codefuse-ai/F2LLM-v2-14B

Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-14B est un modèle d’embedding dense de 14 milliards de paramètres, tous actifs. Il produit des vecteurs de 5 120 dimensions et appartient à une famille multilingue couvrant plus de 200 langues, avec un accent sur les langues disposant de…

Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-14B est un modèle d’embedding dense de 14 milliards de paramètres, tous actifs. Il produit des vecteurs de 5 120 dimensions et appartient à une famille multilingue couvrant plus de 200 langues, avec un accent sur les langues disposant de ressources moyennes ou faibles. Il est distribué sous licence ouverte Apache 2.0.

Le modèle transforme requêtes et documents en représentations numériques pour la recherche sémantique, la recherche d’information, le RAG, la similarité sémantique et le clustering. Il prend aussi en charge la classification, le reranking et le bitext mining, avec des instructions personnalisées et une intégration à Sentence Transformers ou Transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcodefuse-ai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie9 mars 2026
Dimension du vecteur5 120
Représentationdense
Paramètres14 milliards
Paramètres actifs14 milliards
Longueur de séquence max40 960 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR58,3 %21ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval75,6 %7ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval19,7 %5ᵉ / 29mteb✅ Mesuré
MTEB: Code Information Retrieval79,9 %1ᵉ / 49mteb✅ Mesuré
MTEB: Code80,8 %1ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal56,1 %26ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare67,3 %10ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance76,0 %20ᵉ / 97mteb✅ Mesuré
MTEB: Medical65,2 %2ᵉ / 158mteb✅ Mesuré
MTEB: Legal64,7 %4ᵉ / 157mteb✅ Mesuré
MTEB: European69,9 %1ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French53,4 %30ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent F2LLM-v2-14B parmi les modèles les plus performants en recherche de code et en recherche d’information appliquée à plusieurs langages de programmation. Le modèle se distingue également sur les textes japonais, thaïs et en langues indiennes, ce qui confirme son orientation multilingue. Ses performances dans le domaine chimique élargissent son intérêt aux corpus scientifiques spécialisés. L’entraînement repose sur 60 millions de données publiques de haute qualité. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux, tandis que l’encodage séparé des requêtes et des documents convient à la constitution d’index persistants.

Limites et points d’attention. Avec 14 milliards de paramètres actifs, le déploiement demande davantage de ressources qu’un petit modèle d’embedding. Les vecteurs denses de 5 120 dimensions alourdissent aussi le stockage des index et le coût de la recherche de similarité à grande échelle. Le domaine chimique reste très bien classé dans MTEB, mais légèrement derrière les positions obtenues sur les tracks de recherche et plusieurs tracks linguistiques. Usages pertinents : recherche sémantique multilingue, RAG, retrieval de code, clustering, classification, similarité sémantique et alignement de textes bilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).