codefuse-ai/F2LLM-v2-8B

Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-8B est un modèle d'embedding dense de 8 milliards de paramètres, tous actifs. Il convertit les textes en vecteurs de 4 096 dimensions, obtenus à partir du dernier jeton EOS puis normalisés en L2.

Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-8B est un modèle d'embedding dense de 8 milliards de paramètres, tous actifs. Il convertit les textes en vecteurs de 4 096 dimensions, obtenus à partir du dernier jeton EOS puis normalisés en L2.

Ce modèle généraliste couvre plus de 200 langues, avec une attention particulière aux langues à ressources moyennes et faibles. Distribué sous licence ouverte Apache 2.0, il cible la recherche sémantique, le RAG, le reranking, la similarité, le clustering et le bitext mining. Des instructions personnalisées peuvent orienter l'encodage des requêtes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcodefuse-ai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie9 mars 2026
Dimension du vecteur4 096
Représentationdense
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max40 960 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR57,5 %23ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval76,6 %5ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval17,7 %8ᵉ / 29mteb✅ Mesuré
MTEB: Code Information Retrieval79,6 %4ᵉ / 49mteb✅ Mesuré
MTEB: Code80,2 %5ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal54,6 %28ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare66,7 %15ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance74,8 %23ᵉ / 97mteb✅ Mesuré
MTEB: Medical64,9 %4ᵉ / 158mteb✅ Mesuré
MTEB: Legal63,5 %7ᵉ / 157mteb✅ Mesuré
MTEB: European69,2 %2ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French52,5 %36ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ codefuse-ai/F2LLM-v2-8B57 %

MTEB: Long-context Retrieval

▶ codefuse-ai/F2LLM-v2-8B77 %

Notre analyse

Forces. Les résultats MTEB placent F2LLM-v2-8B parmi les meilleurs modèles évalués pour la recherche de code et la recherche d'informations dans des contenus de programmation variés. Il se distingue également dans le domaine chimique, où il occupe la première place du track concerné. Ses classements en japonais, dans les langues indiciennes et en thaï confirment une forte aptitude multilingue sur des tâches mêlant recherche, classification, clustering, similarité sémantique et bitext mining. La licence Apache 2.0 facilite l'intégration, la modification et les usages commerciaux.

Limites et points d'attention. Les performances en langues indiciennes et en thaï sont légèrement inférieures à celles observées sur la recherche de code, même si elles restent dans le groupe de tête de MTEB. Les vecteurs de 4 096 dimensions alourdissent les index et augmentent les besoins de stockage, de mémoire et de calcul lors des recherches à grande échelle. Les 8 milliards de paramètres actifs impliquent aussi un déploiement plus exigeant qu'avec un encodeur plus compact. Usages pertinents : recherche sémantique multilingue, RAG, recherche de code, corpus chimiques, clustering et alignement de textes bilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).