codefuse-ai/F2LLM-v2-0.6B

Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-0.6B est un modèle d'embedding dense multilingue de 596 millions de paramètres, distribué sous licence ouverte Apache 2.0. Il couvre plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles.

Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-0.6B est un modèle d'embedding dense multilingue de 596 millions de paramètres, distribué sous licence ouverte Apache 2.0. Il couvre plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles.

Le modèle transforme chaque texte en un vecteur de 1 024 dimensions, extrait du dernier jeton EOS puis normalisé en norme L2. Ces représentations servent à la recherche sémantique, au RAG, au reranking, à la mesure de similarité, au clustering et au bitext mining. Les requêtes peuvent recevoir des instructions personnalisées.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcodefuse-ai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie9 mars 2026
Dimension du vecteur1 024
Représentationdense
Paramètres596 millions
Paramètres actifs596 millions
Longueur de séquence max40 960 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,4 %86ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval70,8 %18ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval13,3 %20ᵉ / 29mteb✅ Mesuré
MTEB: Code Information Retrieval77,7 %11ᵉ / 49mteb✅ Mesuré
MTEB: Code77,4 %11ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal47,6 %47ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare57,7 %41ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance63,1 %43ᵉ / 97mteb✅ Mesuré
MTEB: Medical57,9 %27ᵉ / 158mteb✅ Mesuré
MTEB: Legal57,9 %17ᵉ / 157mteb✅ Mesuré
MTEB: European64,5 %5ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French37,6 %77ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. F2LLM-v2-0.6B se distingue sur plusieurs volets multilingues de MTEB, avec des classements dans le top 10 pour le japonais, le thaï et le coréen. Ses résultats en Code Information Retrieval et en Code montrent également une aptitude marquée à retrouver des contenus pertinents dans diverses langues de programmation et catégories de tâches. Son classement sur Long-context Retrieval indique une bonne capacité à représenter des contenus étendus pour la recherche. La licence Apache 2.0 facilite l'intégration, la modification et l'auto-hébergement dans des systèmes de recherche ou de RAG.

Limites et points d'attention. Les tracks consacrés au code restent légèrement moins bien classés que ses meilleurs résultats linguistiques, tandis que Long-context Retrieval affiche un rang plus éloigné du sommet malgré une position solide parmi de nombreux modèles. Chaque élément indexé occupe 1 024 valeurs numériques, ce qui pèse sur le stockage et le coût des comparaisons lorsque le corpus grandit. Les 596 millions de paramètres impliquent aussi une infrastructure d'inférence adaptée au volume traité. Usages pertinents : recherche sémantique multilingue, RAG, recherche de code, rapprochement de textes bilingues, similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).