codefuse-ai/F2LLM-v2-0.6B
Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-0.6B est un modèle d'embedding dense multilingue de 596 millions de paramètres, distribué sous licence ouverte Apache 2.0. Il couvre plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles.
Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-0.6B est un modèle d'embedding dense multilingue de 596 millions de paramètres, distribué sous licence ouverte Apache 2.0. Il couvre plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles.
Le modèle transforme chaque texte en un vecteur de 1 024 dimensions, extrait du dernier jeton EOS puis normalisé en norme L2. Ces représentations servent à la recherche sémantique, au RAG, au reranking, à la mesure de similarité, au clustering et au bitext mining. Les requêtes peuvent recevoir des instructions personnalisées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,4 % | 86ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 70,8 % | 18ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 13,3 % | 20ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 77,7 % | 11ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 77,4 % | 11ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 47,6 % | 47ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 57,7 % | 41ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 63,1 % | 43ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 57,9 % | 27ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 57,9 % | 17ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 64,5 % | 5ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 37,6 % | 77ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. F2LLM-v2-0.6B se distingue sur plusieurs volets multilingues de MTEB, avec des classements dans le top 10 pour le japonais, le thaï et le coréen. Ses résultats en Code Information Retrieval et en Code montrent également une aptitude marquée à retrouver des contenus pertinents dans diverses langues de programmation et catégories de tâches. Son classement sur Long-context Retrieval indique une bonne capacité à représenter des contenus étendus pour la recherche. La licence Apache 2.0 facilite l'intégration, la modification et l'auto-hébergement dans des systèmes de recherche ou de RAG.
Limites et points d'attention. Les tracks consacrés au code restent légèrement moins bien classés que ses meilleurs résultats linguistiques, tandis que Long-context Retrieval affiche un rang plus éloigné du sommet malgré une position solide parmi de nombreux modèles. Chaque élément indexé occupe 1 024 valeurs numériques, ce qui pèse sur le stockage et le coût des comparaisons lorsque le corpus grandit. Les 596 millions de paramètres impliquent aussi une infrastructure d'inférence adaptée au volume traité. Usages pertinents : recherche sémantique multilingue, RAG, recherche de code, rapprochement de textes bilingues, similarité et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).