codefuse-ai/F2LLM-v2-80M
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-80M est un modèle d’embedding généraliste et multilingue de 80 millions de paramètres, tous actifs. Issu de l’élagage et de l’entraînement d’un modèle de base de 0,6 milliard de paramètres, il prend en charge plus de 200 langues.
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-80M est un modèle d’embedding généraliste et multilingue de 80 millions de paramètres, tous actifs. Issu de l’élagage et de l’entraînement d’un modèle de base de 0,6 milliard de paramètres, il prend en charge plus de 200 langues.
Le modèle produit des représentations denses de 320 dimensions à partir de l’état caché du dernier jeton EOS. Il sert notamment à la recherche sémantique, au RAG, au reranking, à la similarité, à la classification, au clustering et au bitext mining. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 320 |
| Représentation | dense |
| Paramètres | 80 millions |
| Paramètres actifs | 80 millions |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 44,9 % | 128ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 31,7 % | 117ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 8,7 % | 25ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB English | 48,6 % | 1ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: RTEB Code | 54,8 % | 1ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 68,4 % | 26ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 68,0 % | 24ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 30,6 % | 139ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 49,1 % | 52ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 47,6 % | 74ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 50,7 % | 44ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 43,0 % | 59ᵉ / 157 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les meilleurs résultats MTEB de F2LLM-v2-80M concernent la recherche d’information, ce qui correspond directement aux besoins d’indexation sémantique et de récupération de passages pour le RAG. Le modèle affiche aussi un positionnement multilingue concret, avec des évaluations en français, en espagnol et en thaï. Le track French constitue son classement relatif le plus favorable parmi les évaluations fournies. Son format instruct permet d’associer des consignes personnalisées aux requêtes. La dimension compacte de 320 réduit la taille des index vectoriels et les besoins de stockage, tandis que la licence Apache 2.0 facilite le déploiement sur une infrastructure maîtrisée.
Limites et points d'attention. Les résultats MTEB restent en milieu de classement sur plusieurs tracks de recherche et sur les évaluations en espagnol et en thaï. Le track Chemical est le moins favorable, avec un rang proche du bas du classement, ce qui invite à valider le modèle avant un déploiement spécialisé dans ce domaine. La normalisation L2 des vecteurs doit être appliquée de manière cohérente lors de l’indexation et des requêtes. Usages pertinents : recherche sémantique multilingue, récupération de passages pour le RAG, déduplication, rapprochement de textes, classification et clustering avec des index compacts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).