codefuse-ai/F2LLM-v2-160M
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-160M est un modèle d’embedding dense de 159 millions de paramètres, tous actifs. Il transforme les textes en vecteurs de 640 dimensions, extraits de l’état caché du dernier jeton EOS puis normalisés en L2.
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-160M est un modèle d’embedding dense de 159 millions de paramètres, tous actifs. Il transforme les textes en vecteurs de 640 dimensions, extraits de l’état caché du dernier jeton EOS puis normalisés en L2.
Généraliste et multilingue, il prend en charge plus de 200 langues, avec une attention particulière aux langues à ressources moyennes et faibles. Il sert à la recherche sémantique, au RAG, au reranking, au clustering, à la similarité sémantique et au bitext mining. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des services commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 640 |
| Représentation | dense |
| Paramètres | 159 millions |
| Paramètres actifs | 159 millions |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 46,5 % | 121ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 57,6 % | 36ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 10,4 % | 24ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 70,5 % | 22ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 70,4 % | 20ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 38,1 % | 87ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 51,4 % | 51ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 52,9 % | 65ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 52,4 % | 42ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 49,9 % | 43ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 59,1 % | 22ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 32,7 % | 86ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les meilleurs résultats MTEB de F2LLM-v2-160M concernent la recherche d’information dans le code et, plus largement, le retrieval couvrant divers langages de programmation. Le modèle se distingue aussi en thaï, où il figure dans le top 10 du track, ce qui soutient son positionnement multilingue et son intérêt pour des langues moins dotées en ressources. Les instructions personnalisées appliquées aux requêtes permettent d’adapter la représentation au cas d’usage. La sortie de 640 dimensions offre un compromis pratique pour limiter la taille des index vectoriels, tandis que la licence Apache 2.0 facilite le déploiement auto-hébergé.
Limites et points d'attention. Les résultats sont moins favorables sur le track Chemical et en japonais, avec des classements proches du bas des groupes évalués. Le track Spanish se situe également derrière les meilleurs modèles de sa catégorie. Ces écarts indiquent qu’une couverture de plus de 200 langues ne garantit pas une qualité uniforme selon la langue ou le domaine. La normalisation L2 et l’extraction sur le dernier jeton EOS doivent rester cohérentes entre l’indexation et les requêtes. Usages pertinents : recherche sémantique multilingue, RAG, retrieval de code, clustering, STS, reranking et alignement de textes bilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).