codefuse-ai/F2LLM-v2-330M
Publié le 9 mars 2026 par codefuse-ai, codefuse-ai/F2LLM-v2-330M est un modèle d’embedding généraliste et multilingue de 334 millions de paramètres. Il produit des représentations denses de 896 dimensions et couvre plus de 200 langues, avec un accent sur celles disposant de ressources…
Publié le 9 mars 2026 par codefuse-ai, codefuse-ai/F2LLM-v2-330M est un modèle d’embedding généraliste et multilingue de 334 millions de paramètres. Il produit des représentations denses de 896 dimensions et couvre plus de 200 langues, avec un accent sur celles disposant de ressources moyennes ou faibles.
Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes de recherche sémantique, de RAG, de similarité textuelle ou de clustering. L’encodage séparé des requêtes et des documents, ainsi que les instructions personnalisées appliquées aux requêtes, facilitent son adaptation aux moteurs de recherche.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 896 |
| Représentation | dense |
| Paramètres | 334 millions |
| Paramètres actifs | 334 millions |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 49,9 % | 103ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 66,3 % | 23ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 11,6 % | 22ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 76,1 % | 13ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 75,7 % | 14ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 45,5 % | 62ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 55,3 % | 47ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 60,7 % | 46ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 56,4 % | 33ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 56,7 % | 20ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 62,0 % | 13ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 35,0 % | 80ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les meilleurs résultats MTEB concernent la recherche d’information et la recherche de code dans plusieurs langages de programmation, ce qui indique une bonne aptitude à rapprocher une requête de passages ou de documents pertinents. Le modèle se distingue aussi sur les textes thaïs et japonais, où il figure dans le top 10, tandis que son rang en coréen reste favorable sur un ensemble de modèles plus large. Son entraînement familial sur un corpus composite de 60 millions de données publiques soutient cette orientation multilingue. Les vecteurs sont construits à partir de l’état caché du dernier jeton EOS, puis normalisés en L2 dans l’usage avec Transformers, une propriété adaptée aux calculs de similarité. La licence Apache 2.0 constitue un atout pour l’auto-hébergement et l’intégration dans des produits.
Limites et points d'attention. Les performances sont moins dominantes sur le track Chemical, où le classement se situe davantage dans le milieu du groupe évalué. Les positions obtenues sur les tracks de code restent solides sans placer le modèle parmi les tout premiers, et les résultats multilingues varient selon la langue, le japonais étant moins nettement classé que le thaï. La dimension de 896 implique aussi un index plus volumineux et davantage de calcul par comparaison qu’avec des embeddings de dimension inférieure. Usages pertinents : recherche sémantique multilingue, RAG, recherche de code, similarité textuelle, clustering, reranking et bitext mining.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).