codefuse-ai/F2LLM-v2-14B
Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-14B est un modèle d’embedding dense de 14 milliards de paramètres, tous actifs. Il produit des vecteurs de 5 120 dimensions et appartient à une famille multilingue couvrant plus de 200 langues, avec un accent sur les langues disposant de…
Publié par codefuse-ai le 9 mars 2026, F2LLM-v2-14B est un modèle d’embedding dense de 14 milliards de paramètres, tous actifs. Il produit des vecteurs de 5 120 dimensions et appartient à une famille multilingue couvrant plus de 200 langues, avec un accent sur les langues disposant de ressources moyennes ou faibles. Il est distribué sous licence ouverte Apache 2.0.
Le modèle transforme requêtes et documents en représentations numériques pour la recherche sémantique, la recherche d’information, le RAG, la similarité sémantique et le clustering. Il prend aussi en charge la classification, le reranking et le bitext mining, avec des instructions personnalisées et une intégration à Sentence Transformers ou Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 5 120 |
| Représentation | dense |
| Paramètres | 14 milliards |
| Paramètres actifs | 14 milliards |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 58,3 % | 21ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 75,6 % | 7ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 19,7 % | 5ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 79,9 % | 1ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 80,8 % | 1ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 56,1 % | 26ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 67,3 % | 10ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 76,0 % | 20ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 65,2 % | 2ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 64,7 % | 4ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 69,9 % | 1ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 53,4 % | 30ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB placent F2LLM-v2-14B parmi les modèles les plus performants en recherche de code et en recherche d’information appliquée à plusieurs langages de programmation. Le modèle se distingue également sur les textes japonais, thaïs et en langues indiennes, ce qui confirme son orientation multilingue. Ses performances dans le domaine chimique élargissent son intérêt aux corpus scientifiques spécialisés. L’entraînement repose sur 60 millions de données publiques de haute qualité. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux, tandis que l’encodage séparé des requêtes et des documents convient à la constitution d’index persistants.
Limites et points d’attention. Avec 14 milliards de paramètres actifs, le déploiement demande davantage de ressources qu’un petit modèle d’embedding. Les vecteurs denses de 5 120 dimensions alourdissent aussi le stockage des index et le coût de la recherche de similarité à grande échelle. Le domaine chimique reste très bien classé dans MTEB, mais légèrement derrière les positions obtenues sur les tracks de recherche et plusieurs tracks linguistiques. Usages pertinents : recherche sémantique multilingue, RAG, retrieval de code, clustering, classification, similarité sémantique et alignement de textes bilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).