codefuse-ai/F2LLM-v2-8B
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-8B est un modèle d'embedding dense de 8 milliards de paramètres, tous actifs. Il convertit les textes en vecteurs de 4 096 dimensions, obtenus à partir du dernier jeton EOS puis normalisés en L2.
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-8B est un modèle d'embedding dense de 8 milliards de paramètres, tous actifs. Il convertit les textes en vecteurs de 4 096 dimensions, obtenus à partir du dernier jeton EOS puis normalisés en L2.
Ce modèle généraliste couvre plus de 200 langues, avec une attention particulière aux langues à ressources moyennes et faibles. Distribué sous licence ouverte Apache 2.0, il cible la recherche sémantique, le RAG, le reranking, la similarité, le clustering et le bitext mining. Des instructions personnalisées peuvent orienter l'encodage des requêtes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 57,5 % | 23ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 76,6 % | 5ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 17,7 % | 8ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 79,6 % | 4ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 80,2 % | 5ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 54,6 % | 28ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 66,7 % | 15ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 74,8 % | 23ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 64,9 % | 4ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 63,5 % | 7ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 69,2 % | 2ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 52,5 % | 36ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB placent F2LLM-v2-8B parmi les meilleurs modèles évalués pour la recherche de code et la recherche d'informations dans des contenus de programmation variés. Il se distingue également dans le domaine chimique, où il occupe la première place du track concerné. Ses classements en japonais, dans les langues indiciennes et en thaï confirment une forte aptitude multilingue sur des tâches mêlant recherche, classification, clustering, similarité sémantique et bitext mining. La licence Apache 2.0 facilite l'intégration, la modification et les usages commerciaux.
Limites et points d'attention. Les performances en langues indiciennes et en thaï sont légèrement inférieures à celles observées sur la recherche de code, même si elles restent dans le groupe de tête de MTEB. Les vecteurs de 4 096 dimensions alourdissent les index et augmentent les besoins de stockage, de mémoire et de calcul lors des recherches à grande échelle. Les 8 milliards de paramètres actifs impliquent aussi un déploiement plus exigeant qu'avec un encodeur plus compact. Usages pertinents : recherche sémantique multilingue, RAG, recherche de code, corpus chimiques, clustering et alignement de textes bilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).