codefuse-ai/F2LLM-v2-4B
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-4B est un modèle d’embedding dense de 4 milliards de paramètres, tous actifs. Il convertit les textes en vecteurs de 2 560 dimensions, calculés à partir de l’état caché du dernier jeton EOS puis normalisés en L2.
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-4B est un modèle d’embedding dense de 4 milliards de paramètres, tous actifs. Il convertit les textes en vecteurs de 2 560 dimensions, calculés à partir de l’état caché du dernier jeton EOS puis normalisés en L2.
Généraliste et multilingue, il prend en charge plus de 200 langues, avec une attention particulière aux langues à ressources moyennes et faibles. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement. Il cible notamment la recherche sémantique, le RAG, le reranking, la similarité textuelle, le clustering et le bitext mining.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 2 560 |
| Représentation | dense |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 56,9 % | 26ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 75,4 % | 8ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 16,4 % | 12ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 79,6 % | 5ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 80,2 % | 6ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 52,7 % | 35ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 65,5 % | 17ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 73,9 % | 24ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 64,5 % | 5ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 61,5 % | 10ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 68,6 % | 3ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 50,3 % | 43ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB placent F2LLM-v2-4B parmi les meilleurs modèles évalués en recherche et en recherche d’information dans diverses langues de programmation. Ses performances ressortent aussi sur les textes japonais, thaïs et en langues indiciennes, ce qui conforte son positionnement multilingue. Le modèle figure également parmi les mieux classés sur les contenus du domaine chimique, pour des tâches comprenant notamment la classification, le clustering et le bitext mining. Les instructions personnalisées appliquées aux requêtes permettent d’adapter les embeddings au scénario de recherche. La licence Apache 2.0 facilite enfin le déploiement et l’exploitation dans une infrastructure maîtrisée.
Limites et points d'attention. La représentation de 2 560 dimensions implique des index plus volumineux et des calculs de similarité plus coûteux que ceux de modèles produisant des vecteurs plus compacts. Les 4 milliards de paramètres actifs constituent également un facteur à intégrer au dimensionnement de l’infrastructure d’inférence. Les usages pertinents couvrent la recherche sémantique multilingue, la récupération de passages pour le RAG, le reranking, le rapprochement de textes parallèles et le regroupement de corpus, notamment dans des environnements mêlant langues peu dotées, contenus techniques et textes chimiques.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).