codefuse-ai/F2LLM-v2-1.7B
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-1.7B est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Généraliste et multilingue, il prend en charge plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles. Sa…
Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-1.7B est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Généraliste et multilingue, il prend en charge plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles. Sa licence ouverte Apache 2.0 permet notamment l’auto-hébergement.
Le modèle transforme les textes en vecteurs de 2 048 dimensions, obtenus depuis l’état caché du dernier jeton EOS puis normalisés en L2. Ces représentations servent à la recherche sémantique, au RAG, au reranking, à la mesure de similarité, au clustering et à l’alignement de textes bilingues. Les requêtes peuvent recevoir des instructions personnalisées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 mars 2026 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 40 960 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 54,1 % | 53ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 71,4 % | 16ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 15,4 % | 14ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 78,5 % | 8ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 78,8 % | 8ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 49,7 % | 41ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 60,3 % | 36ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 68,9 % | 34ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 61,4 % | 17ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 60,3 % | 13ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 66,9 % | 4ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 41,1 % | 70ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. F2LLM-v2-1.7B se place dans le top 10 de tous les tracks MTEB communiqués. Ses résultats soulignent une aptitude marquée à la recherche de code et à la recherche d’informations dans des contenus issus de langages de programmation variés. Le modèle se distingue aussi sur plusieurs ensembles multilingues, notamment en japonais, thaï, langues indiennes et coréen. Cette combinaison convient aux systèmes de recherche couvrant des langues et des domaines hétérogènes. La normalisation L2 facilite l’exploitation des vecteurs pour la similarité, tandis que la licence Apache 2.0 autorise des déploiements auto-hébergés et des adaptations.
Limites et points d’attention. Les vecteurs de 2 048 dimensions exigent davantage de stockage, de mémoire et de calcul lors de l’indexation et de la recherche que des représentations moins dimensionnées. Avec 2 milliards de paramètres actifs, chaque traitement mobilise l’ensemble du modèle, ce qui constitue également un facteur à intégrer dans le dimensionnement de l’infrastructure. Les résultats disponibles mettent surtout en avant la recherche de code et certaines langues asiatiques ou indiennes, sans justifier une généralisation à tous les domaines. Usages pertinents : recherche sémantique multilingue, RAG, recherche de code, reranking, clustering et alignement bilingue.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).