codefuse-ai/F2LLM-v2-1.7B

Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-1.7B est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Généraliste et multilingue, il prend en charge plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles. Sa…

Publié le 9 mars 2026 par codefuse-ai, F2LLM-v2-1.7B est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Généraliste et multilingue, il prend en charge plus de 200 langues, avec une attention particulière aux langues disposant de ressources moyennes ou faibles. Sa licence ouverte Apache 2.0 permet notamment l’auto-hébergement.

Le modèle transforme les textes en vecteurs de 2 048 dimensions, obtenus depuis l’état caché du dernier jeton EOS puis normalisés en L2. Ces représentations servent à la recherche sémantique, au RAG, au reranking, à la mesure de similarité, au clustering et à l’alignement de textes bilingues. Les requêtes peuvent recevoir des instructions personnalisées.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcodefuse-ai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie9 mars 2026
Dimension du vecteur2 048
Représentationdense
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max40 960 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR54,1 %53ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval71,4 %16ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval15,4 %14ᵉ / 29mteb✅ Mesuré
MTEB: Code Information Retrieval78,5 %8ᵉ / 49mteb✅ Mesuré
MTEB: Code78,8 %8ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal49,7 %41ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare60,3 %36ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance68,9 %34ᵉ / 97mteb✅ Mesuré
MTEB: Medical61,4 %17ᵉ / 158mteb✅ Mesuré
MTEB: Legal60,3 %13ᵉ / 157mteb✅ Mesuré
MTEB: European66,9 %4ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French41,1 %70ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

jxm/cde-small-v254 %
▶ codefuse-ai/F2LLM-v2-1.…54 %
MongoDB/mdbr-leaf-ir54 %

MTEB: Long-context Retrieval

▶ codefuse-ai/F2LLM-v2-1.…71 %

Notre analyse

Forces. F2LLM-v2-1.7B se place dans le top 10 de tous les tracks MTEB communiqués. Ses résultats soulignent une aptitude marquée à la recherche de code et à la recherche d’informations dans des contenus issus de langages de programmation variés. Le modèle se distingue aussi sur plusieurs ensembles multilingues, notamment en japonais, thaï, langues indiennes et coréen. Cette combinaison convient aux systèmes de recherche couvrant des langues et des domaines hétérogènes. La normalisation L2 facilite l’exploitation des vecteurs pour la similarité, tandis que la licence Apache 2.0 autorise des déploiements auto-hébergés et des adaptations.

Limites et points d’attention. Les vecteurs de 2 048 dimensions exigent davantage de stockage, de mémoire et de calcul lors de l’indexation et de la recherche que des représentations moins dimensionnées. Avec 2 milliards de paramètres actifs, chaque traitement mobilise l’ensemble du modèle, ce qui constitue également un facteur à intégrer dans le dimensionnement de l’infrastructure. Les résultats disponibles mettent surtout en avant la recherche de code et certaines langues asiatiques ou indiennes, sans justifier une généralisation à tous les domaines. Usages pertinents : recherche sémantique multilingue, RAG, recherche de code, reranking, clustering et alignement bilingue.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).