BAAI: bge-large-en-v1.5

Publié par BAAI le 18 novembre 2025 sous licence ouverte MIT, BAAI: bge-large-en-v1.5 est un modèle d’embedding anglophone de 335 millions de paramètres. Il produit des représentations denses de 1 024 dimensions et peut être utilisé en inférence comme en fine-tuning.

Publié par BAAI le 18 novembre 2025 sous licence ouverte MIT, BAAI: bge-large-en-v1.5 est un modèle d’embedding anglophone de 335 millions de paramètres. Il produit des représentations denses de 1 024 dimensions et peut être utilisé en inférence comme en fine-tuning.

Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering. Cette version 1.5 améliore la distribution des similarités et la recherche sans instruction. Une instruction de requête optionnelle peut néanmoins orienter la recherche de passages pertinents.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur1 024
Représentationdense
Paramètres335 millions
Paramètres actifs335 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR54,3 %49ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval40,1 %75ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval13,6 %18ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal31,7 %128ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare46,1 %59ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance58,2 %49ᵉ / 97mteb✅ Mesuré
MTEB: Medical42,1 %59ᵉ / 158mteb✅ Mesuré
MTEB: Legal39,6 %83ᵉ / 157mteb✅ Mesuré
MTEB: European48,5 %66ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French26,4 %108ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,6 %131ᵉ / 209mteb✅ Mesuré
MTEB: Chemical70,9 %15ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

WhereIsAI/UAE-Large-V155 %
▶ bge-large-en-v1.554 %
manveertamber/cadet-emb…54 %

MTEB: Long-context Retrieval

WhereIsAI/UAE-Large-V140 %
▶ bge-large-en-v1.540 %

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,01 $

Prix en dollars US par million de tokens.

Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB Chemical, où il se situe dans la partie supérieure du classement, ce qui indique une bonne aptitude à représenter des textes du domaine chimique. Ses résultats sur RTEB Finance et BEIR montrent aussi une capacité exploitable pour la recherche d’information financière et le retrieval zero-shot sur des tâches et domaines variés, bien que sans domination des classements. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires. Le tarif d’entrée, 0,01 $ par million de tokens, est annoncé 78 % sous la moyenne des modèles d’embedding similaires.

Limites et points d’attention. Les résultats sur MTEB French et MTEB European restent en milieu de tableau ou en dessous, en cohérence avec un modèle conçu pour l’anglais plutôt que pour un usage multilingue. RTEB Healthcare constitue également un point moins favorable pour la recherche médicale. Les vecteurs denses de 1 024 dimensions alourdissent les index et peuvent accroître le coût de stockage et de recherche à grande échelle. Usages pertinents : recherche sémantique anglophone, RAG, similarité et clustering, notamment sur des corpus chimiques ou généralistes.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).