BAAI: bge-base-en-v1.5

BAAI: bge-base-en-v1.5 est un modèle d’embedding anglophone de 109 millions de paramètres, publié par BAAI sous licence ouverte MIT. Il produit des représentations denses de 768 dimensions et se concentre sur l’anglais ainsi que sur la recherche de passages.

BAAI: bge-base-en-v1.5 est un modèle d’embedding anglophone de 109 millions de paramètres, publié par BAAI sous licence ouverte MIT. Il produit des représentations denses de 768 dimensions et se concentre sur l’anglais ainsi que sur la recherche de passages.

Le modèle transforme les textes en vecteurs utilisables pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Cette version améliore la distribution des scores de similarité et la recherche sans instruction. Pour la recherche de passages, une instruction dédiée peut être ajoutée à la requête, tandis que les passages sont encodés sans instruction.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR53,2 %61ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval33,9 %109ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal32,5 %120ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare43,6 %63ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance54,7 %59ᵉ / 97mteb✅ Mesuré
MTEB: Medical42,9 %56ᵉ / 158mteb✅ Mesuré
MTEB: Legal40,2 %77ᵉ / 157mteb✅ Mesuré
MTEB: European46,9 %79ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French23,4 %116ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,0 %139ᵉ / 209mteb✅ Mesuré
MTEB: Chemical70,5 %19ᵉ / 41mteb✅ Mesuré
MTEB: French49,2 %65ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,005 $

Prix en dollars US par million de tokens.

Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Les résultats MTEB placent le modèle dans la première moitié du track Chemical, ce qui souligne son intérêt pour l’encodage de textes spécialisés en chimie, sur des tâches mêlant notamment classification, clustering et rapprochement de textes. Sur BEIR, il obtient également un positionnement solide en recherche zero-shot à travers des domaines et des tâches de recherche d’information hétérogènes. Ses 109 millions de paramètres et ses vecteurs denses de 768 dimensions offrent un format relativement contenu pour constituer des index sémantiques. La licence MIT facilite l’intégration, la modification et l’auto-hébergement. Son tarif d’entrée économique, 89 % inférieur à la moyenne des modèles similaires, favorise les traitements à grande échelle.

Limites et points d'attention. Le modèle est destiné en priorité à l’anglais. Ses résultats sur MTEB French et European se situent dans la seconde moitié des classements, ce qui réduit son intérêt pour des corpus principalement français ou multilingues européens. Les tracks RTEB Finance et RTEB Healthcare indiquent aussi un positionnement en retrait pour la recherche spécialisée dans les domaines financier et médical. Les vecteurs de 768 dimensions impliquent par ailleurs un index et des calculs de similarité plus lourds que des représentations de dimension inférieure. Usages pertinents : recherche sémantique et RAG en anglais, recherche de passages, clustering de corpus et applications spécialisées en chimie.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).