BAAI: bge-base-en-v1.5
BAAI: bge-base-en-v1.5 est un modèle d’embedding anglophone de 109 millions de paramètres, publié par BAAI sous licence ouverte MIT. Il produit des représentations denses de 768 dimensions et se concentre sur l’anglais ainsi que sur la recherche de passages.
BAAI: bge-base-en-v1.5 est un modèle d’embedding anglophone de 109 millions de paramètres, publié par BAAI sous licence ouverte MIT. Il produit des représentations denses de 768 dimensions et se concentre sur l’anglais ainsi que sur la recherche de passages.
Le modèle transforme les textes en vecteurs utilisables pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Cette version améliore la distribution des scores de similarité et la recherche sans instruction. Pour la recherche de passages, une instruction dédiée peut être ajoutée à la requête, tandis que les passages sont encodés sans instruction.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 18 novembre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 53,2 % | 61ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 33,9 % | 109ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 32,5 % | 120ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 43,6 % | 63ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 54,7 % | 59ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 42,9 % | 56ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 40,2 % | 77ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,9 % | 79ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 23,4 % | 116ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,0 % | 139ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 70,5 % | 19ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 49,2 % | 65ᵉ / 117 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,005 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Les résultats MTEB placent le modèle dans la première moitié du track Chemical, ce qui souligne son intérêt pour l’encodage de textes spécialisés en chimie, sur des tâches mêlant notamment classification, clustering et rapprochement de textes. Sur BEIR, il obtient également un positionnement solide en recherche zero-shot à travers des domaines et des tâches de recherche d’information hétérogènes. Ses 109 millions de paramètres et ses vecteurs denses de 768 dimensions offrent un format relativement contenu pour constituer des index sémantiques. La licence MIT facilite l’intégration, la modification et l’auto-hébergement. Son tarif d’entrée économique, 89 % inférieur à la moyenne des modèles similaires, favorise les traitements à grande échelle.
Limites et points d'attention. Le modèle est destiné en priorité à l’anglais. Ses résultats sur MTEB French et European se situent dans la seconde moitié des classements, ce qui réduit son intérêt pour des corpus principalement français ou multilingues européens. Les tracks RTEB Finance et RTEB Healthcare indiquent aussi un positionnement en retrait pour la recherche spécialisée dans les domaines financier et médical. Les vecteurs de 768 dimensions impliquent par ailleurs un index et des calculs de similarité plus lourds que des représentations de dimension inférieure. Usages pertinents : recherche sémantique et RAG en anglais, recherche de passages, clustering de corpus et applications spécialisées en chimie.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).