BAAI: bge-large-en-v1.5
Publié par BAAI le 18 novembre 2025 sous licence ouverte MIT, BAAI: bge-large-en-v1.5 est un modèle d’embedding anglophone de 335 millions de paramètres. Il produit des représentations denses de 1 024 dimensions et peut être utilisé en inférence comme en fine-tuning.
Publié par BAAI le 18 novembre 2025 sous licence ouverte MIT, BAAI: bge-large-en-v1.5 est un modèle d’embedding anglophone de 335 millions de paramètres. Il produit des représentations denses de 1 024 dimensions et peut être utilisé en inférence comme en fine-tuning.
Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering. Cette version 1.5 améliore la distribution des similarités et la recherche sans instruction. Une instruction de requête optionnelle peut néanmoins orienter la recherche de passages pertinents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 18 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 54,3 % | 49ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 40,1 % | 75ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 13,6 % | 18ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 31,7 % | 128ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 46,1 % | 59ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 58,2 % | 49ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 42,1 % | 59ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,6 % | 83ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 48,5 % | 66ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 26,4 % | 108ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,6 % | 131ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 70,9 % | 15ᵉ / 41 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,01 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB Chemical, où il se situe dans la partie supérieure du classement, ce qui indique une bonne aptitude à représenter des textes du domaine chimique. Ses résultats sur RTEB Finance et BEIR montrent aussi une capacité exploitable pour la recherche d’information financière et le retrieval zero-shot sur des tâches et domaines variés, bien que sans domination des classements. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires. Le tarif d’entrée, 0,01 $ par million de tokens, est annoncé 78 % sous la moyenne des modèles d’embedding similaires.
Limites et points d’attention. Les résultats sur MTEB French et MTEB European restent en milieu de tableau ou en dessous, en cohérence avec un modèle conçu pour l’anglais plutôt que pour un usage multilingue. RTEB Healthcare constitue également un point moins favorable pour la recherche médicale. Les vecteurs denses de 1 024 dimensions alourdissent les index et peuvent accroître le coût de stockage et de recherche à grande échelle. Usages pertinents : recherche sémantique anglophone, RAG, similarité et clustering, notamment sur des corpus chimiques ou généralistes.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).