BAAI/bge-large-en
BAAI/bge-large-en est un modèle d’embedding anglophone publié par BAAI le 5 août 2023 sous licence ouverte MIT. Ses 335 millions de paramètres produisent des représentations denses de 1 024 dimensions. Conçu pour l’anglais, il transforme les textes en vecteurs numériques plutôt que de…
BAAI/bge-large-en est un modèle d’embedding anglophone publié par BAAI le 5 août 2023 sous licence ouverte MIT. Ses 335 millions de paramètres produisent des représentations denses de 1 024 dimensions. Conçu pour l’anglais, il transforme les textes en vecteurs numériques plutôt que de générer du contenu.
Le modèle sert à la recherche sémantique, à la recherche de passages, au RAG, à la classification, au clustering et à l’alimentation de bases vectorielles. Pour la recherche de passages, les requêtes courtes gagnent à recevoir le préfixe « Represent this sentence for searching relevant passages: », tandis que les passages restent sans instruction.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 5 août 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 53,9 % | 55ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 32,0 % | 125ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 45,8 % | 60ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 57,1 % | 54ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 27,9 % | 99ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 18,8 % | 123ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 68,7 % | 30ᵉ / 41 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Chemical
Notre analyse
Forces. Les résultats MTEB placent le modèle dans la partie supérieure du classement BEIR, ce qui indique une aptitude solide à la recherche zero-shot sur des tâches et domaines hétérogènes. Le track Chemical constitue son résultat spécialisé le plus élevé, même si son rang y reste intermédiaire. RTEB Finance montre également un niveau médian exploitable pour la recherche financière. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. L’apprentissage contrastif avec une température de 0,01 vise à rapprocher les textes sémantiquement associés, et les similarités sont surtout pertinentes pour ordonner les résultats.
Limites et points d’attention. Les performances sont moins convaincantes sur RTEB Healthcare, faibles sur RTEB Legal et particulièrement en retrait sur RTEB French. Son orientation anglophone limite donc son intérêt pour les corpus français et les usages multilingues. Les vecteurs denses de 1 024 dimensions alourdissent davantage les index, le stockage et les calculs de recherche que des représentations plus petites. Avec environ trois ans d’ancienneté, il appartient à une génération désormais ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche sémantique et RAG en anglais, notamment sur des corpus généraux, chimiques ou financiers, ainsi que clustering et classification par similarité.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).