BAAI/bge-en-icl
BAAI/bge-en-icl est un modèle d’embedding anglophone publié par BAAI le 25 juillet 2024 sous licence ouverte Apache 2.0. Ses 7 milliards de paramètres, tous actifs, produisent des représentations denses de 4 096 dimensions.
BAAI/bge-en-icl est un modèle d’embedding anglophone publié par BAAI le 25 juillet 2024 sous licence ouverte Apache 2.0. Ses 7 milliards de paramètres, tous actifs, produisent des représentations denses de 4 096 dimensions.
Le modèle transforme requêtes et documents en embeddings distincts, dont la similarité peut être calculée par produit matriciel. Il cible notamment la recherche sémantique de passages, la récupération d’informations pour le RAG, la mesure de similarité et le clustering. Il accepte aussi des exemples few-shot intégrés à la requête pour adapter la représentation en contexte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 25 juillet 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 62,2 % | 5ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. BAAI/bge-en-icl se distingue surtout en recherche d’information zero-shot sur des tâches et domaines hétérogènes. Son classement dans le top 10 de BEIR le situe parmi les modèles les plus performants de ce benchmark pour retrouver des passages pertinents sans adaptation préalable. L’apprentissage en contexte constitue un autre atout pratique : des exemples few-shot peuvent être ajoutés à la requête, tout en conservant un fonctionnement sans exemples. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement.
Limites et points d’attention. Le modèle est destiné à l’anglais, ce qui restreint sa pertinence pour les corpus multilingues. Ses vecteurs denses de 4 096 dimensions alourdissent les index et rendent le stockage ainsi que la recherche de similarité plus coûteux que pour des embeddings plus compacts. Avec 7 milliards de paramètres actifs, son exécution demande également davantage de ressources que celle de petits encodeurs. Sorti en juillet 2024, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique anglophone, récupération de passages pour le RAG, similarité et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).