BAAI/bge-en-icl

BAAI/bge-en-icl est un modèle d’embedding anglophone publié par BAAI le 25 juillet 2024 sous licence ouverte Apache 2.0. Ses 7 milliards de paramètres, tous actifs, produisent des représentations denses de 4 096 dimensions.

BAAI/bge-en-icl est un modèle d’embedding anglophone publié par BAAI le 25 juillet 2024 sous licence ouverte Apache 2.0. Ses 7 milliards de paramètres, tous actifs, produisent des représentations denses de 4 096 dimensions.

Le modèle transforme requêtes et documents en embeddings distincts, dont la similarité peut être calculée par produit matriciel. Il cible notamment la recherche sémantique de passages, la récupération d’informations pour le RAG, la mesure de similarité et le clustering. Il accepte aussi des exemples few-shot intégrés à la requête pour adapter la représentation en contexte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie25 juillet 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR62,2 %5ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. BAAI/bge-en-icl se distingue surtout en recherche d’information zero-shot sur des tâches et domaines hétérogènes. Son classement dans le top 10 de BEIR le situe parmi les modèles les plus performants de ce benchmark pour retrouver des passages pertinents sans adaptation préalable. L’apprentissage en contexte constitue un autre atout pratique : des exemples few-shot peuvent être ajoutés à la requête, tout en conservant un fonctionnement sans exemples. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement.

Limites et points d’attention. Le modèle est destiné à l’anglais, ce qui restreint sa pertinence pour les corpus multilingues. Ses vecteurs denses de 4 096 dimensions alourdissent les index et rendent le stockage ainsi que la recherche de similarité plus coûteux que pour des embeddings plus compacts. Avec 7 milliards de paramètres actifs, son exécution demande également davantage de ressources que celle de petits encodeurs. Sorti en juillet 2024, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique anglophone, récupération de passages pour le RAG, similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).