BAAI/bge-multilingual-gemma2
Publié par BAAI le 25 juillet 2024, BAAI/bge-multilingual-gemma2 est un modèle d’embedding dense de 9 milliards de paramètres, tous actifs, dérivé de google/gemma-2-9b. Il produit des vecteurs de 3 584 dimensions et relève d’une licence spécifique Gemma, distincte d’une licence open…
Publié par BAAI le 25 juillet 2024, BAAI/bge-multilingual-gemma2 est un modèle d’embedding dense de 9 milliards de paramètres, tous actifs, dérivé de google/gemma-2-9b. Il produit des vecteurs de 3 584 dimensions et relève d’une licence spécifique Gemma, distincte d’une licence open source standard.
Son entraînement couvre notamment l’anglais, le chinois, le japonais, le coréen et le français, ainsi que la recherche, la classification et le clustering. Il sert à indexer des contenus pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le regroupement de documents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | https://ai.google.dev/gemma/terms |
| Date de sortie | 25 juillet 2024 |
| Dimension du vecteur | 3 584 |
| Représentation | dense |
| Paramètres | 9 milliards |
| Paramètres actifs | 9 milliards |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 59,2 % | 14ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: French | 70,4 % | 4ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Chinese | 67,6 % | 28ᵉ / 58 | mteb | ✅ Mesuré |
| MTEB: Vietnamese | 43,5 % | 20ᵉ / 27 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: French
Notre analyse
Forces. Le modèle se distingue particulièrement en français, où MTEB le classe dans le top 10 pour un ensemble mêlant classification, clustering et comparaison de paires. Ses résultats sur BEIR indiquent aussi une bonne aptitude à la recherche zero-shot dans des tâches et domaines hétérogènes. Son caractère multilingue facilite la création d’index couvrant plusieurs langues avec un même espace vectoriel. L’intégration est prévue avec FlagEmbedding, Sentence Transformers et HuggingFace Transformers. Pour la recherche, les requêtes reçoivent une instruction, tandis que les documents sont encodés sans instruction.
Limites et points d’attention. Les performances sont moins convaincantes en chinois, où le modèle se situe autour du milieu du classement MTEB, et surtout en vietnamien, où il figure dans la partie basse. Ses 9 milliards de paramètres rendent l’inférence plus exigeante que celle de modèles d’embedding plus petits. Les vecteurs de 3 584 dimensions alourdissent également le stockage des index et le coût de la recherche. Sorti en 2024, il est désormais ancien à l’échelle rapide de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche multilingue, RAG en français et indexation documentaire hétérogène.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).