BAAI/bge-m3-unsupervised
Publié par BAAI le 30 janvier 2024, BAAI/bge-m3-unsupervised est un modèle d’embedding dense de 568 millions de paramètres, distribué sous licence ouverte MIT. Il produit des vecteurs de 1024 dimensions et résulte d’un apprentissage contrastif à partir de bge-m3-retromae.
Publié par BAAI le 30 janvier 2024, BAAI/bge-m3-unsupervised est un modèle d’embedding dense de 568 millions de paramètres, distribué sous licence ouverte MIT. Il produit des vecteurs de 1024 dimensions et résulte d’un apprentissage contrastif à partir de bge-m3-retromae.
Sa couverture de plus de 100 langues et sa fenêtre maximale de 8192 tokens permettent d’encoder aussi bien des phrases que des documents longs. Ces représentations servent à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 30 janvier 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 568 millions |
| Paramètres actifs | 568 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 46,3 % | 59ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 46,7 % | 58ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 56,3 % | 55ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 44,1 % | 63ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 60,2 % | 40ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB German
MTEB: RTEB Finance
Notre analyse
Forces. Les résultats MTEB placent surtout le modèle favorablement sur RTEB German, où il figure approximativement dans le premier cinquième du classement pour la recherche couvrant les domaines juridique, médical et commercial. RTEB French et RTEB Legal le situent également dans le premier tiers, ce qui confirme un intérêt pour la récupération multilingue et spécialisée. La séquence de 8192 tokens facilite l’indexation de documents longs sans découpage excessif. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d’attention. Les positions sur RTEB Finance et RTEB Healthcare se trouvent au-delà de la moitié du classement, avec une compétitivité plus limitée pour ces corpus spécialisés. Les vecteurs de 1024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec près de deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de janvier 2024 est probablement dépassé par des embeddings plus récents, tandis que les variantes de cette période sont souvent retirées des catalogues actifs. Usages pertinents : recherche multilingue, RAG sur documents longs, similarité et clustering, notamment en allemand, en français et dans le domaine juridique.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).