Mihaiii/Bulbasaur
Publié par Mihaiii le 27 avril 2024, Mihaiii/Bulbasaur est un modèle d’embedding anglophone de 17 millions de paramètres, tous actifs. Cette distillation de gte-tiny, entraînée sur le jeu qa-assistant, encode chaque phrase sous la forme d’un vecteur dense de 384 dimensions.
Publié par Mihaiii le 27 avril 2024, Mihaiii/Bulbasaur est un modèle d’embedding anglophone de 17 millions de paramètres, tous actifs. Cette distillation de gte-tiny, entraînée sur le jeu qa-assistant, encode chaque phrase sous la forme d’un vecteur dense de 384 dimensions.
Conçu pour l’autocomplétion sémantique, il peut aussi alimenter la recherche sémantique, le RAG, la mesure de similarité et le clustering. Il accepte jusqu’à 512 tokens, puis tronque les textes plus longs. Les vecteurs sont obtenus par mean pooling avec prise en compte du masque d’attention. Sa licence ouverte MIT autorise l’auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mihaiii |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 27 avril 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense (embedding de phrase par mean pooling) |
| Paramètres | 17 millions |
| Paramètres actifs | 17 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 37,3 % | 148ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 31,2 % | 119ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,4 % | 146ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 30,5 % | 114ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 35,8 % | 109ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 43,1 % | 104ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 6,4 % | 170ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 12,2 % | 163ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 42,9 % | 92ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 36,7 % | 69ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,9 % | 96ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 22,8 % | 91ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les meilleurs résultats relatifs de Mihaiii/Bulbasaur apparaissent sur les tracks MTEB European et French, consacrés notamment à la classification, au clustering et au rapprochement de textes. Sa conception issue du jeu qa-assistant correspond également à la recherche de contenus sémantiquement proches et à l’autocomplétion. Avec 17 millions de paramètres et des vecteurs de 384 dimensions, le modèle reste compact, ce qui allège le stockage des index et le calcul de similarité. La licence MIT facilite son déploiement et son adaptation dans une infrastructure auto-hébergée.
Limites et points d’attention. Malgré ses meilleurs scores relatifs sur European et French, ses rangs y restent bas. Les résultats sont encore plus faibles sur BEIR, German, Legal et Indic, ce qui limite son intérêt pour la recherche zero-shot hétérogène, les corpus juridiques et les usages multilingues. Le traitement exclusivement anglophone renforce cette restriction. La limite de 512 tokens impose de segmenter les documents longs ou d’accepter leur troncature. Sorti il y a environ deux ans, âge très long à l’échelle de l’IA, il est probablement dépassé par des modèles plus récents et souvent retiré du catalogue de son éditeur. Usages pertinents : autocomplétion, similarité, clustering et recherche sémantique sur des textes anglais courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).