Mihaiii/Bulbasaur

Publié par Mihaiii le 27 avril 2024, Mihaiii/Bulbasaur est un modèle d’embedding anglophone de 17 millions de paramètres, tous actifs. Cette distillation de gte-tiny, entraînée sur le jeu qa-assistant, encode chaque phrase sous la forme d’un vecteur dense de 384 dimensions.

Publié par Mihaiii le 27 avril 2024, Mihaiii/Bulbasaur est un modèle d’embedding anglophone de 17 millions de paramètres, tous actifs. Cette distillation de gte-tiny, entraînée sur le jeu qa-assistant, encode chaque phrase sous la forme d’un vecteur dense de 384 dimensions.

Conçu pour l’autocomplétion sémantique, il peut aussi alimenter la recherche sémantique, le RAG, la mesure de similarité et le clustering. Il accepte jusqu’à 512 tokens, puis tronque les textes plus longs. Les vecteurs sont obtenus par mean pooling avec prise en compte du masque d’attention. Sa licence ouverte MIT autorise l’auto-hébergement.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMihaiii
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie27 avril 2024
Dimension du vecteur384
Représentationdense (embedding de phrase par mean pooling)
Paramètres17 millions
Paramètres actifs17 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR37,3 %148ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval31,2 %119ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal29,4 %146ᵉ / 208mteb✅ Mesuré
MTEB: Medical30,5 %114ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,8 %109ᵉ / 157mteb✅ Mesuré
MTEB: European43,1 %104ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French6,4 %170ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German12,2 %163ᵉ / 209mteb✅ Mesuré
MTEB: French42,9 %92ᵉ / 117mteb✅ Mesuré
MTEB: German36,7 %69ᵉ / 96mteb✅ Mesuré
MTEB: Indic31,9 %96ᵉ / 119mteb✅ Mesuré
MTEB: Russian22,8 %91ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

deepfile/embedder-100p39 %
▶ Mihaiii/Bulbasaur37 %
Hum-Works/lodestone-bas…37 %

MTEB: Long-context Retrieval

▶ Mihaiii/Bulbasaur31 %

Notre analyse

Forces. Les meilleurs résultats relatifs de Mihaiii/Bulbasaur apparaissent sur les tracks MTEB European et French, consacrés notamment à la classification, au clustering et au rapprochement de textes. Sa conception issue du jeu qa-assistant correspond également à la recherche de contenus sémantiquement proches et à l’autocomplétion. Avec 17 millions de paramètres et des vecteurs de 384 dimensions, le modèle reste compact, ce qui allège le stockage des index et le calcul de similarité. La licence MIT facilite son déploiement et son adaptation dans une infrastructure auto-hébergée.

Limites et points d’attention. Malgré ses meilleurs scores relatifs sur European et French, ses rangs y restent bas. Les résultats sont encore plus faibles sur BEIR, German, Legal et Indic, ce qui limite son intérêt pour la recherche zero-shot hétérogène, les corpus juridiques et les usages multilingues. Le traitement exclusivement anglophone renforce cette restriction. La limite de 512 tokens impose de segmenter les documents longs ou d’accepter leur troncature. Sorti il y a environ deux ans, âge très long à l’échelle de l’IA, il est probablement dépassé par des modèles plus récents et souvent retiré du catalogue de son éditeur. Usages pertinents : autocomplétion, similarité, clustering et recherche sémantique sur des textes anglais courts.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).