Mihaiii/Venusaur
Mihaiii/Venusaur est un modèle d’embedding dense de 16 millions de paramètres, publié par Mihaiii le 29 avril 2024 sous licence ouverte MIT. Il transforme exclusivement des textes anglais en vecteurs de 384 dimensions et accepte des séquences allant jusqu’à 512 tokens.
Mihaiii/Venusaur est un modèle d’embedding dense de 16 millions de paramètres, publié par Mihaiii le 29 avril 2024 sous licence ouverte MIT. Il transforme exclusivement des textes anglais en vecteurs de 384 dimensions et accepte des séquences allant jusqu’à 512 tokens.
Distillé à partir de Bulbasaur avec le jeu de données qa-assistant, il cible l’autocomplétion sémantique et l’encodage de phrases. Ses vecteurs peuvent alimenter la recherche sémantique, la récupération de passages pour un système RAG, la mesure de similarité ou le clustering. Il fonctionne avec Sentence-Transformers ou Hugging Face Transformers, avec un mean pooling tenant compte du masque d’attention.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mihaiii |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 29 avril 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 16 millions |
| Paramètres actifs | 16 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 25,5 % | 170ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 25,7 % | 139ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 26,6 % | 164ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 24,2 % | 129ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 31,4 % | 129ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 40,8 % | 112ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 3,2 % | 187ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 13,6 % | 153ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 41,6 % | 96ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 36,4 % | 71ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,6 % | 86ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 22,8 % | 90ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les évaluations MTEB les plus favorables à Venusaur concernent les tracks French et European, qui couvrent notamment classification, clustering, comparaison de paires et bitext mining. Ces résultats restent toutefois modestes dans leurs classements respectifs et ne changent pas sa prise en charge exclusivement anglophone. Ses 384 dimensions permettent de constituer des index vectoriels relativement compacts, tandis que ses 16 millions de paramètres facilitent un déploiement léger. La licence MIT autorise l’auto-hébergement et une intégration ouverte.
Limites et points d’attention. Les tracks German et Indic sont plus faibles, ce qui concorde avec l’absence de prise en charge multilingue. Les résultats Legal et RTEB Legal placent également le modèle dans le bas des classements pour la recherche de documents, de textes réglementaires, de questions-réponses et de résumés juridiques. La limite de 512 tokens impose de tronquer ou segmenter les textes longs. Sorti il y a près de deux ans, un âge très long à l’échelle de l’IA, Venusaur est probablement dépassé par des embeddings plus récents et peut avoir été retiré des catalogues actuels. Usages pertinents : autocomplétion sémantique, recherche et clustering de phrases anglaises courtes, avec des contraintes limitées de stockage vectoriel.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).