Mihaiii/Wartortle
Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Wartortle est un modèle d’embedding dense de 17 millions de paramètres. Distillé de bge-base-en-v1.5, il produit des vecteurs de 384 dimensions et se distingue par un format compact.
Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Wartortle est un modèle d’embedding dense de 17 millions de paramètres. Distillé de bge-base-en-v1.5, il produit des vecteurs de 384 dimensions et se distingue par un format compact.
Conçu pour l’autocomplétion sémantique, il peut aussi alimenter la recherche par similarité, l’indexation de contenus pour le RAG et le clustering de textes. Son utilisation repose sur un pooling du jeton CLS suivi d’une normalisation, selon une méthode similaire à celle de bge-base-en-v1.5.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mihaiii |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 30 avril 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 17 millions |
| Paramètres actifs | 17 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 29,3 % | 161ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 31,1 % | 120ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 28,0 % | 157ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 25,2 % | 127ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 33,0 % | 124ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 42,7 % | 107ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 6,0 % | 173ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 14,5 % | 149ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 41,8 % | 95ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 35,3 % | 76ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 33,3 % | 93ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,1 % | 92ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les évaluations European et French, qui couvrent notamment la classification, le clustering, la comparaison de paires et, pour le track européen, le bitext mining. Ces résultats montrent une aptitude plus nette sur les tâches européennes et francophones que sur les autres ensembles évalués, sans toutefois placer Wartortle parmi les modèles de tête. Ses 384 dimensions permettent de constituer des index relativement légers, tandis que ses 17 millions de paramètres facilitent un déploiement compact. La licence MIT autorise l’auto-hébergement et une intégration souple.
Limites et points d’attention. Les rangs obtenus restent bas sur l’ensemble des tracks MTEB recensés. Les performances sont particulièrement modestes en German, Dutch, Indic et Legal, ce qui limite son intérêt pour les corpus multilingues exigeants et la recherche juridique spécialisée. Sorti il y a environ deux ans, Wartortle appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents, voire retiré des catalogues actuels. Usages pertinents : autocomplétion sémantique, recherche de similarité, RAG ou clustering lorsque la compacité prime sur la qualité maximale.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).