Mihaiii/Wartortle

Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Wartortle est un modèle d’embedding dense de 17 millions de paramètres. Distillé de bge-base-en-v1.5, il produit des vecteurs de 384 dimensions et se distingue par un format compact.

Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Wartortle est un modèle d’embedding dense de 17 millions de paramètres. Distillé de bge-base-en-v1.5, il produit des vecteurs de 384 dimensions et se distingue par un format compact.

Conçu pour l’autocomplétion sémantique, il peut aussi alimenter la recherche par similarité, l’indexation de contenus pour le RAG et le clustering de textes. Son utilisation repose sur un pooling du jeton CLS suivi d’une normalisation, selon une méthode similaire à celle de bge-base-en-v1.5.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMihaiii
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie30 avril 2024
Dimension du vecteur384
Représentationdense
Paramètres17 millions
Paramètres actifs17 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR29,3 %161ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval31,1 %120ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal28,0 %157ᵉ / 208mteb✅ Mesuré
MTEB: Medical25,2 %127ᵉ / 158mteb✅ Mesuré
MTEB: Legal33,0 %124ᵉ / 157mteb✅ Mesuré
MTEB: European42,7 %107ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French6,0 %173ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German14,5 %149ᵉ / 209mteb✅ Mesuré
MTEB: French41,8 %95ᵉ / 117mteb✅ Mesuré
MTEB: German35,3 %76ᵉ / 96mteb✅ Mesuré
MTEB: Dutch33,3 %93ᵉ / 113mteb✅ Mesuré
MTEB: Indic32,1 %92ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les évaluations European et French, qui couvrent notamment la classification, le clustering, la comparaison de paires et, pour le track européen, le bitext mining. Ces résultats montrent une aptitude plus nette sur les tâches européennes et francophones que sur les autres ensembles évalués, sans toutefois placer Wartortle parmi les modèles de tête. Ses 384 dimensions permettent de constituer des index relativement légers, tandis que ses 17 millions de paramètres facilitent un déploiement compact. La licence MIT autorise l’auto-hébergement et une intégration souple.

Limites et points d’attention. Les rangs obtenus restent bas sur l’ensemble des tracks MTEB recensés. Les performances sont particulièrement modestes en German, Dutch, Indic et Legal, ce qui limite son intérêt pour les corpus multilingues exigeants et la recherche juridique spécialisée. Sorti il y a environ deux ans, Wartortle appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents, voire retiré des catalogues actuels. Usages pertinents : autocomplétion sémantique, recherche de similarité, RAG ou clustering lorsque la compacité prime sur la qualité maximale.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).