Mihaiii/Squirtle

Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Squirtle est un modèle d’embedding dense de 16 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index.

Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Squirtle est un modèle d’embedding dense de 16 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index.

Distillé à partir de bge-base-en-v1.5, il est conçu pour l’autocomplétion sémantique et requiert un pooling CLS avec normalisation. Il peut aussi servir comme bge-base-en-v1.5 pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Son évaluation couvre plusieurs ensembles linguistiques européens et indic.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMihaiii
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie30 avril 2024
Dimension du vecteur384
Représentationdense
Paramètres16 millions
Paramètres actifs16 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR26,2 %168ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval26,2 %138ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal26,0 %168ᵉ / 208mteb✅ Mesuré
MTEB: Medical23,7 %131ᵉ / 158mteb✅ Mesuré
MTEB: Legal30,1 %133ᵉ / 157mteb✅ Mesuré
MTEB: European40,9 %110ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French4,1 %181ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German13,4 %155ᵉ / 209mteb✅ Mesuré
MTEB: French40,8 %98ᵉ / 117mteb✅ Mesuré
MTEB: German34,3 %78ᵉ / 96mteb✅ Mesuré
MTEB: Dutch32,2 %96ᵉ / 113mteb✅ Mesuré
MTEB: Indic32,1 %91ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Mihaiii/Squirtle26 %

MTEB: Long-context Retrieval

bigscience/sgpt-bloom-7…29 %
▶ Mihaiii/Squirtle26 %

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les tracks European et French, qui regroupent notamment classification, clustering, comparaison de paires et recherche de correspondances entre langues. Squirtle présente ainsi davantage d’intérêt pour l’indexation sémantique de contenus européens, particulièrement français, que pour ses autres domaines évalués. Ses 16 millions de paramètres et ses vecteurs de 384 dimensions favorisent un déploiement léger, avec des index relativement compacts. La licence MIT autorise l’auto-hébergement et une intégration souple dans des applications.

Limites et points d'attention. Les classements MTEB restent bas sur l’ensemble des tracks communiqués, y compris European et French. Les performances sont plus faibles en German, Dutch et Indic, tandis que Legal constitue le domaine le moins convaincant, ce qui limite son intérêt pour la recherche dans les corpus juridiques. Sorti il y a environ deux ans, soit une ancienneté très importante à l’échelle de l’IA, Squirtle appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Son emploi impose un pooling CLS et une normalisation corrects. Usages pertinents : autocomplétion sémantique, prototypes de recherche, RAG léger, similarité et clustering sur des corpus non critiques.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).