Mihaiii/Squirtle
Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Squirtle est un modèle d’embedding dense de 16 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index.
Publié par Mihaiii le 30 avril 2024 sous licence ouverte MIT, Squirtle est un modèle d’embedding dense de 16 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index.
Distillé à partir de bge-base-en-v1.5, il est conçu pour l’autocomplétion sémantique et requiert un pooling CLS avec normalisation. Il peut aussi servir comme bge-base-en-v1.5 pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Son évaluation couvre plusieurs ensembles linguistiques européens et indic.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mihaiii |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 30 avril 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 16 millions |
| Paramètres actifs | 16 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 26,2 % | 168ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 26,2 % | 138ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 26,0 % | 168ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 23,7 % | 131ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 30,1 % | 133ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 40,9 % | 110ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 4,1 % | 181ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 13,4 % | 155ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 40,8 % | 98ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 34,3 % | 78ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 32,2 % | 96ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,1 % | 91ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les tracks European et French, qui regroupent notamment classification, clustering, comparaison de paires et recherche de correspondances entre langues. Squirtle présente ainsi davantage d’intérêt pour l’indexation sémantique de contenus européens, particulièrement français, que pour ses autres domaines évalués. Ses 16 millions de paramètres et ses vecteurs de 384 dimensions favorisent un déploiement léger, avec des index relativement compacts. La licence MIT autorise l’auto-hébergement et une intégration souple dans des applications.
Limites et points d'attention. Les classements MTEB restent bas sur l’ensemble des tracks communiqués, y compris European et French. Les performances sont plus faibles en German, Dutch et Indic, tandis que Legal constitue le domaine le moins convaincant, ce qui limite son intérêt pour la recherche dans les corpus juridiques. Sorti il y a environ deux ans, soit une ancienneté très importante à l’échelle de l’IA, Squirtle appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Son emploi impose un pooling CLS et une normalisation corrects. Usages pertinents : autocomplétion sémantique, prototypes de recherche, RAG léger, similarité et clustering sur des corpus non critiques.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).