Haon-Chen/speed-embedding-7b-instruct

Publié par Haon-Chen le 31 octobre 2024 sous licence ouverte MIT, Haon-Chen/speed-embedding-7b-instruct est un modèle dense de 7 milliards de paramètres et 32 couches. Il produit des vecteurs de 4 096 dimensions par pooling sur le dernier token, avec normalisation L2 dans l’exemple…

Publié par Haon-Chen le 31 octobre 2024 sous licence ouverte MIT, Haon-Chen/speed-embedding-7b-instruct est un modèle dense de 7 milliards de paramètres et 32 couches. Il produit des vecteurs de 4 096 dimensions par pooling sur le dernier token, avec normalisation L2 dans l’exemple d’utilisation.

Évalué notamment sur des contenus indic, allemands, médicaux et juridiques, ce modèle sert à la recherche sémantique, au classement de passages, au RAG, à la similarité et au clustering. Chaque requête reçoit une instruction décrivant la tâche, contrairement aux documents. Les entrées supérieures à 4 096 tokens sont déconseillées.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurHaon-Chen
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie31 octobre 2024
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval33,6 %110ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal34,7 %99ᵉ / 208mteb✅ Mesuré
MTEB: Medical47,0 %48ᵉ / 158mteb✅ Mesuré
MTEB: Legal43,0 %60ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French4,7 %179ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German33,2 %91ᵉ / 209mteb✅ Mesuré
MTEB: Indic47,5 %45ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ Haon-Chen/speed-embeddi…34 %

MTEB: Indic

▶ Haon-Chen/speed-embeddi…48 %
Sailesh97/Hinvec47 %

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les langues indiques, puis la recherche d’informations médicales et juridiques. Le modèle présente ainsi un intérêt pour l’indexation multilingue et les corpus spécialisés, notamment cliniques, biomédicaux, juridiques et réglementaires. Son encodage guidé par une instruction permet de préciser la tâche côté requête, tandis que les documents restent encodés sans consigne. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes de recherche ou de RAG.

Limites et points d'attention. Les évaluations RTEB Legal, RTEB German et Long-context Retrieval placent le modèle dans la seconde moitié des classements, avec une faiblesse particulièrement marquée sur la récupération en contexte long. La recommandation de ne pas dépasser 4 096 tokens limite le traitement direct de documents volumineux et peut imposer leur découpage. Les vecteurs de 4 096 dimensions alourdissent également les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec près de deux ans d’ancienneté, durée très longue à l’échelle de l’IA, le modèle est probablement dépassé par des références plus récentes de sa catégorie. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts ou segmentés, similarité et clustering de corpus médicaux ou juridiques.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).