avsolatorio/NoInstruct-small-Embedding-v0

Publié par avsolatorio le 1er mai 2024, NoInstruct-small-Embedding-v0 est un modèle d’embedding dense de 33 millions de paramètres, tous actifs. Il produit des vecteurs de 384 dimensions et adopte un encodage asymétrique : mean pooling pour les requêtes, représentation du jeton [CLS]…

Publié par avsolatorio le 1er mai 2024, NoInstruct-small-Embedding-v0 est un modèle d’embedding dense de 33 millions de paramètres, tous actifs. Il produit des vecteurs de 384 dimensions et adopte un encodage asymétrique : mean pooling pour les requêtes, représentation du jeton [CLS] pour les phrases et documents.

Distribué sous licence ouverte MIT, il sert à indexer et comparer des textes pour la recherche sémantique, le RAG, la similarité et le clustering. Il fonctionne sans instruction arbitraire lors de l’encodage des requêtes et peut être utilisé avec Transformers, notamment pour établir des similarités cosinus.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuravsolatorio
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie1 mai 2024
Dimension du vecteur384
Représentationdense, avec représentations asymétriques : mean pooling pour les requêtes et jeton [CLS] pour les phrases/documents
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR52,0 %72ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval36,1 %97ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal30,9 %137ᵉ / 208mteb✅ Mesuré
MTEB: Medical38,8 %84ᵉ / 158mteb✅ Mesuré
MTEB: Legal38,9 %91ᵉ / 157mteb✅ Mesuré
MTEB: European47,1 %77ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French15,4 %146ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German11,8 %167ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ avsolatorio/NoInstruct-…52 %
llmrails/ember-v152 %

MTEB: Long-context Retrieval

▶ avsolatorio/NoInstruct-…36 %

Notre analyse

Forces. Son meilleur positionnement MTEB concerne BEIR, ce qui indique une aptitude correcte à la recherche zero-shot sur des tâches et domaines hétérogènes. Le track European constitue son deuxième résultat le plus favorable, avec une qualité intermédiaire sur des tâches couvrant plusieurs langues européennes. L’architecture asymétrique distingue explicitement les requêtes des contenus indexés, un choix adapté à la recherche d’information. Les vecteurs de 384 dimensions limitent la taille des index et le coût des comparaisons par rapport à des représentations plus larges. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Les résultats sont plus faibles sur Legal et Medical, puis reculent davantage sur Long-context Retrieval. RTEB Legal est le track le moins favorable, ce qui invite à la prudence pour la recherche juridique spécialisée. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et est probablement dépassé par des modèles plus récents. La prise en charge de Sentence Transformers était seulement annoncée comme future. Usages pertinents : moteurs de recherche sémantique compacts, RAG généraliste, détection de similarité et clustering, après validation sur le corpus ciblé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).