avsolatorio/NoInstruct-small-Embedding-v0
Publié par avsolatorio le 1er mai 2024, NoInstruct-small-Embedding-v0 est un modèle d’embedding dense de 33 millions de paramètres, tous actifs. Il produit des vecteurs de 384 dimensions et adopte un encodage asymétrique : mean pooling pour les requêtes, représentation du jeton [CLS]…
Publié par avsolatorio le 1er mai 2024, NoInstruct-small-Embedding-v0 est un modèle d’embedding dense de 33 millions de paramètres, tous actifs. Il produit des vecteurs de 384 dimensions et adopte un encodage asymétrique : mean pooling pour les requêtes, représentation du jeton [CLS] pour les phrases et documents.
Distribué sous licence ouverte MIT, il sert à indexer et comparer des textes pour la recherche sémantique, le RAG, la similarité et le clustering. Il fonctionne sans instruction arbitraire lors de l’encodage des requêtes et peut être utilisé avec Transformers, notamment pour établir des similarités cosinus.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | avsolatorio |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 1 mai 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense, avec représentations asymétriques : mean pooling pour les requêtes et jeton [CLS] pour les phrases/documents |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,0 % | 72ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 36,1 % | 97ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 30,9 % | 137ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,8 % | 84ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 38,9 % | 91ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 47,1 % | 77ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 15,4 % | 146ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 11,8 % | 167ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son meilleur positionnement MTEB concerne BEIR, ce qui indique une aptitude correcte à la recherche zero-shot sur des tâches et domaines hétérogènes. Le track European constitue son deuxième résultat le plus favorable, avec une qualité intermédiaire sur des tâches couvrant plusieurs langues européennes. L’architecture asymétrique distingue explicitement les requêtes des contenus indexés, un choix adapté à la recherche d’information. Les vecteurs de 384 dimensions limitent la taille des index et le coût des comparaisons par rapport à des représentations plus larges. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Les résultats sont plus faibles sur Legal et Medical, puis reculent davantage sur Long-context Retrieval. RTEB Legal est le track le moins favorable, ce qui invite à la prudence pour la recherche juridique spécialisée. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et est probablement dépassé par des modèles plus récents. La prise en charge de Sentence Transformers était seulement annoncée comme future. Usages pertinents : moteurs de recherche sémantique compacts, RAG généraliste, détection de similarité et clustering, après validation sur le corpus ciblé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).