ai-sage/Giga-Embeddings-instruct
Publié par ai-sage le 23 septembre 2025 sous licence ouverte MIT, ai-sage/Giga-Embeddings-instruct est un modèle d’embedding dense de 3 milliards de paramètres, tous actifs. Basé sur le LLM decoder-only GigaChat-3b et un pooling Latent-Attention, il produit des vecteurs de 2 048…
Publié par ai-sage le 23 septembre 2025 sous licence ouverte MIT, ai-sage/Giga-Embeddings-instruct est un modèle d’embedding dense de 3 milliards de paramètres, tous actifs. Basé sur le LLM decoder-only GigaChat-3b et un pooling Latent-Attention, il produit des vecteurs de 2 048 dimensions à partir de séquences pouvant atteindre 4 096 tokens.
Entraîné sur un mélange de données anglaises et russes, il sert à la recherche sémantique, au RAG, à la similarité et au clustering. Les requêtes de retrieval acceptent des instructions en langage naturel, tandis que les documents sont encodés sans instruction. Il transforme le texte en vecteurs et ne génère pas de réponses textuelles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ai-sage |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 23 septembre 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 3 milliards |
| Paramètres actifs | 3 milliards |
| Longueur de séquence max | 4 096 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Russian | 74,2 % | 1ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Russian
Notre analyse
Forces. ai-sage/Giga-Embeddings-instruct se classe en tête du benchmark MTEB: Russian, qui couvre notamment la classification, le clustering, le reranking et la qualité des représentations textuelles en russe. Ce résultat en fait un candidat particulièrement solide pour l’indexation et la recherche sur des corpus russophones, avec une prise en charge complémentaire de l’anglais issue de son entraînement bilingue. Les instructions permettent d’expliciter l’objectif d’une requête de retrieval, sans imposer leur ajout aux documents indexés. La limite de 4 096 tokens facilite aussi l’encodage de passages relativement longs. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.
Limites et points d’attention. Les 3 milliards de paramètres actifs impliquent des besoins de calcul et de mémoire supérieurs à ceux de modèles d’embedding plus petits. Les vecteurs denses de 2 048 dimensions alourdissent également les index et rendent la recherche plus coûteuse que des représentations de dimension inférieure. Pour les tâches symétriques, comme la classification ou la similarité sémantique, une instruction doit être ajoutée devant chaque entrée, ce qui exige un formatage cohérent entre l’indexation et l’évaluation. Usages pertinents : recherche sémantique et RAG en russe ou en anglais, reranking, classification, similarité et clustering de textes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).