ai-sage/Giga-Embeddings-instruct

Publié par ai-sage le 23 septembre 2025 sous licence ouverte MIT, ai-sage/Giga-Embeddings-instruct est un modèle d’embedding dense de 3 milliards de paramètres, tous actifs. Basé sur le LLM decoder-only GigaChat-3b et un pooling Latent-Attention, il produit des vecteurs de 2 048…

Publié par ai-sage le 23 septembre 2025 sous licence ouverte MIT, ai-sage/Giga-Embeddings-instruct est un modèle d’embedding dense de 3 milliards de paramètres, tous actifs. Basé sur le LLM decoder-only GigaChat-3b et un pooling Latent-Attention, il produit des vecteurs de 2 048 dimensions à partir de séquences pouvant atteindre 4 096 tokens.

Entraîné sur un mélange de données anglaises et russes, il sert à la recherche sémantique, au RAG, à la similarité et au clustering. Les requêtes de retrieval acceptent des instructions en langage naturel, tandis que les documents sont encodés sans instruction. Il transforme le texte en vecteurs et ne génère pas de réponses textuelles.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurai-sage
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 septembre 2025
Dimension du vecteur2 048
Représentationdense
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max4 096 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Russian74,2 %1ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Russian

▶ ai-sage/Giga-Embeddings…74 %

Notre analyse

Forces. ai-sage/Giga-Embeddings-instruct se classe en tête du benchmark MTEB: Russian, qui couvre notamment la classification, le clustering, le reranking et la qualité des représentations textuelles en russe. Ce résultat en fait un candidat particulièrement solide pour l’indexation et la recherche sur des corpus russophones, avec une prise en charge complémentaire de l’anglais issue de son entraînement bilingue. Les instructions permettent d’expliciter l’objectif d’une requête de retrieval, sans imposer leur ajout aux documents indexés. La limite de 4 096 tokens facilite aussi l’encodage de passages relativement longs. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.

Limites et points d’attention. Les 3 milliards de paramètres actifs impliquent des besoins de calcul et de mémoire supérieurs à ceux de modèles d’embedding plus petits. Les vecteurs denses de 2 048 dimensions alourdissent également les index et rendent la recherche plus coûteuse que des représentations de dimension inférieure. Pour les tâches symétriques, comme la classification ou la similarité sémantique, une instruction doit être ajoutée devant chaque entrée, ce qui exige un formatage cohérent entre l’indexation et l’évaluation. Usages pertinents : recherche sémantique et RAG en russe ou en anglais, reranking, classification, similarité et clustering de textes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).