LingoIITGN/qwen-indic-v1

LingoIITGN/qwen-indic-v1 est un modèle d’embedding multilingue de 8 milliards de paramètres publié par LingoIITGN sous licence ouverte Apache 2.0. Dérivé de Qwen3-Embedding-8B, ce transformeur decoder-only a été affiné par LoRA en trois étapes, puis fusionné dans les poids de base.

LingoIITGN/qwen-indic-v1 est un modèle d’embedding multilingue de 8 milliards de paramètres publié par LingoIITGN sous licence ouverte Apache 2.0. Dérivé de Qwen3-Embedding-8B, ce transformeur decoder-only a été affiné par LoRA en trois étapes, puis fusionné dans les poids de base.

Le modèle couvre les 22 langues indiennes reconnues par la Constitution et produit des représentations denses de 4 096 dimensions, obtenues par pooling sur le dernier token et normalisation L2. Il sert à la recherche sémantique, à l’indexation pour le RAG, à la classification, à la mesure de similarité et au clustering de textes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurLingoIITGN
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 juillet 2026
Dimension du vecteur4 096
Représentationdense
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max40 960 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Indic73,8 %5ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Indic

▶ LingoIITGN/qwen-indic-v174 %

Notre analyse

Forces. LingoIITGN/qwen-indic-v1 se situe dans le top 10 de MTEB: Indic, une évaluation couvrant notamment le bitext mining et la classification dans les langues indiennes. Sa spécialisation multilingue constitue un atout pour rapprocher des contenus sémantiquement équivalents entre ces langues, classer des textes et construire des systèmes de recherche régionaux. Les préfixes d’instruction adaptés aux familles de tâches permettent de distinguer les usages de recherche, de classification et de similarité. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des infrastructures maîtrisées.

Limites et points d'attention. Les 8 milliards de paramètres impliquent un modèle plus lourd à charger et à exécuter que des encodeurs compacts. Les vecteurs denses de 4 096 dimensions augmentent également la taille des index, les besoins de stockage et le coût des recherches de similarité. L’encodage demande enfin une convention précise : les requêtes reçoivent un préfixe d’instruction, tandis que les documents sont traités sans instruction. Une mauvaise application de ce format peut dégrader l’alignement entre requêtes et contenus. Usages pertinents : recherche sémantique, RAG, classification, similarité interlingue et clustering portant sur les langues indiennes couvertes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).