Thenlper: GTE-Large

Thenlper: GTE-Large est un modèle d’embedding dense d’Alibaba, publié sous licence ouverte MIT le 18 novembre 2025. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions par pooling moyen des états cachés, avec une normalisation L2 optionnelle.

Thenlper: GTE-Large est un modèle d’embedding dense d’Alibaba, publié sous licence ouverte MIT le 18 novembre 2025. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions par pooling moyen des états cachés, avec une normalisation L2 optionnelle.

Fondé principalement sur l’architecture BERT, il a été entraîné par apprentissage contrastif multi-étapes sur des paires de textes issues de domaines variés. Il traite exclusivement l’anglais, avec une longueur maximale de 512 tokens. Il sert à la recherche sémantique, au RAG, à la similarité textuelle, au clustering et au reranking.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur1 024
Représentationdense
Paramètres335 millions
Paramètres actifs335 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR52,2 %71ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval38,7 %83ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal34,3 %105ᵉ / 208mteb✅ Mesuré
MTEB: Medical42,1 %58ᵉ / 158mteb✅ Mesuré
MTEB: Legal41,2 %71ᵉ / 157mteb✅ Mesuré
MTEB: European48,9 %64ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French27,7 %100ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German19,8 %121ᵉ / 209mteb✅ Mesuré
MTEB: French51,5 %51ᵉ / 117mteb✅ Mesuré
MTEB: German43,1 %37ᵉ / 96mteb✅ Mesuré
MTEB: Indic31,3 %107ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,01 $

Prix en dollars US par million de tokens.

Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Le résultat le plus élevé apparaît sur MTEB BEIR, ce qui place la recherche d’information généraliste parmi ses points forts. Le track MTEB French obtient également un résultat relativement solide, même si le modèle est destiné exclusivement aux textes anglais. L’entraînement contrastif sur un corpus à grande échelle et couvrant plusieurs domaines correspond directement aux tâches de rapprochement sémantique. La licence MIT facilite l’auto-hébergement et l’intégration dans des applications commerciales. Le tarif minimal de 0,01 dollar par million de tokens en entrée, avec sortie gratuite, se situe 78 % sous la moyenne des modèles d’embedding similaires.

Limites et points d’attention. Les résultats sont plus faibles sur MTEB German, Medical et Legal, ce qui invite à valider le modèle avant un déploiement spécialisé dans les contenus allemands, cliniques, biomédicaux ou juridiques. Sa prise en charge exclusivement anglophone limite les usages multilingues, malgré les résultats mesurés sur plusieurs tracks européens. La limite de 512 tokens impose de segmenter les documents longs. Les vecteurs de 1 024 dimensions alourdissent aussi les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus petites. Usages pertinents : recherche sémantique et RAG en anglais, similarité de textes, clustering et reranking sur des passages courts ou préalablement segmentés.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).