Thenlper: GTE-Large
Thenlper: GTE-Large est un modèle d’embedding dense d’Alibaba, publié sous licence ouverte MIT le 18 novembre 2025. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions par pooling moyen des états cachés, avec une normalisation L2 optionnelle.
Thenlper: GTE-Large est un modèle d’embedding dense d’Alibaba, publié sous licence ouverte MIT le 18 novembre 2025. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions par pooling moyen des états cachés, avec une normalisation L2 optionnelle.
Fondé principalement sur l’architecture BERT, il a été entraîné par apprentissage contrastif multi-étapes sur des paires de textes issues de domaines variés. Il traite exclusivement l’anglais, avec une longueur maximale de 512 tokens. Il sert à la recherche sémantique, au RAG, à la similarité textuelle, au clustering et au reranking.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 18 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,2 % | 71ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 38,7 % | 83ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 34,3 % | 105ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 42,1 % | 58ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 41,2 % | 71ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 48,9 % | 64ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 27,7 % | 100ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 19,8 % | 121ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 51,5 % | 51ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 43,1 % | 37ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,3 % | 107ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,01 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Le résultat le plus élevé apparaît sur MTEB BEIR, ce qui place la recherche d’information généraliste parmi ses points forts. Le track MTEB French obtient également un résultat relativement solide, même si le modèle est destiné exclusivement aux textes anglais. L’entraînement contrastif sur un corpus à grande échelle et couvrant plusieurs domaines correspond directement aux tâches de rapprochement sémantique. La licence MIT facilite l’auto-hébergement et l’intégration dans des applications commerciales. Le tarif minimal de 0,01 dollar par million de tokens en entrée, avec sortie gratuite, se situe 78 % sous la moyenne des modèles d’embedding similaires.
Limites et points d’attention. Les résultats sont plus faibles sur MTEB German, Medical et Legal, ce qui invite à valider le modèle avant un déploiement spécialisé dans les contenus allemands, cliniques, biomédicaux ou juridiques. Sa prise en charge exclusivement anglophone limite les usages multilingues, malgré les résultats mesurés sur plusieurs tracks européens. La limite de 512 tokens impose de segmenter les documents longs. Les vecteurs de 1 024 dimensions alourdissent aussi les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus petites. Usages pertinents : recherche sémantique et RAG en anglais, similarité de textes, clustering et reranking sur des passages courts ou préalablement segmentés.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).