RTEB English
MTEB: RTEB English est un benchmark public consacré à la recherche d’information en anglais. Créé en 2025 par Hugging Face, MongoDB et la communauté MTEB, il constitue le sous-ensemble anglophone de RTEB.
MTEB: RTEB English est un benchmark public consacré à la recherche d’information en anglais. Créé en 2025 par Hugging Face, MongoDB et la communauté MTEB, il constitue le sous-ensemble anglophone de RTEB.
Il évalue la qualité de recherche des modèles dans les domaines juridique, financier, du code et de la santé. Ses tâches représentent des besoins de production réels. Le benchmark sert ainsi à comparer la capacité des modèles à retrouver des informations pertinentes, au moyen de la métrique nDCG@10.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Hugging Face, MongoDB et communaute MTEB |
| Capacités mesurées | Evalue la qualite de la recherche en anglais dans les domaines juridique, finance, code et sante, avec des taches representatives de besoins de production reels. |
| Modalité | Texte |
| Type de questions | Recherche d'information en anglais (retrieval) |
| Métrique d'évaluation | nDCG@10 |
| Accès | Public |
| Langues | Anglais |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 48,6 % | 9 mars 2026 | ✅ Mesuré |
| 2 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 41,3 % | 8 février 2024 | ✅ Mesuré |
| 3 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 22,7 % | 15 janvier 2025 | ✅ Mesuré |
| 4 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 22,0 % | 23 mai 2025 | ✅ Mesuré |
Classement établi sur 4 modèles évalués. Score médian de l'ensemble : 32,0 %.
Notre analyse
Un score nDCG@10 élevé traduit une meilleure qualité de classement des résultats pertinents parmi les dix premières réponses. Dans la base considérée, codefuse-ai/F2LLM-v2-80M obtient 49 %, contre un score médian de 32 % pour les quatre modèles évalués. Cet écart place nettement le modèle en tête de cet échantillon, sans indiquer une saturation du benchmark puisque le meilleur résultat reste éloigné du maximum théorique de la métrique.
La lecture du classement exige toutefois de tenir compte de la fiabilité des résultats, majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une mesure uniforme. MTEB: RTEB English associe par ailleurs des jeux de données ouverts et fermés, les résultats sur les tâches privées nécessitant une soumission par l’intermédiaire du dépôt MTEB. Sa portée reste ciblée sur la recherche en anglais et sur quatre domaines. Le classement renseigne donc précisément sur ces usages de retrieval, mais ne doit pas être étendu à d’autres langues, domaines ou capacités des modèles.
Sources des scores : mteb.