Long-context Retrieval

MTEB: Long-context Retrieval est un benchmark consacré à la recherche d’information dans des documents longs. Créé par les auteurs de LongEmbed, Dawei Zhu et al., puis intégré à MTEB, il associe des tâches synthétiques et réelles afin d’examiner des contextes de longueur variable où…

MTEB: Long-context Retrieval est un benchmark consacré à la recherche d’information dans des documents longs. Créé par les auteurs de LongEmbed, Dawei Zhu et al., puis intégré à MTEB, il associe des tâches synthétiques et réelles afin d’examiner des contextes de longueur variable où l’information cible peut être dispersée.

Il mesure la capacité des modèles d’embeddings à retrouver les documents pertinents malgré l’allongement du contexte. Il complète ainsi l’évaluation du retrieval en mettant spécifiquement l’accent sur la gestion de contenus longs, plutôt que sur les seules performances obtenues avec des passages courts.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs LongEmbed (Dawei Zhu et al.) ; integre dans MTEB (embeddings-benchmark)
Capacités mesuréesQualite de retrieval en contexte long, avec longueurs de documents variables et information cible dispersee.
ModalitéTexte
Type de questionsRecherche/retrieval de documents longs
Métrique d'évaluationnDCG@10 (metriques de retrieval)
AccèsPublic
LanguesAnglais
Taille du jeu6 taches (2 synthetiques + 4 reelles), documents de 256 a 32768 tokens
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (169)

#ModèleÉditeurLicenceScoreSortieFiabilité
1lightonai/GTE-ModernColBERT-v1lightonai🟢 Ouvert90,6 %30 avril 2025✅ Mesuré
2voyageai/voyage-multilingual-2Voyage AI🟢 Ouvert79,2 %10 juin 2024✅ Mesuré
3voyageai/voyage-law-2Voyage AI🟢 Ouvert78,8 %15 avril 2024✅ Mesuré
4codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert76,6 %9 mars 2026✅ Mesuré
5BidirLM/BidirLM-1B-EmbeddingBidirLM🟢 Ouvert76,4 %7 avril 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert75,6 %9 mars 2026✅ Mesuré
7codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert75,4 %9 mars 2026✅ Mesuré
8voyageai/voyage-3Voyage AI🟢 Ouvert74,1 %18 septembre 2024✅ Mesuré
9BidirLM/BidirLM-1.7B-EmbeddingBidirLM🟢 Ouvert73,4 %7 avril 2026✅ Mesuré
10infly/inf-retriever-v1infly🟢 Ouvert73,2 %24 décembre 2024✅ Mesuré
11ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1ICT-TIME-and-Querit🟢 Ouvert72,1 %2 mai 2026✅ Mesuré
12BidirLM/BidirLM-0.6B-EmbeddingBidirLM🟢 Ouvert71,9 %7 avril 2026✅ Mesuré
13BidirLM/BidirLM-270M-EmbeddingBidirLM🟢 Ouvert71,8 %7 avril 2026✅ Mesuré
14ibm-granite/granite-embedding-311m-multilingual-r2IBM🟢 Ouvert71,7 %29 avril 2026✅ Mesuré
15codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert71,4 %9 mars 2026✅ Mesuré
16voyageai/voyage-3-liteVoyage AI🟢 Ouvert71,4 %18 septembre 2024✅ Mesuré
17codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert70,8 %9 mars 2026✅ Mesuré
18infly/inf-retriever-v1-1.5binfly🟢 Ouvert70,2 %8 février 2025✅ Mesuré
19jinaai/jina-embeddings-v4Jina AI🟢 Ouvert69,9 %24 juin 2025✅ Mesuré
20jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert66,4 %1 avril 2026✅ Mesuré
21jinaai/jina-embeddings-v5-text-smallJina AI🟢 Ouvert66,4 %17 février 2026✅ Mesuré
22codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert66,3 %9 mars 2026✅ Mesuré
23ibm-granite/granite-embedding-english-r2IBM🟢 Ouvert65,6 %15 août 2025✅ Mesuré
24ibm-granite/granite-embedding-97m-multilingual-r2IBM🟢 Ouvert65,5 %29 avril 2026✅ Mesuré
25HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1HIT-TMG🟢 Ouvert65,1 %23 octobre 2024✅ Mesuré
26ibm-granite/granite-embedding-small-english-r2IBM🟢 Ouvert63,7 %15 août 2025✅ Mesuré
27Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert63,7 %4 décembre 2024✅ Mesuré
28jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert63,7 %1 avril 2026✅ Mesuré
29jinaai/jina-embeddings-v5-text-nanoJina AI🟢 Ouvert63,7 %17 février 2026✅ Mesuré
30Alibaba-NLP/gte-multilingual-baseAlibaba🟢 Ouvert62,1 %20 juillet 2024✅ Mesuré
31NovaSearch/jasper_en_vision_language_v1NovaSearch🟢 Ouvert60,9 %11 décembre 2024✅ Mesuré
32sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert60,4 %15 janvier 2025✅ Mesuré
33BAAI: bge-m3BAAI🟢 Ouvert59,5 %18 novembre 2025✅ Mesuré
34deepvk/USER-bge-m3deepvk🟢 Ouvert59,4 %5 juillet 2024✅ Mesuré
35codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert57,6 %9 mars 2026✅ Mesuré
36manu/bge-m3-custom-frmanu🟢 Ouvert57,4 %11 avril 2024✅ Mesuré
37jinaai/jina-embeddings-v3Jina AI🟢 Ouvert55,7 %18 septembre 2024✅ Mesuré
38nomic-ai/nomic-embed-text-v1-unsupervisedNomic AI🟢 Ouvert55,5 %15 janvier 2024✅ Mesuré
39Snowflake/snowflake-arctic-embed-m-v2.0Snowflake🟢 Ouvert55,4 %4 décembre 2024✅ Mesuré
40dwzhu/e5-base-4kdwzhu🟢 Ouvert54,5 %28 mars 2024✅ Mesuré
41openai/text-embedding-3-smallOpenAI🟢 Ouvert53,6 %25 janvier 2024✅ Mesuré
42openai/text-embedding-3-largeOpenAI🟢 Ouvert52,4 %25 janvier 2024✅ Mesuré
43nomic-ai/nomic-embed-text-v1Nomic AI🟢 Ouvert47,7 %31 janvier 2024✅ Mesuré
44Alibaba-NLP/gte-Qwen2-7B-instructAlibaba🟢 Ouvert47,2 %15 juin 2024✅ Mesuré
45GritLM/GritLM-7BGritLM🟢 Ouvert47,1 %15 février 2024✅ Mesuré
46NovaSearch/stella_en_1.5B_v5NovaSearch🟢 Ouvert46,5 %12 juillet 2024✅ Mesuré
47Salesforce/SFR-Embedding-2_RSalesforce🟢 Ouvert45,9 %14 juin 2024✅ Mesuré
48Linq-AI-Research/Linq-Embed-MistralLinq-AI-Research🟢 Ouvert45,8 %29 mai 2024✅ Mesuré
49Snowflake/snowflake-arctic-embed-m-longSnowflake🟢 Ouvert45,7 %12 avril 2024✅ Mesuré
50Salesforce/SFR-Embedding-MistralSalesforce🟢 Ouvert44,3 %24 janvier 2024✅ Mesuré
51GritLM/GritLM-8x7BGritLM🟢 Ouvert44,2 %15 février 2024✅ Mesuré
52Alibaba-NLP/gte-Qwen2-1.5B-instructAlibaba🟢 Ouvert44,1 %29 juillet 2024✅ Mesuré
53intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert43,7 %8 février 2024✅ Mesuré
54HIT-TMG/KaLM-embedding-multilingual-mini-v1HIT-TMG🟢 Ouvert43,2 %27 août 2024✅ Mesuré
55Intfloat: E5-Large-v2Intfloat🟢 Ouvert42,9 %18 novembre 2025✅ Mesuré
56Snowflake/snowflake-arctic-embed-lSnowflake🟢 Ouvert42,5 %12 avril 2024✅ Mesuré
57NovaSearch/stella_en_400M_v5NovaSearch🟢 Ouvert42,3 %12 juillet 2024✅ Mesuré
58ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert42,2 %18 décembre 2024✅ Mesuré
59Cohere/Cohere-embed-english-v3.0Cohere🟢 Ouvert42,1 %2 novembre 2023✅ Mesuré
60manveertamber/cadet-embed-base-v1manveertamber🟢 Ouvert42,0 %11 mai 2025✅ Mesuré
61Alibaba-NLP/gte-Qwen1.5-7B-instructAlibaba🟢 Ouvert41,8 %20 avril 2024✅ Mesuré
62intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert41,8 %8 février 2024✅ Mesuré
63Intfloat: E5-Base-v2Intfloat🟢 Ouvert41,1 %18 novembre 2025✅ Mesuré
64intfloat/e5-small-v2Intfloat🟢 Ouvert40,7 %8 février 2024✅ Mesuré
65Lajavaness/bilingual-embedding-baseLajavaness🟢 Ouvert40,6 %26 juin 2024✅ Mesuré
66Snowflake/snowflake-arctic-embed-m-v1.5Snowflake🟢 Ouvert40,5 %8 juillet 2024✅ Mesuré
67intfloat/multilingual-e5-baseIntfloat🟢 Ouvert40,5 %8 février 2024✅ Mesuré
68Lajavaness/bilingual-embedding-largeLajavaness🟢 Ouvert40,5 %24 juin 2024✅ Mesuré
69Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert40,4 %18 novembre 2025✅ Mesuré
70w601sxs/b1ade-embedw601sxs🟢 Ouvert40,2 %10 mars 2025✅ Mesuré
71sdadas/mmlw-e5-largesdadas🟢 Ouvert40,2 %17 novembre 2023✅ Mesuré
72WhereIsAI/UAE-Large-V1WhereIsAI🟢 Ouvert40,1 %4 décembre 2023✅ Mesuré
73Snowflake/snowflake-arctic-embed-mSnowflake🟢 Ouvert40,1 %12 avril 2024✅ Mesuré
74BAAI: bge-large-en-v1.5BAAI🟢 Ouvert40,1 %18 novembre 2025✅ Mesuré
75Snowflake/snowflake-arctic-embed-sSnowflake🟢 Ouvert39,5 %12 avril 2024✅ Mesuré
76intfloat/e5-largeIntfloat🟢 Ouvert39,4 %26 décembre 2022✅ Mesuré
77Cohere/Cohere-embed-multilingual-v3.0Cohere🟢 Ouvert39,3 %2 novembre 2023✅ Mesuré
78Cohere/Cohere-embed-multilingual-light-v3.0Cohere🟢 Ouvert39,1 %2 novembre 2023✅ Mesuré
79avsolatorio/GIST-large-Embedding-v0avsolatorio🟢 Ouvert39,0 %14 février 2024✅ Mesuré
80mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert38,9 %7 mars 2024✅ Mesuré
81intfloat/multilingual-e5-smallIntfloat🟢 Ouvert38,8 %8 février 2024✅ Mesuré
82Thenlper: GTE-LargeAlibaba🟢 Ouvert38,7 %18 novembre 2025✅ Mesuré
83Cohere/Cohere-embed-english-light-v3.0Cohere🟢 Ouvert38,6 %2 novembre 2023✅ Mesuré
84ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert38,4 %18 décembre 2024✅ Mesuré
85OrdalieTech/Solon-embeddings-large-0.1OrdalieTech🟢 Ouvert37,8 %9 décembre 2023✅ Mesuré
86ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert37,7 %18 décembre 2024✅ Mesuré
87intfloat/e5-baseIntfloat🟢 Ouvert37,6 %26 décembre 2022✅ Mesuré
88sdadas/mmlw-roberta-largesdadas🟢 Ouvert37,4 %17 novembre 2023✅ Mesuré
89jinaai/jina-embedding-b-en-v1Jina AI🟢 Ouvert37,2 %7 juillet 2023✅ Mesuré
90manu/sentence_croissant_alpha_v0.4manu🟢 Ouvert37,2 %27 avril 2024✅ Mesuré
91Lajavaness/bilingual-embedding-smallLajavaness🟢 Ouvert37,1 %17 juillet 2024✅ Mesuré
92manu/sentence_croissant_alpha_v0.2manu🟢 Ouvert36,8 %15 mars 2024✅ Mesuré
93Snowflake/snowflake-arctic-embed-xsSnowflake🟢 Ouvert36,8 %8 juillet 2024✅ Mesuré
94intfloat/e5-smallIntfloat🟢 Ouvert36,6 %8 février 2024✅ Mesuré
95manu/sentence_croissant_alpha_v0.3manu🟢 Ouvert36,5 %26 avril 2024✅ Mesuré
96avsolatorio/NoInstruct-small-Embedding-v0avsolatorio🟢 Ouvert36,1 %1 mai 2024✅ Mesuré
97Mihaiii/IvysaurMihaiii🟢 Ouvert36,0 %27 avril 2024✅ Mesuré
98avsolatorio/GIST-Embedding-v0avsolatorio🟢 Ouvert35,2 %31 janvier 2024✅ Mesuré
99Thenlper: GTE-BaseAlibaba🟢 Ouvert34,8 %18 novembre 2025✅ Mesuré
100avsolatorio/GIST-small-Embedding-v0avsolatorio🟢 Ouvert34,8 %3 février 2024✅ Mesuré
101thenlper/gte-smallAlibaba🟢 Ouvert34,5 %27 juillet 2023✅ Mesuré
102McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervisedMcGill-NLP🟢 Ouvert34,5 %9 avril 2024✅ Mesuré
103infgrad/stella-base-en-v2infgrad🟢 Ouvert34,5 %19 octobre 2023✅ Mesuré
104avsolatorio/GIST-all-MiniLM-L6-v2avsolatorio🟢 Ouvert34,4 %3 février 2024✅ Mesuré
105ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert34,3 %18 décembre 2024✅ Mesuré
106jinaai/jina-embedding-s-en-v1Jina AI🟢 Ouvert34,3 %7 juillet 2023✅ Mesuré
107sdadas/mmlw-e5-basesdadas🟢 Ouvert34,2 %17 novembre 2023✅ Mesuré
108BAAI: bge-base-en-v1.5BAAI🟢 Ouvert33,9 %18 novembre 2025✅ Mesuré
109Haon-Chen/speed-embedding-7b-instructHaon-Chen🟢 Ouvert33,6 %31 octobre 2024✅ Mesuré
110sdadas/mmlw-roberta-basesdadas🟢 Ouvert33,2 %17 novembre 2023✅ Mesuré
111sdadas/mmlw-e5-smallsdadas🟢 Ouvert32,8 %17 novembre 2023✅ Mesuré
112Mihaiii/gte-micro-v4Mihaiii🟢 Ouvert32,7 %22 avril 2024✅ Mesuré
113minishlab/potion-base-8Mminishlab🟢 Ouvert32,6 %29 octobre 2024✅ Mesuré
114BAAI/bge-small-en-v1.5BAAI🟢 Ouvert32,1 %12 septembre 2023✅ Mesuré
115ai-forever/ru-en-RoSBERTaai-forever🟢 Ouvert31,7 %29 juillet 2024✅ Mesuré
116codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert31,7 %9 mars 2026✅ Mesuré
117minishlab/potion-base-4Mminishlab🟢 Ouvert31,2 %29 octobre 2024✅ Mesuré
118Mihaiii/BulbasaurMihaiii🟢 Ouvert31,2 %27 avril 2024✅ Mesuré
119Mihaiii/WartortleMihaiii🟢 Ouvert31,1 %30 avril 2024✅ Mesuré
120Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert31,1 %17 novembre 2025✅ Mesuré
121minishlab/M2V_base_gloveminishlab🟢 Ouvert30,8 %21 septembre 2024✅ Mesuré
122sergeyzh/LaBSE-ru-turbosergeyzh🟢 Ouvert30,6 %27 juin 2024✅ Mesuré
123nomic-ai/nomic-embed-text-v1.5Nomic AI🟢 Ouvert30,6 %10 février 2024✅ Mesuré
124consciousAI/cai-lunaris-text-embeddingsconsciousAI🟢 Ouvert29,9 %22 juin 2023✅ Mesuré
125McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcseMcGill-NLP🟢 Ouvert29,8 %9 avril 2024✅ Mesuré
126Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert29,8 %17 novembre 2025✅ Mesuré
127brahmairesearch/slx-v0.1brahmairesearch🟢 Ouvert29,8 %13 août 2024✅ Mesuré
128deepfile/embedder-100pdeepfile🟢 Ouvert29,8 %24 juillet 2023✅ Mesuré
129abhinand/MedEmbed-small-v0.1abhinand🟢 Ouvert28,7 %20 octobre 2024✅ Mesuré
130bigscience/sgpt-bloom-7b1-msmarcobigscience🟢 Ouvert28,6 %26 août 2022✅ Mesuré
131minishlab/M2V_base_glove_subwordminishlab🟢 Ouvert28,4 %21 septembre 2024✅ Mesuré
132minishlab/M2V_base_outputminishlab🟢 Ouvert28,1 %21 septembre 2024✅ Mesuré
133sergeyzh/rubert-tiny-turbosergeyzh🟢 Ouvert27,4 %21 juin 2024✅ Mesuré
134minishlab/potion-base-2Mminishlab🟢 Ouvert27,2 %29 octobre 2024✅ Mesuré
135Mihaiii/gte-microMihaiii🟢 Ouvert27,1 %21 avril 2024✅ Mesuré
136minishlab/potion-multilingual-128Mminishlab🟢 Ouvert26,7 %23 mai 2025✅ Mesuré
137Mihaiii/SquirtleMihaiii🟢 Ouvert26,2 %30 avril 2024✅ Mesuré
138Mihaiii/VenusaurMihaiii🟢 Ouvert25,7 %29 avril 2024✅ Mesuré
139nvidia/NV-Embed-v2NVIDIA🟢 Ouvert25,4 %9 septembre 2024✅ Mesuré
140Sentence Transformers: all-MiniLM-L12-v2Sentence Transformers🟢 Ouvert25,3 %18 novembre 2025✅ Mesuré
141cointegrated/LaBSE-en-rucointegrated🟢 Ouvert24,1 %10 juin 2021✅ Mesuré
142deepvk/USER-basedeepvk🟢 Ouvert23,5 %10 juin 2024✅ Mesuré
143Omartificial-Intelligence-Space/Arabic-labse-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert22,9 %16 juin 2024✅ Mesuré
144sentence-transformers/LaBSESentence Transformers🟢 Ouvert21,9 %1 novembre 2019✅ Mesuré
145sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert21,7 %1 novembre 2019✅ Mesuré
146nvidia/NV-Embed-v1NVIDIA🟢 Ouvert21,2 %13 septembre 2024✅ Mesuré
147sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert20,9 %1 novembre 2019✅ Mesuré
148Omartificial-Intelligence-Space/Arabic-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert20,8 %14 juin 2024✅ Mesuré
149Gameselo/STS-multilingual-mpnet-base-v2Gameselo🟢 Ouvert19,7 %7 juin 2024✅ Mesuré
150omarelshehy/arabic-english-sts-matryoshkaomarelshehy🟢 Ouvert19,7 %13 octobre 2024✅ Mesuré
151Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert19,4 %15 juin 2024✅ Mesuré
152shibing624/text2vec-base-multilingualshibing624🟢 Ouvert17,9 %22 juin 2023✅ Mesuré
153Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert17,9 %25 juin 2024✅ Mesuré
154aari1995/German_Semantic_STS_V2aari1995🟢 Ouvert17,7 %17 novembre 2022✅ Mesuré
155cointegrated/rubert-tiny2cointegrated🟢 Ouvert14,1 %28 octobre 2021✅ Mesuré
156silma-ai/silma-embeddding-matryoshka-v0.1silma-ai🟢 Ouvert14,1 %12 octobre 2024✅ Mesuré
157Omartificial-Intelligence-Space/Arabert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert12,5 %16 juin 2024✅ Mesuré
158Omartificial-Intelligence-Space/Marbert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert9,1 %17 juin 2024✅ Mesuré
159DeepPavlov/distilrubert-small-cased-conversationalDeepPavlov🟢 Ouvert8,9 %28 juin 2022✅ Mesuré
160Jaume/gemma-2b-embeddingsJaume🟢 Ouvert8,8 %29 juin 2024✅ Mesuré
161DeepPavlov/rubert-base-cased-sentenceDeepPavlov🟢 Ouvert8,1 %4 mars 2020✅ Mesuré
162DeepPavlov/rubert-base-casedDeepPavlov🟢 Ouvert8,1 %4 mars 2020✅ Mesuré
163cointegrated/rubert-tinycointegrated🟢 Ouvert7,6 %24 mai 2021✅ Mesuré
164ai-forever/sbert_large_nlu_ruai-forever🟢 Ouvert6,9 %20 novembre 2020✅ Mesuré
165ai-forever/sbert_large_mt_nlu_ruai-forever🟢 Ouvert6,5 %18 mai 2021✅ Mesuré
166malenia1/ternary-weight-embeddingmalenia1🟢 Ouvert5,9 %23 octobre 2024✅ Mesuré
167jinaai/jina-embeddings-v2-small-enJina AI🟢 Ouvert5,5 %27 septembre 2023✅ Mesuré
168deepvk/deberta-v1-basedeepvk🟢 Ouvert4,4 %7 février 2023✅ Mesuré
169jinaai/jina-embeddings-v2-base-enJina AI🟢 Ouvert1,8 %27 septembre 2023✅ Mesuré

Classement établi sur 169 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 37,8 %.

Notre analyse

Un score nDCG@10 élevé indique que le modèle place plus efficacement les documents pertinents parmi ses dix premiers résultats, y compris lorsque l’information recherchée est répartie dans de longs contenus. Le meilleur résultat, obtenu par lightonai/GTE-ModernColBERT-v1, est nettement supérieur au score médian des 169 modèles recensés. Cet écart révèle une forte différenciation entre les systèmes et montre que la majorité reste loin de la performance de tête. Un score de 91 % se rapproche toutefois du plafond de la métrique, ce qui peut réduire la capacité du benchmark à départager de futures améliorations au sommet. La rigueur comparative doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure uniforme. L’accès public peut par ailleurs favoriser l’exposition préalable des modèles aux tâches, avec un risque de contamination des évaluations. Enfin, la portée demeure ciblée sur le retrieval long en anglais, à travers six tâches synthétiques et réelles. Ces résultats ne décrivent donc pas les autres capacités des modèles ni leur comportement dans d’autres langues.


Sources des scores : mteb.