Medical MTEB: Medical est un benchmark public créé en 2025 par MTEB / MMTEB (embeddings-benchmark). Il évalue la recherche d’information médicale dans des contenus cliniques, biomédicaux et destinés au grand public.
Long-context Retrieval MTEB: Long-context Retrieval est un benchmark consacré à la recherche d’information dans des documents longs. Créé par les auteurs de LongEmbed, Dawei Zhu et al., puis intégré à MTEB, il associe des tâches synthétiques et réelles afin d’examiner des contextes de longueur variable où…
SQuALITY SQuALITY est un benchmark de compréhension de longs documents et de résumé abstrait orienté question. Il s’appuie sur des nouvelles du domaine public, lues puis résumées à partir de zéro par des contributeurs qualifiés, afin de produire des synthèses originales, fidèles et centrées sur…
Multilingual MMLU Multilingual MMLU est un benchmark public conçu par les auteurs de MMLU-ProX, Weihao Xuan et al., et publié en 2025. Héritier de MMLU-Pro, il repose sur des questions à choix multiple exigeantes, centrées sur le raisonnement et les connaissances académiques multidisciplinaires.
BFCL v2 BFCL v2 est un benchmark créé en 2024 par Berkeley Gorilla, à l’UC Berkeley, pour évaluer les capacités d’appel de fonctions des grands modèles de langage. Il s’appuie sur des scénarios issus de fonctions d’entreprise, de projets open source et de contributions d’utilisateurs.
GDP.pdf GDP.pdf est un benchmark de vision consacré au travail intellectuel à valeur économique. Il soumet les modèles à des tâches professionnelles présentées sous forme de documents visuels, notamment des PDF, afin d’évaluer leur capacité à exploiter des informations structurées.
FLEURS FLEURS, créé par Google Research en 2022, est un jeu de données vocales parallèles fondé sur FLoRes-101. Il rassemble des enregistrements multilingues accompagnés de transcriptions et d’étiquettes afin d’évaluer le traitement automatique de la parole dans un large éventail linguistique.