Code MTEB: Code est un benchmark public créé en 2024 par la communauté MTEB / embeddings-benchmark. Il évalue la qualité de récupération de code dans un large éventail de langages de programmation, à partir de requêtes formulées en anglais.
Code Information Retrieval MTEB: Code Information Retrieval est un benchmark public créé en 2024 par la CoIR team de Huawei Noah's Ark Lab. Il évalue la capacité des modèles à retrouver des informations pertinentes dans du code, à travers plusieurs langages de programmation et différents contextes techniques.
Dutch MTEB: Dutch est un benchmark communautaire créé par MTEB / embeddings-benchmark dans le cadre de MTEB-NL. Il évalue la qualité des embeddings de textes en néerlandais sur un ensemble diversifié de tâches, allant de la classification à la recherche, en passant par le clustering et la…
WMT23 WMT23 est un benchmark de traduction automatique créé en 2023 par la Conference on Machine Translation (WMT). Il évalue des systèmes dans plusieurs domaines, notamment la traduction générale, biomédicale et littéraire, ainsi que pour des langues peu dotées.
SWE-Lancer SWE-Lancer est un benchmark créé par OpenAI pour évaluer les grands modèles de langage sur des missions réelles d’ingénierie logicielle issues d’Upwork. Les tâches couvrent la correction de bugs, l’implémentation de fonctionnalités et la sélection de propositions techniques.
RULER RULER est un benchmark synthétique conçu par NVIDIA pour évaluer les modèles confrontés à de très longs contextes. Ses tâches en anglais couvrent la récupération d’information, le suivi multi-sauts, l’agrégation et la question-réponse, avec des réponses courtes ou structurées.
MMMU (validation) MMMU (validation), créé par Xiang Yue et al., est le jeu de validation d’un benchmark consacré à la compréhension et au raisonnement multimodaux de niveau universitaire. Il confronte les modèles à des questions associant texte et images dans un large éventail de disciplines.