Arena-Hard v2 Arena-Hard v2 est un benchmark conçu en 2025 par LMArena, anciennement LMSYS, notamment par Tianle Li et Wei-Lin Chiang. Il rassemble des requêtes utilisateur réelles et difficiles issues de Chatbot Arena et de WildChat-1M.
MT-Bench MT-Bench est un benchmark publié en 2023 par LMSYS Org (Zheng et al.) pour évaluer les capacités conversationnelles des grands modèles de langage. Il repose sur des échanges ouverts en plusieurs tours, examinés par un autre LLM agissant comme juge.
Arena Hard Créé en 2024 par LMSYS / Chatbot Arena, Arena Hard est un benchmark public consacré aux modèles conversationnels instruction-tuned. Il rassemble des requêtes ouvertes difficiles issues de situations réelles, notamment en raisonnement, programmation, mathématiques, écriture et créativité.