DirectIA
  • Applications IA
  • Modèles
    • Modèles LLM
    • Modèles d'embeddings
    • Génération d'images
    • Génération de vidéos
    • Synthèse vocale (TTS)
    • Reconnaissance vocale (STT)
    • Génération de musique
    • Benchmarks
  • Hardware
    • Toutes les machines
    • Cartes graphiques
    • Mini-PC mémoire unifiée
    • Stations IA
    • Apple Silicon
    • PC à NPU
    • Serveurs & accélérateurs
  • Formation IA
  • Actualités

Benchmarks

Arena-Hard v2

Arena-Hard v2 est un benchmark conçu en 2025 par LMArena, anciennement LMSYS, notamment par Tianle Li et Wei-Lin Chiang. Il rassemble des requêtes utilisateur réelles et difficiles issues de Chatbot Arena et de WildChat-1M.
18 juil. 2026 à 23:05

MT-Bench

MT-Bench est un benchmark publié en 2023 par LMSYS Org (Zheng et al.) pour évaluer les capacités conversationnelles des grands modèles de langage. Il repose sur des échanges ouverts en plusieurs tours, examinés par un autre LLM agissant comme juge.
18 juil. 2026 à 23:03

Arena Hard

Créé en 2024 par LMSYS / Chatbot Arena, Arena Hard est un benchmark public consacré aux modèles conversationnels instruction-tuned. Il rassemble des requêtes ouvertes difficiles issues de situations réelles, notamment en raisonnement, programmation, mathématiques, écriture et créativité.
18 juil. 2026 à 23:02
DirectIA © 2026. Propulsé par Ghost