DirectIA
  • Applications IA
  • Modèles
    • Modèles LLM
    • Modèles d'embeddings
    • Génération d'images
    • Génération de vidéos
    • Synthèse vocale (TTS)
    • Reconnaissance vocale (STT)
    • Génération de musique
    • Benchmarks
  • Hardware
    • Toutes les machines
    • Cartes graphiques
    • Mini-PC mémoire unifiée
    • Stations IA
    • Apple Silicon
    • PC à NPU
    • Serveurs & accélérateurs
  • Formation IA
  • Actualités

Benchmarks

Multi-Challenge

Multi-Challenge est un benchmark créé en 2025 par l’équipe SEAL de Scale AI, au sein de Scale Labs. Il évalue les modèles dans des conversations réalistes et contextuellement complexes, portant notamment sur la planification de voyages, la documentation technique et la communication…
18 juil. 2026 à 23:02

MCP Atlas

Créé par Scale AI en 2026, MCP Atlas évalue la capacité des modèles d’IA à utiliser des outils à grande échelle dans des scénarios agentiques complexes. Les tâches imposent un raisonnement en plusieurs étapes et la coordination de plusieurs serveurs et outils réels au moyen du protocole…
18 juil. 2026 à 23:02

SWE-Bench Pro

SWE-Bench Pro est un benchmark créé en 2025 par Xiang Deng et ses coauteurs chez Scale AI. Version avancée de SWE-Bench, il évalue des modèles de langage confrontés à des problèmes réels de génie logiciel, formulés en anglais et accompagnés de code.
18 juil. 2026 à 23:02

Humanity's Last Exam

Humanity's Last Exam est un benchmark académique multimodal créé en 2025 par le Center for AI Safety (CAIS) et Scale AI. Il confronte les modèles à des questions expertes en mathématiques, sciences naturelles et sciences humaines, avec des solutions conçues pour être vérifiables et sans…
18 juil. 2026 à 23:01
DirectIA © 2026. Propulsé par Ghost