DirectIA
  • Applications IA
  • Modèles
    • Modèles LLM
    • Modèles d'embeddings
    • Génération d'images
    • Génération de vidéos
    • Synthèse vocale (TTS)
    • Reconnaissance vocale (STT)
    • Génération de musique
    • Benchmarks
  • Hardware
    • Toutes les machines
    • Cartes graphiques
    • Mini-PC mémoire unifiée
    • Stations IA
    • Apple Silicon
    • PC à NPU
    • Serveurs & accélérateurs
  • Formation IA
  • Actualités

Benchmarks

C-Eval

C-Eval est une suite d’évaluation en chinois conçue par Y. Huang et al., au sein de HKUST NLP et avec plusieurs collaborateurs. Elle examine les connaissances disciplinaires et les capacités de raisonnement de modèles de fondation dans un contexte éducatif et professionnel chinois.
18 juil. 2026 à 23:05

Toolathlon

Toolathlon est un benchmark créé en 2025 par HKUST-NLP pour évaluer des agents d’IA confrontés à des tâches réalistes et longues nécessitant plusieurs outils. Les scénarios sollicitent différentes applications au fil d’interactions prolongées.
18 juil. 2026 à 23:02
DirectIA © 2026. Propulsé par Ghost