Multi-Challenge
Multi-Challenge est un benchmark créé en 2025 par l’équipe SEAL de Scale AI, au sein de Scale Labs. Il évalue les modèles dans des conversations réalistes et contextuellement complexes, portant notamment sur la planification de voyages, la documentation technique et la communication…