Agents' Last Exam
Agents' Last Exam est un benchmark en anglais consacré aux agents d’IA confrontés à des tâches ouvertes, complexes et de longue durée. Il évalue leur aptitude à maintenir un raisonnement, élaborer un plan et mener une exécution jusqu’à son terme.
Agents' Last Exam est un benchmark en anglais consacré aux agents d’IA confrontés à des tâches ouvertes, complexes et de longue durée. Il évalue leur aptitude à maintenir un raisonnement, élaborer un plan et mener une exécution jusqu’à son terme.
Créé pour éprouver des capacités agentiques avancées, il accorde une place importante à l’utilisation d’outils. Les résultats avec et sans outils permettent d’examiner séparément l’autonomie intrinsèque des modèles et leur efficacité lorsqu’ils disposent de ressources externes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Capacités mesurées | agents, raisonnement, appels d'outils |
| Modalité | Texte |
| Type de questions | tâches agentiques ouvertes de longue durée |
| Métrique d'évaluation | taux de réussite, rapporté avec et sans accès aux outils |
| Langues | anglais |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 52,7 % | 9 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 50,4 % | 9 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 50,3 % | 9 juillet 2026 | Auto-déclaré |
| 4 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 41,4 % | 24 juin 2026 | Auto-déclaré |
| 5 | DeepSeek-V4-Flash-0731 | DeepSeek | 🟢 Ouvert | 25,2 % | 31 juillet 2026 | Auto-déclaré |
Classement établi sur 5 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 50,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent réussit fréquemment des tâches longues exigeant raisonnement soutenu, planification, exécution et, selon le protocole, utilisation d’outils. La distinction entre résultats avec et sans outils aide à déterminer dans quelle mesure la réussite dépend de ces outils. La lecture doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs, une méthode moins contrôlée qu’une mesure indépendante appliquée uniformément. Avec un meilleur résultat de 53 % et une médiane de 50 %, l’ensemble évalué ne paraît pas saturé, mais l’écart limité entre le sommet et le centre réduit la portée des différences observées. Une éventuelle contamination des tâches par les données d’entraînement pourrait aussi favoriser certains modèles. La portée demeure centrée sur des tâches agentiques ouvertes en anglais et ne résume donc pas toutes les capacités d’un modèle. Sur les cinq modèles de la base, le classement place GPT-5.6 Sol en tête, avec une avance modeste sur la performance médiane.
Sources des scores : llm-stats.