OSWorld 2.0
OSWorld 2.0 est un benchmark conçu par XLang Lab et ses collaborateurs pour évaluer des agents multimodaux dans des situations réalistes d’utilisation d’un ordinateur. Il repose sur de longs workflows de bout en bout couvrant des tâches quotidiennes et professionnelles.
OSWorld 2.0 est un benchmark conçu par XLang Lab et ses collaborateurs pour évaluer des agents multimodaux dans des situations réalistes d’utilisation d’un ordinateur. Il repose sur de longs workflows de bout en bout couvrant des tâches quotidiennes et professionnelles.
Le benchmark mesure notamment la planification d’actions, la manipulation de plusieurs applications, le croisement de sources et l’inférence d’états implicites dans des environnements dynamiques. Il sert ainsi à apprécier la capacité des modèles à mener une tâche complexe jusqu’à son achèvement effectif.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | XLang Lab et collaborateurs |
| Capacités mesurées | agents, généraliste, multimodal, vision |
| Modalité | Multimodal |
| Type de questions | tâches agentiques multimodales de contrôle d’ordinateur, sous forme de workflows longs de bout en bout |
| Métrique d'évaluation | taux de réussite fondé sur l’achèvement binaire de chaque workflow |
| Langues | anglais |
| Taille du jeu | 108 workflows |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 🔒 Propriétaire | 70,6 % | 24 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 62,6 % | 9 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 50,2 % | 9 juillet 2026 | Auto-déclaré |
| 4 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 45,6 % | 9 juillet 2026 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 56,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent achève correctement une forte proportion des workflows, et pas seulement certaines étapes intermédiaires. Cette exigence rend l’évaluation stricte, mais la métrique binaire ne distingue pas un échec précoce d’un workflow presque terminé. La lecture du classement appelle aussi de la prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure entièrement indépendante. Avec 71 %, Claude Opus 5 domine les quatre modèles recensés et dépasse de 15 points le score médian de 56 %. Cet écart révèle une avance nette sur cet ensemble précis, tandis que le meilleur résultat reste éloigné d’un taux de réussite total, ce qui ne signale pas de saturation apparente. La portée demeure toutefois circonscrite à 108 workflows en anglais centrés sur le contrôle d’ordinateur. Les résultats ne doivent donc pas être généralisés à d’autres langues ou capacités. Enfin, une éventuelle contamination doit rester un point de vigilance, sans être confondue avec une performance effectivement observée sur des tâches nouvelles.
Sources des scores : llm-stats.