OSWorld 2.0

OSWorld 2.0 est un benchmark conçu par XLang Lab et ses collaborateurs pour évaluer des agents multimodaux dans des situations réalistes d’utilisation d’un ordinateur. Il repose sur de longs workflows de bout en bout couvrant des tâches quotidiennes et professionnelles.

OSWorld 2.0 est un benchmark conçu par XLang Lab et ses collaborateurs pour évaluer des agents multimodaux dans des situations réalistes d’utilisation d’un ordinateur. Il repose sur de longs workflows de bout en bout couvrant des tâches quotidiennes et professionnelles.

Le benchmark mesure notamment la planification d’actions, la manipulation de plusieurs applications, le croisement de sources et l’inférence d’états implicites dans des environnements dynamiques. Il sert ainsi à apprécier la capacité des modèles à mener une tâche complexe jusqu’à son achèvement effectif.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkXLang Lab et collaborateurs
Capacités mesuréesagents, généraliste, multimodal, vision
ModalitéMultimodal
Type de questionstâches agentiques multimodales de contrôle d’ordinateur, sous forme de workflows longs de bout en bout
Métrique d'évaluationtaux de réussite fondé sur l’achèvement binaire de chaque workflow
Languesanglais
Taille du jeu108 workflows

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 5Anthropic🔒 Propriétaire70,6 %24 juillet 2026Auto-déclaré
2GPT-5.6 SolOpenAI🔒 Propriétaire62,6 %9 juillet 2026Auto-déclaré
3GPT-5.6 TerraOpenAI🔒 Propriétaire50,2 %9 juillet 2026Auto-déclaré
4GPT-5.6 LunaOpenAI🔒 Propriétaire45,6 %9 juillet 2026Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 56,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent achève correctement une forte proportion des workflows, et pas seulement certaines étapes intermédiaires. Cette exigence rend l’évaluation stricte, mais la métrique binaire ne distingue pas un échec précoce d’un workflow presque terminé. La lecture du classement appelle aussi de la prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure entièrement indépendante. Avec 71 %, Claude Opus 5 domine les quatre modèles recensés et dépasse de 15 points le score médian de 56 %. Cet écart révèle une avance nette sur cet ensemble précis, tandis que le meilleur résultat reste éloigné d’un taux de réussite total, ce qui ne signale pas de saturation apparente. La portée demeure toutefois circonscrite à 108 workflows en anglais centrés sur le contrôle d’ordinateur. Les résultats ne doivent donc pas être généralisés à d’autres langues ou capacités. Enfin, une éventuelle contamination doit rester un point de vigilance, sans être confondue avec une performance effectivement observée sur des tâches nouvelles.


Sources des scores : llm-stats.