OSWorld
OSWorld est un benchmark créé en 2024 par Tianbao Xie et al., au sein de XLang Lab et avec plusieurs collaborateurs. Il propose des tâches agentiques interactives réalisées dans de véritables environnements informatiques sous Ubuntu, Windows et macOS.
OSWorld est un benchmark créé en 2024 par Tianbao Xie et al., au sein de XLang Lab et avec plusieurs collaborateurs. Il propose des tâches agentiques interactives réalisées dans de véritables environnements informatiques sous Ubuntu, Windows et macOS.
Il évalue la capacité d’agents multimodaux à comprendre l’écran, à planifier une procédure et à exécuter des actions dans des applications web et bureautiques réelles. Son évaluation fondée sur l’exécution vise ainsi à mesurer le comportement opérationnel des modèles, notamment lors de manipulations de fichiers et de workflows impliquant plusieurs applications.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Tianbao Xie et al. (XLang Lab et collaborateurs) |
| Capacités mesurées | agents, généraliste, multimodal, vision |
| Modalité | Multimodal |
| Type de questions | tâches agentiques interactives sur ordinateur réel |
| Métrique d'évaluation | success rate / taux de réussite des tâches |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 369 tâches |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (20)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 78,8 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 76,4 % | 24 juin 2026 | Auto-déclaré |
| 3 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 72,7 % | 5 février 2026 | Auto-déclaré |
| 4 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 72,5 % | 17 février 2026 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,7 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 66,3 % | 24 novembre 2025 | Auto-déclaré |
| 7 | GLM-5V-Turbo | Zhipu AI | 🔒 Propriétaire | 62,3 % | 2 avril 2026 | Auto-déclaré |
| 8 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 61,4 % | 29 septembre 2025 | Auto-déclaré |
| 9 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 50,7 % | 15 octobre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,0 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 38,1 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 33,9 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 33,9 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 32,6 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 31,4 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 30,6 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 30,3 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 26,2 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,8 % | 26 janvier 2025 | Auto-déclaré |
| 20 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 5,9 % | 28 février 2025 | Auto-déclaré |
Classement établi sur 20 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 39,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé dans OSWorld indique qu’un agent réussit une forte proportion de tâches informatiques complètes, depuis l’interprétation visuelle de l’écran jusqu’à l’exécution des actions prévues. Cette métrique mesure un résultat concret plutôt qu’une réponse isolée. La fiabilité comparative doit néanmoins être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, et non tous établis dans un même processus de mesure indépendant.
Le classement montre un écart important entre la médiane de 40 % et Seed 2.1 Pro, en tête à 79 %. Ce niveau maximal laisse encore une marge d’échec notable et ne signale donc pas une saturation complète du benchmark. La portée reste circonscrite à 369 tâches en anglais, couvrant des applications web et de bureau sur trois systèmes d’exploitation. Son accès public facilite la comparaison et l’apprentissage interactif, mais peut aussi accroître le risque que les tâches soient connues des modèles ou de leurs concepteurs. OSWorld renseigne ainsi surtout sur l’efficacité agentique dans les environnements informatiques qu’il couvre.
Sources des scores : llm-stats.