OSWorld

OSWorld est un benchmark créé en 2024 par Tianbao Xie et al., au sein de XLang Lab et avec plusieurs collaborateurs. Il propose des tâches agentiques interactives réalisées dans de véritables environnements informatiques sous Ubuntu, Windows et macOS.

OSWorld est un benchmark créé en 2024 par Tianbao Xie et al., au sein de XLang Lab et avec plusieurs collaborateurs. Il propose des tâches agentiques interactives réalisées dans de véritables environnements informatiques sous Ubuntu, Windows et macOS.

Il évalue la capacité d’agents multimodaux à comprendre l’écran, à planifier une procédure et à exécuter des actions dans des applications web et bureautiques réelles. Son évaluation fondée sur l’exécution vise ainsi à mesurer le comportement opérationnel des modèles, notamment lors de manipulations de fichiers et de workflows impliquant plusieurs applications.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkTianbao Xie et al. (XLang Lab et collaborateurs)
Capacités mesuréesagents, généraliste, multimodal, vision
ModalitéMultimodal
Type de questionstâches agentiques interactives sur ordinateur réel
Métrique d'évaluationsuccess rate / taux de réussite des tâches
AccèsPublic
Languesanglais
Taille du jeu369 tâches
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (20)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 ProByteDance🔒 Propriétaire78,8 %24 juin 2026Auto-déclaré
2Seed 2.1 TurboByteDance🔒 Propriétaire76,4 %24 juin 2026Auto-déclaré
3Claude Opus 4.6Anthropic🔒 Propriétaire72,7 %5 février 2026Auto-déclaré
4Claude Sonnet 4.6Anthropic🔒 Propriétaire72,5 %17 février 2026Auto-déclaré
5Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert66,7 %22 septembre 2025Auto-déclaré
6Claude Opus 4.5Anthropic🔒 Propriétaire66,3 %24 novembre 2025Auto-déclaré
7GLM-5V-TurboZhipu AI🔒 Propriétaire62,3 %2 avril 2026Auto-déclaré
8Claude Sonnet 4.5Anthropic🔒 Propriétaire61,4 %29 septembre 2025Auto-déclaré
9Claude Haiku 4.5Anthropic🔒 Propriétaire50,7 %15 octobre 2025Auto-déclaré
10Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert41,0 %22 septembre 2025Auto-déclaré
11Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert38,1 %22 septembre 2025Auto-déclaré
12Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert33,9 %22 septembre 2025Auto-déclaré
13Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert33,9 %22 septembre 2025Auto-déclaré
14Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert32,6 %22 septembre 2025Auto-déclaré
15Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert31,4 %22 septembre 2025Auto-déclaré
16Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert30,6 %22 septembre 2025Auto-déclaré
17Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert30,3 %22 septembre 2025Auto-déclaré
18Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert26,2 %22 septembre 2025Auto-déclaré
19Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert8,8 %26 janvier 2025Auto-déclaré
20Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert5,9 %28 février 2025Auto-déclaré

Classement établi sur 20 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 39,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé dans OSWorld indique qu’un agent réussit une forte proportion de tâches informatiques complètes, depuis l’interprétation visuelle de l’écran jusqu’à l’exécution des actions prévues. Cette métrique mesure un résultat concret plutôt qu’une réponse isolée. La fiabilité comparative doit néanmoins être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, et non tous établis dans un même processus de mesure indépendant.

Le classement montre un écart important entre la médiane de 40 % et Seed 2.1 Pro, en tête à 79 %. Ce niveau maximal laisse encore une marge d’échec notable et ne signale donc pas une saturation complète du benchmark. La portée reste circonscrite à 369 tâches en anglais, couvrant des applications web et de bureau sur trois systèmes d’exploitation. Son accès public facilite la comparaison et l’apprentissage interactif, mais peut aussi accroître le risque que les tâches soient connues des modèles ou de leurs concepteurs. OSWorld renseigne ainsi surtout sur l’efficacité agentique dans les environnements informatiques qu’il couvre.


Sources des scores : llm-stats.