OSWorld-Verified

OSWorld-Verified est un sous-ensemble vérifié d’OSWorld, conçu en 2025 par XLang Lab, à l’University of Hong Kong. Il propose un environnement informatique réel et évolutif dans lequel des agents multimodaux accomplissent des tâches ouvertes sur Ubuntu, Windows et macOS.

OSWorld-Verified est un sous-ensemble vérifié d’OSWorld, conçu en 2025 par XLang Lab, à l’University of Hong Kong. Il propose un environnement informatique réel et évolutif dans lequel des agents multimodaux accomplissent des tâches ouvertes sur Ubuntu, Windows et macOS.

Le benchmark mesure la capacité à comprendre une interface graphique, naviguer entre plusieurs applications, manipuler des fichiers et exécuter des workflows concrets. Il sert ainsi à évaluer des modèles au-delà de la génération de réponses, en observant leur aptitude à agir, se configurer et apprendre de manière interactive.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkXLang Lab (University of Hong Kong)
Capacités mesuréesExécution de tâches multi-applications dans un vrai environnement OS (Ubuntu, Windows, macOS) : grounding GUI, workflows réels, configuration et apprentissage interactif.
ModalitéMultimodal
Type de questionsTâches informatiques ouvertes pour agents multimodaux (navigation GUI, apps réelles, I/O fichiers)
Métrique d'évaluationTaux de succès basé sur l'exécution (scripts d'évaluation par tâche)
AccèsPublic
LicenceApache-2.0
Languesanglais (interfaces)
Taille du jeu369 tâches (OSWorld) ; OSWorld-Verified = sous-ensemble vérifié
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (19)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire85,0 %9 juin 2026Auto-déclaré
2Claude Opus 4.8Anthropic🔒 Propriétaire83,4 %28 mai 2026Auto-déclaré
3Claude Sonnet 5Anthropic🔒 Propriétaire81,2 %30 juin 2026Auto-déclaré
4Muse Spark 1.1Meta🔒 Propriétaire80,8 %9 juillet 2026Auto-déclaré
5Claude Mythos PreviewAnthropic🔒 Propriétaire79,6 %Auto-déclaré
6GPT-5.5OpenAI🔒 Propriétaire78,7 %23 avril 2026Auto-déclaré
7Gemini 3.5 FlashGoogle🔒 Propriétaire78,4 %19 mai 2026Auto-déclaré
8Claude Opus 4.7Anthropic🔒 Propriétaire78,0 %16 avril 2026Auto-déclaré
9GPT-4.5OpenAI🔒 Propriétaire75,0 %5 mars 2026Auto-déclaré
10Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire73,3 %31 mai 2026Auto-déclaré
11Kimi K2.6Moonshot AI🟢 Ouvert73,1 %20 avril 2026Auto-déclaré
12GPT-5.4 miniOpenAI🔒 Propriétaire72,1 %17 mars 2026Auto-déclaré
13MiniMax M3MiniMax🟢 Ouvert70,1 %1 juin 2026Auto-déclaré
14GPT-5.3 CodexOpenAI🔒 Propriétaire64,7 %5 février 2026Auto-déclaré
15Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire62,5 %31 mars 2026Auto-déclaré
16Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert58,0 %24 février 2026Auto-déclaré
17Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert56,2 %24 février 2026Auto-déclaré
18Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert54,5 %24 février 2026Auto-déclaré
19GPT-5.4 nanoOpenAI🔒 Propriétaire39,0 %17 mars 2026Auto-déclaré

Classement établi sur 19 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 73,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent réussit fréquemment les tâches demandées dans leur environnement réel, selon des scripts d’évaluation propres à chaque tâche. Cette mesure fondée sur l’exécution apporte davantage de rigueur qu’une appréciation textuelle du résultat. Toutefois, les scores de la base étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend aussi des conditions de test et de la fidélité des déclarations.

Le classement montre un niveau global déjà élevé parmi les 18 modèles évalués, avec une médiane de 73 % et Claude Fable 5 en tête à 85 %. Cet écart laisse encore une marge de progression, même si des scores concentrés dans le haut de l’échelle peuvent progressivement réduire le pouvoir discriminant du benchmark. Son accès public appelle également à considérer le risque de contamination lors de l’interprétation des performances. Enfin, sa portée reste centrée sur des tâches informatiques ouvertes, des interfaces en anglais et des workflows GUI multi-applications sur les trois systèmes pris en charge. Il évalue donc l’action dans un OS réel, plutôt que l’ensemble des capacités générales d’un modèle.


Sources des scores : llm-stats.