OSWorld-Verified
OSWorld-Verified est un sous-ensemble vérifié d’OSWorld, conçu en 2025 par XLang Lab, à l’University of Hong Kong. Il propose un environnement informatique réel et évolutif dans lequel des agents multimodaux accomplissent des tâches ouvertes sur Ubuntu, Windows et macOS.
OSWorld-Verified est un sous-ensemble vérifié d’OSWorld, conçu en 2025 par XLang Lab, à l’University of Hong Kong. Il propose un environnement informatique réel et évolutif dans lequel des agents multimodaux accomplissent des tâches ouvertes sur Ubuntu, Windows et macOS.
Le benchmark mesure la capacité à comprendre une interface graphique, naviguer entre plusieurs applications, manipuler des fichiers et exécuter des workflows concrets. Il sert ainsi à évaluer des modèles au-delà de la génération de réponses, en observant leur aptitude à agir, se configurer et apprendre de manière interactive.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | XLang Lab (University of Hong Kong) |
| Capacités mesurées | Exécution de tâches multi-applications dans un vrai environnement OS (Ubuntu, Windows, macOS) : grounding GUI, workflows réels, configuration et apprentissage interactif. |
| Modalité | Multimodal |
| Type de questions | Tâches informatiques ouvertes pour agents multimodaux (navigation GUI, apps réelles, I/O fichiers) |
| Métrique d'évaluation | Taux de succès basé sur l'exécution (scripts d'évaluation par tâche) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais (interfaces) |
| Taille du jeu | 369 tâches (OSWorld) ; OSWorld-Verified = sous-ensemble vérifié |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (19)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 85,0 % | 9 juin 2026 | Auto-déclaré |
| 2 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 83,4 % | 28 mai 2026 | Auto-déclaré |
| 3 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 81,2 % | 30 juin 2026 | Auto-déclaré |
| 4 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 80,8 % | 9 juillet 2026 | Auto-déclaré |
| 5 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 79,6 % | — | Auto-déclaré |
| 6 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 78,7 % | 23 avril 2026 | Auto-déclaré |
| 7 | Gemini 3.5 Flash | 🔒 Propriétaire | 78,4 % | 19 mai 2026 | Auto-déclaré | |
| 8 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 78,0 % | 16 avril 2026 | Auto-déclaré |
| 9 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 75,0 % | 5 mars 2026 | Auto-déclaré |
| 10 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 73,3 % | 31 mai 2026 | Auto-déclaré |
| 11 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 73,1 % | 20 avril 2026 | Auto-déclaré |
| 12 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 72,1 % | 17 mars 2026 | Auto-déclaré |
| 13 | MiniMax M3 | MiniMax | 🟢 Ouvert | 70,1 % | 1 juin 2026 | Auto-déclaré |
| 14 | GPT-5.3 Codex | OpenAI | 🔒 Propriétaire | 64,7 % | 5 février 2026 | Auto-déclaré |
| 15 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 62,5 % | 31 mars 2026 | Auto-déclaré |
| 16 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,0 % | 24 février 2026 | Auto-déclaré |
| 17 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,2 % | 24 février 2026 | Auto-déclaré |
| 18 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,5 % | 24 février 2026 | Auto-déclaré |
| 19 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 39,0 % | 17 mars 2026 | Auto-déclaré |
Classement établi sur 19 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 73,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent réussit fréquemment les tâches demandées dans leur environnement réel, selon des scripts d’évaluation propres à chaque tâche. Cette mesure fondée sur l’exécution apporte davantage de rigueur qu’une appréciation textuelle du résultat. Toutefois, les scores de la base étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend aussi des conditions de test et de la fidélité des déclarations.
Le classement montre un niveau global déjà élevé parmi les 18 modèles évalués, avec une médiane de 73 % et Claude Fable 5 en tête à 85 %. Cet écart laisse encore une marge de progression, même si des scores concentrés dans le haut de l’échelle peuvent progressivement réduire le pouvoir discriminant du benchmark. Son accès public appelle également à considérer le risque de contamination lors de l’interprétation des performances. Enfin, sa portée reste centrée sur des tâches informatiques ouvertes, des interfaces en anglais et des workflows GUI multi-applications sur les trois systèmes pris en charge. Il évalue donc l’action dans un OS réel, plutôt que l’ensemble des capacités générales d’un modèle.
Sources des scores : llm-stats.