AndroidWorld_SR
AndroidWorld_SR est un benchmark conçu par Google Research pour évaluer des agents autonomes multimodaux dans un environnement Android dynamique. Il confronte les systèmes à des tâches agentiques inspirées d’usages réels, telles que l’envoi de messages, la création d’événements ou la…
AndroidWorld_SR est un benchmark conçu par Google Research pour évaluer des agents autonomes multimodaux dans un environnement Android dynamique. Il confronte les systèmes à des tâches agentiques inspirées d’usages réels, telles que l’envoi de messages, la création d’événements ou la navigation dans des interfaces mobiles.
L’évaluation combine instructions en langage naturel, captures d’écran et arbres d’accessibilité. Elle mesure ainsi la capacité d’un agent à comprendre un objectif, percevoir l’état de l’interface et enchaîner correctement plusieurs actions jusqu’à l’accomplissement de la tâche.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google Research |
| Capacités mesurées | agents, généraliste, multimodal, raisonnement |
| Modalité | Multimodal |
| Type de questions | tâches agentiques sur appareil Android |
| Métrique d'évaluation | success rate |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais |
| Taille du jeu | 116 tâches programmatiques dans 20 applications Android |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,1 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,4 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,2 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,7 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,7 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 35,0 % | 26 janvier 2025 | Auto-déclaré |
| 7 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,5 % | 26 janvier 2025 | Auto-déclaré |
| 8 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 22,0 % | 28 février 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués. Score médian de l'ensemble : 63,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AndroidWorld_SR indique qu’un agent réussit fréquemment des tâches Android complètes, ce qui mobilise conjointement compréhension linguistique, perception multimodale, planification et exécution séquentielle. Le classement de la base place Qwen3.5-35B-A3B en tête à 71 %, tandis que la médiane des huit modèles évalués atteint 64 %. Cet écart relativement resserré entre la médiane et le meilleur score suggère une différenciation limitée au sommet de cet ensemble, sans saturation totale puisque les résultats restent éloignés de 100 %.
La portée du benchmark reste circonscrite aux tâches en anglais exécutées dans 20 applications Android. Son environnement dynamique et ses tâches programmatiques évaluent des interactions concrètes plutôt qu’une simple réponse textuelle, mais ils ne représentent qu’un périmètre particulier des usages agentiques mobiles. La comparaison doit aussi rester prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une campagne de mesure unique et indépendante. Cette modalité réduit l’homogénéité du classement et limite la force des écarts observés. Le caractère dynamique du dispositif réduit par ailleurs la dépendance à un questionnaire entièrement fixe, sans supprimer le risque général de contamination lié à un benchmark public.
Sources des scores : llm-stats.