AndroidWorld_SR

AndroidWorld_SR est un benchmark conçu par Google Research pour évaluer des agents autonomes multimodaux dans un environnement Android dynamique. Il confronte les systèmes à des tâches agentiques inspirées d’usages réels, telles que l’envoi de messages, la création d’événements ou la…

AndroidWorld_SR est un benchmark conçu par Google Research pour évaluer des agents autonomes multimodaux dans un environnement Android dynamique. Il confronte les systèmes à des tâches agentiques inspirées d’usages réels, telles que l’envoi de messages, la création d’événements ou la navigation dans des interfaces mobiles.

L’évaluation combine instructions en langage naturel, captures d’écran et arbres d’accessibilité. Elle mesure ainsi la capacité d’un agent à comprendre un objectif, percevoir l’état de l’interface et enchaîner correctement plusieurs actions jusqu’à l’accomplissement de la tâche.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle Research
Capacités mesuréesagents, généraliste, multimodal, raisonnement
ModalitéMultimodal
Type de questionstâches agentiques sur appareil Android
Métrique d'évaluationsuccess rate
AccèsPublic
LicenceApache-2.0
Languesanglais
Taille du jeu116 tâches programmatiques dans 20 applications Android
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert71,1 %24 février 2026Auto-déclaré
2Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert66,4 %24 février 2026Auto-déclaré
3Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert64,2 %24 février 2026Auto-déclaré
4Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,7 %22 septembre 2025Auto-déclaré
5Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert63,7 %22 septembre 2025Auto-déclaré
6Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert35,0 %26 janvier 2025Auto-déclaré
7Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert25,5 %26 janvier 2025Auto-déclaré
8Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert22,0 %28 février 2025Auto-déclaré

Classement établi sur 8 modèles évalués. Score médian de l'ensemble : 63,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur AndroidWorld_SR indique qu’un agent réussit fréquemment des tâches Android complètes, ce qui mobilise conjointement compréhension linguistique, perception multimodale, planification et exécution séquentielle. Le classement de la base place Qwen3.5-35B-A3B en tête à 71 %, tandis que la médiane des huit modèles évalués atteint 64 %. Cet écart relativement resserré entre la médiane et le meilleur score suggère une différenciation limitée au sommet de cet ensemble, sans saturation totale puisque les résultats restent éloignés de 100 %.

La portée du benchmark reste circonscrite aux tâches en anglais exécutées dans 20 applications Android. Son environnement dynamique et ses tâches programmatiques évaluent des interactions concrètes plutôt qu’une simple réponse textuelle, mais ils ne représentent qu’un périmètre particulier des usages agentiques mobiles. La comparaison doit aussi rester prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une campagne de mesure unique et indépendante. Cette modalité réduit l’homogénéité du classement et limite la force des écarts observés. Le caractère dynamique du dispositif réduit par ailleurs la dépendance à un questionnaire entièrement fixe, sans supprimer le risque général de contamination lié à un benchmark public.


Sources des scores : llm-stats.