ZEROBench-Sub
ZEROBench-Sub est un sous-ensemble de ZEROBench consacré à des sous-questions de raisonnement visuel. Publié en 2025 par les auteurs de ZeroBench, dont Jonathan Roberts et Mohammad Reza Taesiri à l’University of Cambridge, il cible des tâches particulièrement difficiles combinant…
ZEROBench-Sub est un sous-ensemble de ZEROBench consacré à des sous-questions de raisonnement visuel. Publié en 2025 par les auteurs de ZeroBench, dont Jonathan Roberts et Mohammad Reza Taesiri à l’University of Cambridge, il cible des tâches particulièrement difficiles combinant raisonnement visuel en plusieurs étapes et perception fine des images.
Ce benchmark public sert à comparer la capacité des modèles à extraire des détails visuels pertinents, puis à les articuler dans un raisonnement correct. L’évaluation repose sur l’exactitude des réponses à des questions formulées en anglais.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs ZeroBench (Jonathan Roberts, Mohammad Reza Taesiri et al., University of Cambridge) |
| Capacités mesurées | Raisonnement visuel multi-etapes tres difficile et perception fine sur images. |
| Modalité | Image |
| Type de questions | Questions de raisonnement visuel (sous-questions) |
| Métrique d'évaluation | Exactitude (accuracy) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 334 sous-questions (ZeroBench principal = 100 questions) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 36,2 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 36,2 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 34,4 % | 16 avril 2026 | Auto-déclaré |
| 4 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 34,1 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 27,7 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 5 modèles évalués. Score médian de l'ensemble : 34,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ZEROBench-Sub indique qu’un modèle répond correctement à une plus grande proportion de sous-questions exigeant à la fois perception fine et raisonnement visuel en plusieurs étapes. Les résultats doivent toutefois être interprétés avec prudence, car ils sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le caractère public du jeu impose également de rester attentif au risque d’exposition préalable des modèles aux questions, susceptible d’influencer les scores.
Le classement disponible ne montre pas de saturation apparente. Qwen3.5-122B-A10B arrive en tête à 36 %, tandis que la médiane des cinq modèles évalués atteint 34 %. Ce faible écart entre le meilleur résultat et la médiane révèle des performances regroupées, sans domination très marquée dans cet échantillon. Les scores restent globalement modestes, ce qui reflète la difficulté du benchmark. Sa portée demeure ciblée : ZEROBench-Sub évalue 334 sous-questions visuelles en anglais et ne représente qu’un sous-ensemble du benchmark principal, composé de 100 questions.
Sources des scores : llm-stats.