ZEROBench-Sub

ZEROBench-Sub est un sous-ensemble de ZEROBench consacré à des sous-questions de raisonnement visuel. Publié en 2025 par les auteurs de ZeroBench, dont Jonathan Roberts et Mohammad Reza Taesiri à l’University of Cambridge, il cible des tâches particulièrement difficiles combinant…

ZEROBench-Sub est un sous-ensemble de ZEROBench consacré à des sous-questions de raisonnement visuel. Publié en 2025 par les auteurs de ZeroBench, dont Jonathan Roberts et Mohammad Reza Taesiri à l’University of Cambridge, il cible des tâches particulièrement difficiles combinant raisonnement visuel en plusieurs étapes et perception fine des images.

Ce benchmark public sert à comparer la capacité des modèles à extraire des détails visuels pertinents, puis à les articuler dans un raisonnement correct. L’évaluation repose sur l’exactitude des réponses à des questions formulées en anglais.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs ZeroBench (Jonathan Roberts, Mohammad Reza Taesiri et al., University of Cambridge)
Capacités mesuréesRaisonnement visuel multi-etapes tres difficile et perception fine sur images.
ModalitéImage
Type de questionsQuestions de raisonnement visuel (sous-questions)
Métrique d'évaluationExactitude (accuracy)
AccèsPublic
LanguesAnglais
Taille du jeu334 sous-questions (ZeroBench principal = 100 questions)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert36,2 %24 février 2026Auto-déclaré
2Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert36,2 %24 février 2026Auto-déclaré
3Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert34,4 %16 avril 2026Auto-déclaré
4Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert34,1 %24 février 2026Auto-déclaré
5Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert27,7 %22 septembre 2025Auto-déclaré

Classement établi sur 5 modèles évalués. Score médian de l'ensemble : 34,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ZEROBench-Sub indique qu’un modèle répond correctement à une plus grande proportion de sous-questions exigeant à la fois perception fine et raisonnement visuel en plusieurs étapes. Les résultats doivent toutefois être interprétés avec prudence, car ils sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le caractère public du jeu impose également de rester attentif au risque d’exposition préalable des modèles aux questions, susceptible d’influencer les scores.

Le classement disponible ne montre pas de saturation apparente. Qwen3.5-122B-A10B arrive en tête à 36 %, tandis que la médiane des cinq modèles évalués atteint 34 %. Ce faible écart entre le meilleur résultat et la médiane révèle des performances regroupées, sans domination très marquée dans cet échantillon. Les scores restent globalement modestes, ce qui reflète la difficulté du benchmark. Sa portée demeure ciblée : ZEROBench-Sub évalue 334 sous-questions visuelles en anglais et ne représente qu’un sous-ensemble du benchmark principal, composé de 100 questions.


Sources des scores : llm-stats.