ZEROBench

ZEROBench est un benchmark public créé par University of Cambridge et d’autres contributeurs pour éprouver la compréhension visuelle zero-shot. Il confronte les modèles à des problèmes particulièrement difficiles, formulés sous forme de questions ouvertes ou numériques portant sur des…

ZEROBench est un benchmark public créé par University of Cambridge et d’autres contributeurs pour éprouver la compréhension visuelle zero-shot. Il confronte les modèles à des problèmes particulièrement difficiles, formulés sous forme de questions ouvertes ou numériques portant sur des images.

Publié en 2025, il mesure le raisonnement visuel multimodal, l’interprétation fine des contenus et la cognition spatiale. Son rôle est de distinguer les modèles capables d’aller au-delà d’une reconnaissance superficielle, en évaluant leur aptitude à construire une réponse exacte à partir d’informations visuelles complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkUniversity of Cambridge (et al.)
Capacités mesuréesRaisonnement visuel multimodal de très haute difficulté, interprétation fine d'images et cognition spatiale
ModalitéImage
Type de questionsraisonnement visuel difficile (questions ouvertes / numériques sur images)
Métrique d'évaluationexactitude (accuracy), pass@1 et pass@5
AccèsPublic
Languesanglais
Taille du jeu100 questions principales + 334 sous-questions
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 TurboByteDance🔒 Propriétaire57,2 %24 juin 2026Auto-déclaré
2Seed 2.1 ProByteDance🔒 Propriétaire56,3 %24 juin 2026Auto-déclaré
3Kimi K3Moonshot AI▫ n.d.41,0 %16 juillet 2026Auto-déclaré
4Muse SparkMeta🔒 Propriétaire33,0 %8 avril 2026Auto-déclaré
5Kimi K2.5Moonshot AI🟢 Ouvert11,0 %27 janvier 2026Auto-déclaré
6Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert10,0 %24 février 2026Auto-déclaré
7Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert9,0 %24 février 2026Auto-déclaré
8Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert8,0 %24 février 2026Auto-déclaré
9Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert4,0 %22 septembre 2025Auto-déclaré

Classement établi sur 9 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 11,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ZEROBench traduit une forte capacité à interpréter précisément une image, à raisonner dans l’espace et à produire la bonne réponse sans exemple préalable. L’exactitude et le pass@1 évaluent la réussite immédiate, tandis que le pass@5 mesure la capacité à atteindre la réponse correcte parmi plusieurs tentatives. La comparaison doit toutefois rester prudente, car les résultats de la base sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un protocole de mesure indépendant et uniforme.

Le classement montre une forte dispersion des performances. Seed 2.1 Turbo atteint 57 %, alors que la médiane des huit modèles évalués s’établit à 11 %. Cet écart signale que le benchmark demeure loin d’une saturation générale et qu’il discrimine nettement les systèmes les plus performants. Sa portée reste ciblée sur le raisonnement visuel difficile en anglais, à partir de questions ouvertes ou numériques. Enfin, son accès public impose de considérer le risque de contamination lors de l’interprétation de futurs résultats, une exposition préalable aux questions pouvant fragiliser la valeur d’une évaluation présentée comme zero-shot.


Sources des scores : llm-stats.