ZEROBench
ZEROBench est un benchmark public créé par University of Cambridge et d’autres contributeurs pour éprouver la compréhension visuelle zero-shot. Il confronte les modèles à des problèmes particulièrement difficiles, formulés sous forme de questions ouvertes ou numériques portant sur des…
ZEROBench est un benchmark public créé par University of Cambridge et d’autres contributeurs pour éprouver la compréhension visuelle zero-shot. Il confronte les modèles à des problèmes particulièrement difficiles, formulés sous forme de questions ouvertes ou numériques portant sur des images.
Publié en 2025, il mesure le raisonnement visuel multimodal, l’interprétation fine des contenus et la cognition spatiale. Son rôle est de distinguer les modèles capables d’aller au-delà d’une reconnaissance superficielle, en évaluant leur aptitude à construire une réponse exacte à partir d’informations visuelles complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | University of Cambridge (et al.) |
| Capacités mesurées | Raisonnement visuel multimodal de très haute difficulté, interprétation fine d'images et cognition spatiale |
| Modalité | Image |
| Type de questions | raisonnement visuel difficile (questions ouvertes / numériques sur images) |
| Métrique d'évaluation | exactitude (accuracy), pass@1 et pass@5 |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 100 questions principales + 334 sous-questions |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 57,2 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 56,3 % | 24 juin 2026 | Auto-déclaré |
| 3 | Kimi K3 | Moonshot AI | ▫ n.d. | 41,0 % | 16 juillet 2026 | Auto-déclaré |
| 4 | Muse Spark | Meta | 🔒 Propriétaire | 33,0 % | 8 avril 2026 | Auto-déclaré |
| 5 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 11,0 % | 27 janvier 2026 | Auto-déclaré |
| 6 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 10,0 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 9,0 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,0 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 4,0 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 11,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ZEROBench traduit une forte capacité à interpréter précisément une image, à raisonner dans l’espace et à produire la bonne réponse sans exemple préalable. L’exactitude et le pass@1 évaluent la réussite immédiate, tandis que le pass@5 mesure la capacité à atteindre la réponse correcte parmi plusieurs tentatives. La comparaison doit toutefois rester prudente, car les résultats de la base sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un protocole de mesure indépendant et uniforme.
Le classement montre une forte dispersion des performances. Seed 2.1 Turbo atteint 57 %, alors que la médiane des huit modèles évalués s’établit à 11 %. Cet écart signale que le benchmark demeure loin d’une saturation générale et qu’il discrimine nettement les systèmes les plus performants. Sa portée reste ciblée sur le raisonnement visuel difficile en anglais, à partir de questions ouvertes ou numériques. Enfin, son accès public impose de considérer le risque de contamination lors de l’interprétation de futurs résultats, une exposition préalable aux questions pouvant fragiliser la valeur d’une évaluation présentée comme zero-shot.
Sources des scores : llm-stats.