CountBench
CountBench est un benchmark conçu par Google Research et le Weizmann Institute of Science pour évaluer le comptage d’objets dans des images. Il examine la capacité des modèles à relier le contenu visuel à une compréhension quantitative exprimée en langage.
CountBench est un benchmark conçu par Google Research et le Weizmann Institute of Science pour évaluer le comptage d’objets dans des images. Il examine la capacité des modèles à relier le contenu visuel à une compréhension quantitative exprimée en langage.
Publié en 2023, il sert à mesurer une compétence ciblée des systèmes de vision-langage : identifier correctement combien d’instances d’un objet apparaissent dans une image. Il permet ainsi de comparer les modèles sur une tâche visuelle dont la réponse attendue est exacte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google Research / Weizmann Institute of Science |
| Capacités mesurées | Comptage d'objets dans une image, compréhension quantitative en vision-langage |
| Modalité | Image |
| Type de questions | comptage d'objets (compréhension image-texte vision-langage) |
| Métrique d'évaluation | exactitude (accuracy) du comptage |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 540 images (2 à 10 instances par objet) |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 97,8 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 97,8 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 97,8 % | 21 avril 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 97,6 % | 31 mars 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 97,0 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,7 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 97,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur CountBench indique qu’un modèle produit fréquemment le nombre exact d’objets présents dans les images. La métrique d’exactitude impose une validation stricte de la réponse, mais la fiabilité comparative doit être nuancée : les résultats recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un cadre indépendant commun.
Le score médian de 98 %, identique à celui du meilleur modèle recensé, Qwen3.5-27B, suggère une forte saturation parmi les six modèles de la base. Dans ces conditions, le classement distingue peu les systèmes et de faibles écarts éventuels peuvent avoir une portée limitée. L’accès public au jeu implique aussi que son exposition doit être prise en compte comme risque possible de contamination lors de l’interprétation des performances, sans établir qu’une telle contamination a eu lieu. Enfin, CountBench porte sur un périmètre ciblé : le comptage d’objets dans des images, avec des questions en anglais. Un excellent résultat reflète donc une compréhension quantitative visuelle précise sur cette tâche, et non une mesure générale de toutes les capacités vision-langage.
Sources des scores : llm-stats.