CountBench

CountBench est un benchmark conçu par Google Research et le Weizmann Institute of Science pour évaluer le comptage d’objets dans des images. Il examine la capacité des modèles à relier le contenu visuel à une compréhension quantitative exprimée en langage.

CountBench est un benchmark conçu par Google Research et le Weizmann Institute of Science pour évaluer le comptage d’objets dans des images. Il examine la capacité des modèles à relier le contenu visuel à une compréhension quantitative exprimée en langage.

Publié en 2023, il sert à mesurer une compétence ciblée des systèmes de vision-langage : identifier correctement combien d’instances d’un objet apparaissent dans une image. Il permet ainsi de comparer les modèles sur une tâche visuelle dont la réponse attendue est exacte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle Research / Weizmann Institute of Science
Capacités mesuréesComptage d'objets dans une image, compréhension quantitative en vision-langage
ModalitéImage
Type de questionscomptage d'objets (compréhension image-texte vision-langage)
Métrique d'évaluationexactitude (accuracy) du comptage
AccèsPublic
Languesanglais
Taille du jeu540 images (2 à 10 instances par objet)
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert97,8 %24 février 2026Auto-déclaré
2Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert97,8 %24 février 2026Auto-déclaré
3Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert97,8 %21 avril 2026Auto-déclaré
4Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire97,6 %31 mars 2026Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert97,0 %24 février 2026Auto-déclaré
6Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert93,7 %22 septembre 2025Auto-déclaré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 97,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur CountBench indique qu’un modèle produit fréquemment le nombre exact d’objets présents dans les images. La métrique d’exactitude impose une validation stricte de la réponse, mais la fiabilité comparative doit être nuancée : les résultats recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un cadre indépendant commun.

Le score médian de 98 %, identique à celui du meilleur modèle recensé, Qwen3.5-27B, suggère une forte saturation parmi les six modèles de la base. Dans ces conditions, le classement distingue peu les systèmes et de faibles écarts éventuels peuvent avoir une portée limitée. L’accès public au jeu implique aussi que son exposition doit être prise en compte comme risque possible de contamination lors de l’interprétation des performances, sans établir qu’une telle contamination a eu lieu. Enfin, CountBench porte sur un périmètre ciblé : le comptage d’objets dans des images, avec des questions en anglais. Un excellent résultat reflète donc une compréhension quantitative visuelle précise sur cette tâche, et non une mesure générale de toutes les capacités vision-langage.


Sources des scores : llm-stats.