RefCOCO-avg
RefCOCO-avg est un benchmark d’ancrage visuel qui évalue la capacité d’un modèle à relier une expression en anglais à un objet dans une image, puis à le localiser au moyen d’une boîte englobante.
RefCOCO-avg est un benchmark d’ancrage visuel qui évalue la capacité d’un modèle à relier une expression en anglais à un objet dans une image, puis à le localiser au moyen d’une boîte englobante.
Il agrège les résultats de RefCOCO et RefCOCO+, créés par Licheng Yu et al. à UNC Chapel Hill, ainsi que de RefCOCOg, conçu par Mao et al. chez Google. Il sert à comparer la compréhension des expressions référentielles et le raisonnement spatial des modèles sur des images issues de MS-COCO.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Licheng Yu et al. (UNC Chapel Hill) pour RefCOCO/RefCOCO+ ; Mao et al. (Google) pour RefCOCOg |
| Capacités mesurées | Ancrage visuel (grounding) d'objets, compréhension d'expressions référentielles, raisonnement spatial sur images |
| Modalité | Image |
| Type de questions | compréhension d'expressions référentielles / grounding (localisation par boîte englobante) |
| Métrique d'évaluation | précision (Acc@0.5 IoU) moyennée sur RefCOCO, RefCOCO+ et RefCOCOg |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | RefCOCO ~142k expressions, RefCOCO+ ~141k, RefCOCOg ~95k (images issues de MS-COCO) |
| Année de publication | 2016 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 93,5 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,5 % | 21 avril 2026 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,4 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,0 % | 16 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,3 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,9 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,2 % | 24 février 2026 | Auto-déclaré |
Classement établi sur 7 modèles évalués. Score médian de l'ensemble : 92,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle localise fréquemment l’objet désigné avec un recouvrement d’au moins 0,5 IoU, en moyenne sur les trois benchmarks. Cette moyenne offre une mesure synthétique, mais elle peut masquer des écarts entre RefCOCO, RefCOCO+ et RefCOCOg. La médiane de 92 % et le meilleur résultat de 94 %, obtenu par Qwen3.6 Plus, montrent un classement resserré parmi les sept modèles évalués. Cet écart limité suggère une certaine saturation et réduit le pouvoir discriminant du benchmark au sommet du classement. La rigueur comparative doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une évaluation indépendante uniforme. Le caractère public des jeux crée par ailleurs un risque de contamination des évaluations. Enfin, la portée reste circonscrite à des expressions en anglais, à des images de MS-COCO et à une localisation par boîte englobante. RefCOCO-avg renseigne donc précisément sur le grounding d’objets dans ce cadre, sans représenter à lui seul l’ensemble des capacités visuelles d’un modèle.
Sources des scores : llm-stats.