ODinW
ODinW, pour Object Detection in the Wild, est un benchmark publié par Microsoft en 2021 par l’équipe GLIP, notamment Liunian Harold Li et Pengchuan Zhang. Il évalue la capacité de modèles de détection d’objets à transférer leurs acquis vers des jeux de données réels diversifiés.
ODinW, pour Object Detection in the Wild, est un benchmark publié par Microsoft en 2021 par l’équipe GLIP, notamment Liunian Harold Li et Pengchuan Zhang. Il évalue la capacité de modèles de détection d’objets à transférer leurs acquis vers des jeux de données réels diversifiés.
Les modèles doivent localiser des objets au moyen de boîtes englobantes, dans des configurations zero-shot ou few-shot. ODinW sert ainsi à comparer la précision des prédictions et l’efficacité d’adaptation au niveau des tâches, au-delà d’un jeu de données unique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Microsoft (équipe GLIP : Liunian Harold Li, Pengchuan Zhang et al.) |
| Capacités mesurées | Transfert au niveau tâche de modèles de détection vers des jeux de données réels diversifiés, en précision de prédiction et en efficacité d'adaptation. |
| Modalité | Image |
| Type de questions | Détection d'objets (boîtes englobantes) ; transfert zero-shot/few-shot sur jeux variés |
| Métrique d'évaluation | mAP (mean Average Precision) |
| Accès | Public |
| Langues | anglais (catégories textuelles) |
| Taille du jeu | 13 jeux de données (ODinW-13), étendu à 35 jeux (ODinW-35) |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (16)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 51,8 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 51,1 % | 31 mai 2026 | Auto-déclaré |
| 3 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,8 % | 16 avril 2026 | Auto-déclaré |
| 4 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,6 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,2 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,5 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,6 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,7 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,5 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,2 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 42,6 % | 24 février 2026 | Auto-déclaré |
| 12 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 42,4 % | 27 mars 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 42,3 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,1 % | 24 février 2026 | Auto-déclaré |
| 15 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 39,8 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 39,4 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 16 modèles évalués. Score médian de l'ensemble : 44,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score mAP élevé indique que le modèle produit des détections globalement plus précises dans les différents contextes de transfert couverts par ODinW. Il traduit donc une meilleure capacité à appliquer un modèle de détection à des tâches variées, notamment avec peu ou pas d’exemples d’adaptation. La métrique commune fournit un cadre quantitatif de comparaison, mais la fiabilité pratique du classement doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.
La portée reste celle de la détection d’objets par boîtes englobantes, avec des catégories textuelles en anglais et un ensemble défini de jeux de données réels. Les résultats ne doivent donc pas être généralisés à d’autres capacités. Parmi les 16 modèles recensés, Qwen3.6 Plus atteint 52 %, soit sept points au-dessus de la médiane de 45 %. Cet écart signale un avantage sur les tâches évaluées, sans suffire à établir une saturation générale du benchmark. Le classement reflète avant tout les performances déclarées dans le périmètre précis d’ODinW.
Sources des scores : llm-stats.