ODinW

ODinW, pour Object Detection in the Wild, est un benchmark publié par Microsoft en 2021 par l’équipe GLIP, notamment Liunian Harold Li et Pengchuan Zhang. Il évalue la capacité de modèles de détection d’objets à transférer leurs acquis vers des jeux de données réels diversifiés.

ODinW, pour Object Detection in the Wild, est un benchmark publié par Microsoft en 2021 par l’équipe GLIP, notamment Liunian Harold Li et Pengchuan Zhang. Il évalue la capacité de modèles de détection d’objets à transférer leurs acquis vers des jeux de données réels diversifiés.

Les modèles doivent localiser des objets au moyen de boîtes englobantes, dans des configurations zero-shot ou few-shot. ODinW sert ainsi à comparer la précision des prédictions et l’efficacité d’adaptation au niveau des tâches, au-delà d’un jeu de données unique.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMicrosoft (équipe GLIP : Liunian Harold Li, Pengchuan Zhang et al.)
Capacités mesuréesTransfert au niveau tâche de modèles de détection vers des jeux de données réels diversifiés, en précision de prédiction et en efficacité d'adaptation.
ModalitéImage
Type de questionsDétection d'objets (boîtes englobantes) ; transfert zero-shot/few-shot sur jeux variés
Métrique d'évaluationmAP (mean Average Precision)
AccèsPublic
Languesanglais (catégories textuelles)
Taille du jeu13 jeux de données (ODinW-13), étendu à 35 jeux (ODinW-35)
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (16)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire51,8 %31 mars 2026Auto-déclaré
2Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire51,1 %31 mai 2026Auto-déclaré
3Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert50,8 %16 avril 2026Auto-déclaré
4Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert48,6 %22 septembre 2025Auto-déclaré
5Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert48,2 %22 septembre 2025Auto-déclaré
6Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert47,5 %22 septembre 2025Auto-déclaré
7Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert46,6 %22 septembre 2025Auto-déclaré
8Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert44,7 %22 septembre 2025Auto-déclaré
9Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert44,5 %24 février 2026Auto-déclaré
10Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert43,2 %22 septembre 2025Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert42,6 %24 février 2026Auto-déclaré
12Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert42,4 %27 mars 2025Auto-déclaré
13Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert42,3 %22 septembre 2025Auto-déclaré
14Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert41,1 %24 février 2026Auto-déclaré
15Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert39,8 %22 septembre 2025Auto-déclaré
16Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert39,4 %22 septembre 2025Auto-déclaré

Classement établi sur 16 modèles évalués. Score médian de l'ensemble : 44,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score mAP élevé indique que le modèle produit des détections globalement plus précises dans les différents contextes de transfert couverts par ODinW. Il traduit donc une meilleure capacité à appliquer un modèle de détection à des tâches variées, notamment avec peu ou pas d’exemples d’adaptation. La métrique commune fournit un cadre quantitatif de comparaison, mais la fiabilité pratique du classement doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.

La portée reste celle de la détection d’objets par boîtes englobantes, avec des catégories textuelles en anglais et un ensemble défini de jeux de données réels. Les résultats ne doivent donc pas être généralisés à d’autres capacités. Parmi les 16 modèles recensés, Qwen3.6 Plus atteint 52 %, soit sept points au-dessus de la médiane de 45 %. Cet écart signale un avantage sur les tâches évaluées, sans suffire à établir une saturation générale du benchmark. Le classement reflète avant tout les performances déclarées dans le périmètre précis d’ODinW.


Sources des scores : llm-stats.