TIR-Bench
TIR-Bench est un benchmark de raisonnement multimodal agentique créé en 2025 par agents-x-project, au sein de l’équipe TIR-Bench menée par Ming Li et ses coauteurs. Il évalue la capacité des modèles à « penser avec les images » en intégrant leur création et leur manipulation par des…
TIR-Bench est un benchmark de raisonnement multimodal agentique créé en 2025 par agents-x-project, au sein de l’équipe TIR-Bench menée par Ming Li et ses coauteurs. Il évalue la capacité des modèles à « penser avec les images » en intégrant leur création et leur manipulation par des outils dans la chaîne de raisonnement.
Le benchmark examine également le suivi d’instructions visuelles et la fiabilité de leur exécution. Il sert ainsi à comparer des modèles sur leur aptitude à coordonner texte, images et appels d’outils pour accomplir diverses tâches.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | agents-x-project (équipe TIR-Bench, Ming Li et al.) |
| Capacités mesurées | Raisonnement 'penser avec les images' : créer et manipuler des images via des outils au sein de la chaîne de raisonnement, suivi d'instructions visuelles et fiabilité d'exécution |
| Modalité | Multimodal |
| Type de questions | raisonnement multimodal agentique (thinking-with-images, usage d'outils) |
| Métrique d'évaluation | exactitude (accuracy) |
| Accès | Public |
| Langues | anglais (multimodal image+texte) |
| Taille du jeu | 13 tâches diverses |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Qwen | 61,6 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Qwen | 59,8 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Qwen | 55,5 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Qwen | 53,2 % | 24 février 2026 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 57,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur TIR-Bench indique qu’un modèle exécute correctement une plus grande part des tâches de raisonnement multimodal agentique. Il traduit donc une meilleure aptitude combinée à suivre des instructions visuelles, à appeler des outils et à créer ou manipuler des images pendant le raisonnement. Le classement reste toutefois resserré dans la base évaluée : Qwen3.6 Plus atteint 62 %, contre une médiane de 58 % parmi quatre modèles. Cet écart limité montre un avantage mesurable pour le premier, sans domination très marquée ni saturation complète du benchmark.
La lecture des résultats exige de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public peut aussi imposer une vigilance face au risque de contamination lors de futures évaluations, sans établir qu’elle a eu lieu. Enfin, la portée demeure celle de treize tâches en anglais associant image et texte. TIR-Bench renseigne donc spécifiquement la fiabilité d’exécution et le raisonnement avec outils dans ce cadre multimodal, plutôt que les capacités générales d’un modèle.
Sources des scores : llm-stats.