TIR-Bench

TIR-Bench est un benchmark de raisonnement multimodal agentique créé en 2025 par agents-x-project, au sein de l’équipe TIR-Bench menée par Ming Li et ses coauteurs. Il évalue la capacité des modèles à « penser avec les images » en intégrant leur création et leur manipulation par des…

TIR-Bench est un benchmark de raisonnement multimodal agentique créé en 2025 par agents-x-project, au sein de l’équipe TIR-Bench menée par Ming Li et ses coauteurs. Il évalue la capacité des modèles à « penser avec les images » en intégrant leur création et leur manipulation par des outils dans la chaîne de raisonnement.

Le benchmark examine également le suivi d’instructions visuelles et la fiabilité de leur exécution. Il sert ainsi à comparer des modèles sur leur aptitude à coordonner texte, images et appels d’outils pour accomplir diverses tâches.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkagents-x-project (équipe TIR-Bench, Ming Li et al.)
Capacités mesuréesRaisonnement 'penser avec les images' : créer et manipuler des images via des outils au sein de la chaîne de raisonnement, suivi d'instructions visuelles et fiabilité d'exécution
ModalitéMultimodal
Type de questionsraisonnement multimodal agentique (thinking-with-images, usage d'outils)
Métrique d'évaluationexactitude (accuracy)
AccèsPublic
Languesanglais (multimodal image+texte)
Taille du jeu13 tâches diverses
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1Qwen3.6 PlusQwen61,6 %31 mars 2026Auto-déclaré
2Qwen3.5-27BQwen59,8 %24 février 2026Auto-déclaré
3Qwen3.5-35B-A3BQwen55,5 %24 février 2026Auto-déclaré
4Qwen3.5-122B-A10BQwen53,2 %24 février 2026Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 57,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur TIR-Bench indique qu’un modèle exécute correctement une plus grande part des tâches de raisonnement multimodal agentique. Il traduit donc une meilleure aptitude combinée à suivre des instructions visuelles, à appeler des outils et à créer ou manipuler des images pendant le raisonnement. Le classement reste toutefois resserré dans la base évaluée : Qwen3.6 Plus atteint 62 %, contre une médiane de 58 % parmi quatre modèles. Cet écart limité montre un avantage mesurable pour le premier, sans domination très marquée ni saturation complète du benchmark.

La lecture des résultats exige de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public peut aussi imposer une vigilance face au risque de contamination lors de futures évaluations, sans établir qu’elle a eu lieu. Enfin, la portée demeure celle de treize tâches en anglais associant image et texte. TIR-Bench renseigne donc spécifiquement la fiabilité d’exécution et le raisonnement avec outils dans ce cadre multimodal, plutôt que les capacités générales d’un modèle.


Sources des scores : llm-stats.