Vibe-Eval

Vibe-Eval est une suite d’évaluation créée par Reka AI pour mesurer la compréhension multimodale image-texte et le raisonnement visuel difficile. Elle repose sur des questions visuelles ouvertes accompagnées de réponses de référence rédigées par des experts.

Vibe-Eval est une suite d’évaluation créée par Reka AI pour mesurer la compréhension multimodale image-texte et le raisonnement visuel difficile. Elle repose sur des questions visuelles ouvertes accompagnées de réponses de référence rédigées par des experts.

Le benchmark poursuit deux objectifs complémentaires : réaliser un « vibe-check » des modèles de chat multimodaux sur des usages quotidiens, et éprouver rigoureusement les modèles de pointe. Son sous-ensemble difficile cible notamment des questions auxquelles la majorité des modèles les plus avancés répondent incorrectement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkReka AI
Capacités mesuréesCompréhension multimodale image-texte, raisonnement visuel difficile, vibe-check de modèles de chat multimodaux
ModalitéMultimodal
Type de questionscompréhension visuelle ouverte (VQA à réponse libre)
Métrique d'évaluationscore d'un juge LLM (Reka Core) sur échelle entière 1-5
AccèsPublic
Languesanglais
Taille du jeu269 prompts (169 "normaux" + 100 "hard")
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire67,2 %5 juin 2025Auto-déclaré
2Gemini 2.5 ProGoogle🔒 Propriétaire65,6 %20 mai 2025Auto-déclaré
3Gemini 2.5 FlashGoogle🔒 Propriétaire65,4 %20 mai 2025Auto-déclaré
4Gemini 2.0 FlashGoogle🔒 Propriétaire56,3 %21 janvier 2025Auto-déclaré
5Gemini 1.5 ProGoogle🔒 Propriétaire53,9 %1 mai 2024Auto-déclaré
6Gemini 2.5 Flash-LiteGoogle🟢 Ouvert51,3 %17 juin 2025Auto-déclaré
7Gemini 1.5 FlashGoogle🔒 Propriétaire48,9 %1 mai 2024Auto-déclaré
8Gemini 1.5 Flash 8BGoogle🔒 Propriétaire40,9 %15 mars 2024Auto-déclaré

Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 55,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé signifie que Reka Core, utilisé comme juge LLM, attribue aux réponses du modèle des notes favorables sur l’échelle entière de 1 à 5, au regard des réponses de référence. Le classement met en évidence un avantage de Gemini 2.5 Pro Preview 06-05, à 67 %, face à une médiane de 55 % parmi les huit modèles évalués. Cet écart suggère une différenciation réelle sur les tâches proposées, tandis que le niveau du meilleur score et la difficulté revendiquée du sous-ensemble « hard » ne signalent pas une saturation complète.

La rigueur repose sur des réponses de référence expertes et sur un juge commun, mais la fiabilité pratique du classement est limitée par des scores majoritairement auto-déclarés par les éditeurs. L’accès public et la taille finie du jeu créent aussi un risque de contamination ou d’optimisation ciblée au fil du temps. Enfin, la portée reste circonscrite à des prompts en anglais, centrés sur la compréhension visuelle ouverte et le chat multimodal, plutôt qu’à l’ensemble des capacités d’un modèle.


Sources des scores : llm-stats.