Vibe-Eval
Vibe-Eval est une suite d’évaluation créée par Reka AI pour mesurer la compréhension multimodale image-texte et le raisonnement visuel difficile. Elle repose sur des questions visuelles ouvertes accompagnées de réponses de référence rédigées par des experts.
Vibe-Eval est une suite d’évaluation créée par Reka AI pour mesurer la compréhension multimodale image-texte et le raisonnement visuel difficile. Elle repose sur des questions visuelles ouvertes accompagnées de réponses de référence rédigées par des experts.
Le benchmark poursuit deux objectifs complémentaires : réaliser un « vibe-check » des modèles de chat multimodaux sur des usages quotidiens, et éprouver rigoureusement les modèles de pointe. Son sous-ensemble difficile cible notamment des questions auxquelles la majorité des modèles les plus avancés répondent incorrectement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Reka AI |
| Capacités mesurées | Compréhension multimodale image-texte, raisonnement visuel difficile, vibe-check de modèles de chat multimodaux |
| Modalité | Multimodal |
| Type de questions | compréhension visuelle ouverte (VQA à réponse libre) |
| Métrique d'évaluation | score d'un juge LLM (Reka Core) sur échelle entière 1-5 |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 269 prompts (169 "normaux" + 100 "hard") |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 67,2 % | 5 juin 2025 | Auto-déclaré | |
| 2 | Gemini 2.5 Pro | 🔒 Propriétaire | 65,6 % | 20 mai 2025 | Auto-déclaré | |
| 3 | Gemini 2.5 Flash | 🔒 Propriétaire | 65,4 % | 20 mai 2025 | Auto-déclaré | |
| 4 | Gemini 2.0 Flash | 🔒 Propriétaire | 56,3 % | 21 janvier 2025 | Auto-déclaré | |
| 5 | Gemini 1.5 Pro | 🔒 Propriétaire | 53,9 % | 1 mai 2024 | Auto-déclaré | |
| 6 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 51,3 % | 17 juin 2025 | Auto-déclaré | |
| 7 | Gemini 1.5 Flash | 🔒 Propriétaire | 48,9 % | 1 mai 2024 | Auto-déclaré | |
| 8 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 40,9 % | 15 mars 2024 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 55,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé signifie que Reka Core, utilisé comme juge LLM, attribue aux réponses du modèle des notes favorables sur l’échelle entière de 1 à 5, au regard des réponses de référence. Le classement met en évidence un avantage de Gemini 2.5 Pro Preview 06-05, à 67 %, face à une médiane de 55 % parmi les huit modèles évalués. Cet écart suggère une différenciation réelle sur les tâches proposées, tandis que le niveau du meilleur score et la difficulté revendiquée du sous-ensemble « hard » ne signalent pas une saturation complète.
La rigueur repose sur des réponses de référence expertes et sur un juge commun, mais la fiabilité pratique du classement est limitée par des scores majoritairement auto-déclarés par les éditeurs. L’accès public et la taille finie du jeu créent aussi un risque de contamination ou d’optimisation ciblée au fil du temps. Enfin, la portée reste circonscrite à des prompts en anglais, centrés sur la compréhension visuelle ouverte et le chat multimodal, plutôt qu’à l’ensemble des capacités d’un modèle.
Sources des scores : llm-stats.