EBR-bench
Epoch: EBR-bench est un benchmark créé par Epoch pour évaluer les performances de modèles d’intelligence artificielle selon un protocole commun. Il fournit un cadre standardisé permettant de comparer leurs résultats sur les tâches couvertes par cette évaluation.
Epoch: EBR-bench est un benchmark créé par Epoch pour évaluer les performances de modèles d’intelligence artificielle selon un protocole commun. Il fournit un cadre standardisé permettant de comparer leurs résultats sur les tâches couvertes par cette évaluation.
Son rôle consiste à produire un indicateur quantitatif comparable entre modèles. Ce score aide à distinguer les systèmes les plus performants dans le périmètre du benchmark, sans constituer à lui seul une mesure générale de toutes leurs capacités.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Modalité | Texte |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 39,7 % | 9 juillet 2026 | ✅ Mesuré |
| 2 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 23,0 % | 11 décembre 2025 | ✅ Mesuré |
| 3 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 14,3 % | 24 novembre 2025 | ✅ Mesuré |
| 4 | Gemini 3.1 Pro Preview | ▫ n.d. | 14,3 % | 19 février 2026 | ✅ Mesuré | |
| 5 | GPT-5 | OpenAI | 🔒 Propriétaire | 12,7 % | 7 août 2025 | ✅ Mesuré |
| 6 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 7,9 % | 5 août 2025 | ✅ Mesuré |
| 7 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 2,4 % | 29 septembre 2025 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 14,3 %.
Notre analyse
Un score élevé indique une meilleure réussite aux épreuves d’Epoch: EBR-bench. La fiabilité est renforcée par le fait que les résultats sont au moins partiellement mesurés par un tiers, une méthode généralement plus rigoureuse qu’une évaluation entièrement auto-déclarée. Cette garantie reste toutefois partielle et doit être prise en compte dans l’interprétation.
Avec une médiane de 14 % et un meilleur résultat de 40 %, le benchmark ne paraît pas saturé dans cet ensemble de sept modèles. L’écart entre le centre de la distribution et GPT-5.6 Sol montre que le classement différencie nettement les performances observées. Une éventuelle contamination des données d’évaluation demeure un point de vigilance méthodologique, car elle pourrait favoriser artificiellement un modèle exposé au contenu du test. Enfin, la portée du score reste limitée aux tâches et au protocole d’Epoch: EBR-bench. Le classement révèle surtout la nette avance de GPT-5.6 Sol dans cet échantillon, sans suffire à résumer la qualité globale d’un modèle pour tous les usages.
Sources des scores : epoch.