EBR-bench

Epoch: EBR-bench est un benchmark créé par Epoch pour évaluer les performances de modèles d’intelligence artificielle selon un protocole commun. Il fournit un cadre standardisé permettant de comparer leurs résultats sur les tâches couvertes par cette évaluation.

Epoch: EBR-bench est un benchmark créé par Epoch pour évaluer les performances de modèles d’intelligence artificielle selon un protocole commun. Il fournit un cadre standardisé permettant de comparer leurs résultats sur les tâches couvertes par cette évaluation.

Son rôle consiste à produire un indicateur quantitatif comparable entre modèles. Ce score aide à distinguer les systèmes les plus performants dans le périmètre du benchmark, sans constituer à lui seul une mesure générale de toutes leurs capacités.

Carte d'identité

CaractéristiqueValeur
ModalitéTexte

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire39,7 %9 juillet 2026✅ Mesuré
2GPT-5.2OpenAI🔒 Propriétaire23,0 %11 décembre 2025✅ Mesuré
3Claude Opus 4.5Anthropic🔒 Propriétaire14,3 %24 novembre 2025✅ Mesuré
4Gemini 3.1 Pro PreviewGoogle▫ n.d.14,3 %19 février 2026✅ Mesuré
5GPT-5OpenAI🔒 Propriétaire12,7 %7 août 2025✅ Mesuré
6Claude Opus 4.1Anthropic🔒 Propriétaire7,9 %5 août 2025✅ Mesuré
7Claude Sonnet 4.5Anthropic🔒 Propriétaire2,4 %29 septembre 2025✅ Mesuré

Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 14,3 %.

Notre analyse

Un score élevé indique une meilleure réussite aux épreuves d’Epoch: EBR-bench. La fiabilité est renforcée par le fait que les résultats sont au moins partiellement mesurés par un tiers, une méthode généralement plus rigoureuse qu’une évaluation entièrement auto-déclarée. Cette garantie reste toutefois partielle et doit être prise en compte dans l’interprétation.

Avec une médiane de 14 % et un meilleur résultat de 40 %, le benchmark ne paraît pas saturé dans cet ensemble de sept modèles. L’écart entre le centre de la distribution et GPT-5.6 Sol montre que le classement différencie nettement les performances observées. Une éventuelle contamination des données d’évaluation demeure un point de vigilance méthodologique, car elle pourrait favoriser artificiellement un modèle exposé au contenu du test. Enfin, la portée du score reste limitée aux tâches et au protocole d’Epoch: EBR-bench. Le classement révèle surtout la nette avance de GPT-5.6 Sol dans cet échantillon, sans suffire à résumer la qualité globale d’un modèle pour tous les usages.


Sources des scores : epoch.