Grok 4.3 Beta

Grok 4.3 Beta est un LLM de xAI sorti le 17 avril 2026. À sa sortie, il se classait dans le top 19% des LLM de sa génération sur GPQA diamond, un test de questions scientifiques de niveau doctorat.

Grok 4.3 Beta est un LLM de xAI sorti le 17 avril 2026. À sa sortie, il se classait dans le top 19% des LLM de sa génération sur GPQA diamond, un test de questions scientifiques de niveau doctorat.

Son profil est contrasté : il se distingue surtout en mathématiques de niveau lycée et en sciences avancées, tandis que ses résultats diminuent nettement sur les mathématiques de recherche les plus difficiles, les questions factuelles vérifiables et les problèmes d’échecs. Cette hiérarchie des performances ressort de deux sources de données concordantes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids▫ n.d.
Date de sortie17 avril 2026

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: OTIS Mock AIME 2024-202593,3 %8ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond88,8 %11ᵉ / 85epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private42,8 %13ᵉ / 17epoch✅ Mesuré
Epoch: SimpleQA Verified38,0 %15ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles25,0 %10ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private14,6 %12ᵉ / 18epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: OTIS Mock AIME 2024-2025

▶ Grok 4.3 Beta93 %

Epoch: GPQA diamond

▶ Grok 4.3 Beta89 %

Notre analyse

Forces. Grok 4.3 Beta obtient son meilleur résultat sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, où il se place dans le premier cinquième des modèles évalués. GPQA diamond confirme une solide capacité à traiter des questions scientifiques de niveau doctorat : son classement parmi les 85 LLM sortis au cours des 18 mois précédents le situait dans le haut du panier de sa génération. Ces résultats dessinent un modèle particulièrement à l’aise avec le raisonnement mathématique structuré et les connaissances scientifiques avancées.

Limites et points d'attention. Les performances baissent fortement lorsque la difficulté mathématique atteint le niveau de la recherche. Grok 4.3 Beta se situe près du bas du classement sur FrontierMath-Tiers-1-3-v2-Private et reste également en retrait sur FrontierMath-Tier-4-v2-Private. SimpleQA Verified révèle une fiabilité factuelle limitée, avec un résultat inférieur à la moitié des questions vérifiables. Les problèmes d’échecs constituent une autre faiblesse nette. Le modèle correspond donc davantage aux exercices mathématiques de niveau lycée et aux questions scientifiques avancées qu’aux mathématiques de recherche, à la vérification factuelle ou au raisonnement échiquéen.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.