Grok-4 Heavy

Grok-4 Heavy est un LLM propriétaire de xAI, lancé le 10 juillet 2025 aux États-Unis. À sa sortie, il se distinguait sur GPQA en intégrant le top 1 % des 116 modèles de sa génération, soit ceux publiés au cours des 18 mois précédents.

Grok-4 Heavy est un LLM propriétaire de xAI, lancé le 10 juillet 2025 aux États-Unis. À sa sortie, il se distinguait sur GPQA en intégrant le top 1 % des 116 modèles de sa génération, soit ceux publiés au cours des 18 mois précédents.

Près d’un an plus tard, Grok-4 Heavy est déjà ancien à l’échelle de l’IA. Son intérêt est désormais surtout historique, comme représentant du haut de gamme de sa période, tandis que ses connaissances s’arrêtent au 31 décembre 2024 et que ses poids restent fermés.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Connaissances jusqu'à2024-12-31
Multimodaloui

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 2025100,0 %1ᵉ / 108llm-statsAuto-déclaré
HMMT2596,7 %1ᵉ / 25llm-statsAuto-déclaré
GPQA88,4 %26ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench79,4 %10ᵉ / 72llm-statsAuto-déclaré
USAMO2561,9 %2ᵉ / 3llm-statsAuto-déclaré
Humanity's Last Exam50,7 %18ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Grok-4 Heavy figurait parmi les meilleurs LLM de sa génération sur GPQA. Ce classement dans le top 1 % constitue son principal marqueur de performance et montre qu’il occupait alors une place très élevée face aux modèles contemporains. Cette position permet de le situer comme un modèle haut de gamme de l’été 2025, plutôt que de l’évaluer uniquement selon les standards actuels.

Limites et points d’attention. Son résultat sur FrontierMath-Tier-4-2025-07-01-Private, consacré à des mathématiques de recherche très difficiles, est faible : Grok-4 Heavy se place près du bas du classement, avec 2 % et un rang de 45e sur 55. Cette contre-performance nuance fortement son excellent positionnement sur GPQA et révèle des limites sur les problèmes mathématiques les plus exigeants. Près d’un an après sa sortie, ses performances sont largement dépassées au rythme actuel du secteur, et les modèles de cette ancienneté sont souvent retirés des catalogues. Sa licence propriétaire interdit en outre l’accès ouvert aux poids. La date de coupure des connaissances, fixée à fin 2024, réduit également sa pertinence pour les informations plus récentes.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.