Grok-1.5

Grok-1.5 est un LLM propriétaire lancé par xAI le 28 mars 2024. Ses poids ne sont pas ouverts, ce qui le distingue des modèles librement accessibles et modifiables.

Grok-1.5 est un LLM propriétaire lancé par xAI le 28 mars 2024. Ses poids ne sont pas ouverts, ce qui le distingue des modèles librement accessibles et modifiables.

Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA. À sa sortie, son résultat sur GPQA le plaçait dans le top 64 % des 11 LLM contemporains étudiés, soit un positionnement plutôt intermédiaire parmi les modèles de sa période.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie28 mars 2024
Multimodalnon

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
GSM8k90,0 %26ᵉ / 47llm-statsAuto-déclaré
DocVQA85,6 %24ᵉ / 26llm-statsAuto-déclaré
MMLU81,3 %50ᵉ / 98llm-statsAuto-déclaré
HumanEval74,1 %51ᵉ / 65llm-statsAuto-déclaré
MMMU53,6 %52ᵉ / 61llm-statsAuto-déclaré
MathVista52,8 %33ᵉ / 38llm-statsAuto-déclaré
MMLU-Pro51,0 %108ᵉ / 125llm-statsAuto-déclaré
MATH50,6 %53ᵉ / 70llm-statsAuto-déclaré
GPQA35,9 %198ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Grok-1.5 affichait à sa sortie un niveau mesurable sur GPQA, un benchmark utilisé pour comparer les capacités des LLM. Son appartenance au top 64 % de sa génération indique qu’il devançait une partie des modèles publiés au cours des quelque 18 mois précédents, sans toutefois figurer parmi les références les mieux classées. Il constitue ainsi un jalon dans l’évolution des modèles propriétaires de xAI en 2024.

Limites et points d’attention. Son ancienneté est désormais très importante dans un secteur qui évolue rapidement. Ses performances sont probablement largement dépassées par celles de modèles plus récents, et les modèles de cette période sont souvent retirés des catalogues des éditeurs. Ses poids propriétaires empêchent par ailleurs leur ouverture. Enfin, son positionnement repose sur une seule source de données concordante et sur GPQA, ce qui limite l’étendue de l’évaluation disponible.


Sources des données : LLM-Stats (llm-stats.com).