xAI: Grok Build 0.1
Sorti le 20 mai 2026, xAI: Grok Build 0.1 est un LLM de xAI doté d’une fenêtre de contexte de 256 000 tokens. À sa sortie, il figurait dans le top 83 % du LiveBench: Global average parmi les six LLM de sa génération.
Sorti le 20 mai 2026, xAI: Grok Build 0.1 est un LLM de xAI doté d’une fenêtre de contexte de 256 000 tokens. À sa sortie, il figurait dans le top 83 % du LiveBench: Global average parmi les six LLM de sa génération.
Son principal trait distinctif est son positionnement très économique. Sa tarification se situe 52 % sous la moyenne des LLM similaires et environ 5,5 fois sous celle des modèles frontière. Cette combinaison entre contexte étendu et coût réduit le destine aux traitements de volumes importants.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | xAI |
| Poids | ▫ n.d. |
| Date de sortie | 20 mai 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 96,0 % | 32ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 88,9 % | 1ᵉ / 19 | pinchbench | ✅ Mesuré |
| LiveBench: Mathematics | 78,4 % | 7ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Reasoning | 76,4 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Language | 72,5 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Data Analysis | 70,8 % | 5ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Global average | 67,8 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Coding | 65,4 % | 7ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: IF | 65,2 % | 2ᵉ / 7 | livebench | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 60,0 % | 88ᵉ / 163 | benchable | ✅ Mesuré |
| LiveBench: Agentic Coding | 45,8 % | 3ᵉ / 7 | livebench | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| xAI | 1 $ | 2 $ | 0,2 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 20,58 $ |
| Durée d'exécution — PinchBench | 3 h 40 min |
| Indice valeur/coût — PinchBench | 4,84 |
| Coût moyen par benchmark — Benchable | 0,36 $ |
| Latence moyenne par benchmark — Benchable | 14 min 10 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Grok Build 0.1 obtient des scores élevés sur les évaluations Benchable consacrées à Email Classification, au Reasoning et au Coding. Email Classification lui apporte son placement le plus favorable parmi ces tests, devant Coding puis Reasoning. Sa fenêtre de 256 000 tokens constitue un autre atout concret pour les entrées longues. Le tarif renforce surtout son intérêt économique : il coûte nettement moins cher que les LLM similaires et environ 5,5 fois moins que les modèles frontière.
Limites et points d’attention. Les scores Benchable sont issus de benchmarks plafonnés et différencient donc mal les modèles. Sur Hallucinations, Grok Build 0.1 partage la première place avec 45 autres modèles. Sur Ethics, cette place est partagée avec 71 autres. General Knowledge illustre aussi cette limite : malgré le score maximal, le modèle partage seulement la 47e place avec 24 concurrents. Reasoning et Coding restent également hors des toutes premières places. À sa sortie, son classement LiveBench le situait dans le top 83 % d’un groupe restreint de six LLM. Le modèle reste surtout pertinent pour les usages sensibles au coût, nécessitant un contexte étendu et des performances généralistes correctes.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · LiveBench (livebench.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).