MAI-Code-1-Flash
MAI-Code-1-Flash est un LLM propriétaire de Microsoft, sorti le 2 juin 2026. Développé aux États-Unis, il se distingue par un positionnement dans le haut du classement de sa génération sur GPQA.
MAI-Code-1-Flash est un LLM propriétaire de Microsoft, sorti le 2 juin 2026. Développé aux États-Unis, il se distingue par un positionnement dans le haut du classement de sa génération sur GPQA.
À sa sortie, MAI-Code-1-Flash figurait dans le top 26% des 172 LLM lancés au cours des quelque 18 mois précédents. Ce résultat situe le modèle au-dessus d’une large majorité de ses contemporains sur ce benchmark.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🔒 Propriétaire |
| Date de sortie | 2 juin 2026 |
| Multimodal | non |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2026 | 92,5 % | 9ᵉ / 17 | llm-stats | Auto-déclaré |
| GPQA | 84,6 % | 50ᵉ / 219 | llm-stats | Auto-déclaré |
| IFBench | 75,0 % | 9ᵉ / 27 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 71,7 % | 25ᵉ / 34 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 71,6 % | 52ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 65,5 % | 24ᵉ / 34 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 54,8 % | 29ᵉ / 49 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 51,2 % | 38ᵉ / 41 | llm-stats | Auto-déclaré |
| Artifacts Bench | 36,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 18,0 % | 59ᵉ / 89 | llm-stats | Auto-déclaré |
| FrontierMath | 6,3 % | 15ᵉ / 16 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. Le résultat obtenu sur GPQA place MAI-Code-1-Flash dans la partie supérieure des LLM de sa génération au moment de sa sortie. Ce classement constitue son principal élément distinctif parmi les données disponibles et indique une performance compétitive face aux modèles contemporains évalués sur le même benchmark. Cette position repose sur deux sources de données concordantes.
Limites et points d'attention. Malgré ce classement favorable, le modèle reste en dehors du groupe formé par le premier quart de sa génération sur GPQA. Son évaluation ne le place donc pas au niveau des modèles les mieux classés de cette cohorte. Sa licence propriétaire implique aussi des poids non ouverts, qui ne sont pas accessibles pour un examen ou une modification directe.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.