MAI-Thinking-1
MAI-Thinking-1 est un LLM propriétaire de Microsoft, sorti le 2 juin 2026. Avec 1000 milliards de paramètres, il se distingue d’abord par une taille particulièrement importante et par des poids non ouverts.
MAI-Thinking-1 est un LLM propriétaire de Microsoft, sorti le 2 juin 2026. Avec 1000 milliards de paramètres, il se distingue d’abord par une taille particulièrement importante et par des poids non ouverts.
À sa sortie, MAI-Thinking-1 se situait dans le haut du classement GPQA des LLM de sa génération, sans atteindre le groupe de tête. Ce positionnement en faisait un modèle compétitif à son époque, mais pas une référence dominante sur ce benchmark.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🔒 Propriétaire |
| Date de sortie | 2 juin 2026 |
| Multimodal | non |
| Paramètres | 1000 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 97,0 % | 13ᵉ / 108 | llm-stats | Auto-déclaré |
| AIME 2026 | 94,5 % | 5ᵉ / 17 | llm-stats | Auto-déclaré |
| GraphWalks | 90,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| TruthfulQA | 88,0 % | 1ᵉ / 18 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 87,7 % | 6ᵉ / 53 | llm-stats | Auto-déclaré |
| MMLU-Pro | 85,0 % | 17ᵉ / 125 | llm-stats | Auto-déclaré |
| HMMT Feb 26 | 84,9 % | 8ᵉ / 11 | llm-stats | Auto-déclaré |
| GPQA | 84,2 % | 53ᵉ / 219 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 73,5 % | 40ᵉ / 102 | llm-stats | Auto-déclaré |
| BFCL-v3 | 72,0 % | 4ᵉ / 19 | llm-stats | Auto-déclaré |
| IFBench | 69,0 % | 18ᵉ / 27 | llm-stats | Auto-déclaré |
| LongBench v2 | 61,0 % | 4ᵉ / 15 | llm-stats | Auto-déclaré |
| Multi-Challenge | 53,0 % | 16ᵉ / 28 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 52,8 % | 34ᵉ / 41 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 46,0 % | 42ᵉ / 49 | llm-stats | Auto-déclaré |
| MedXpertQA | 43,0 % | 9ᵉ / 12 | llm-stats | Auto-déclaré |
| HealthBench Professional | 35,0 % | 8ᵉ / 8 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Sur GPQA, MAI-Thinking-1 figurait à sa sortie dans le top 27% des 172 LLM publiés au cours des quelque 18 mois précédents. Il appartenait donc au tiers supérieur de sa génération sur ce benchmark. Son volume de 1000 milliards de paramètres le plaçait également parmi les modèles de très grande taille.
Limites et points d'attention. Son classement GPQA restait hors du premier quart, malgré son nombre élevé de paramètres. Cette combinaison montre que l’échelle du modèle ne se traduisait pas par une place parmi les tout meilleurs de sa génération sur ce test. Sa licence propriétaire exclut par ailleurs l’accès aux poids. Enfin, l’évaluation disponible repose sur une seule source de données concordante, ce qui limite l’étendue des comparaisons possibles.
Sources des données : LLM-Stats (llm-stats.com).