Phi 4 Reasoning
Sorti le 30 avril 2025, Phi 4 Reasoning est déjà un modèle ancien à l’échelle de l’IA. Microsoft l’a conçu comme une déclinaison de Phi-4 spécialisée dans le raisonnement mathématique, avec une architecture Transformer dense decoder-only de 14 milliards de paramètres.
Sorti le 30 avril 2025, Phi 4 Reasoning est déjà un modèle ancien à l’échelle de l’IA. Microsoft l’a conçu comme une déclinaison de Phi-4 spécialisée dans le raisonnement mathématique, avec une architecture Transformer dense decoder-only de 14 milliards de paramètres.
Distribué sous licence MIT avec ses poids ouverts et un usage commercial autorisé, il accepte du texte, de préférence en ChatML, sur une fenêtre de 32 768 tokens. Son entraînement combine affinage supervisé sur des traces de raisonnement et reinforcement learning, à partir de données centrées sur les mathématiques, les sciences, le code, la sécurité et l’IA responsable.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 30 avril 2025 |
| Connaissances jusqu'à | 2025-03-01 |
| Multimodal | non |
| Paramètres | 14 milliards |
| Fenêtre de contexte | 32 768 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HumanEval+ | 92,9 % | 1ᵉ / 10 | llm-stats | Auto-déclaré |
| IFEval | 83,4 % | 45ᵉ / 65 | llm-stats | Auto-déclaré |
| AIME 2024 | 75,3 % | 33ᵉ / 52 | llm-stats | Auto-déclaré |
| MMLU-Pro | 74,3 % | 70ᵉ / 125 | llm-stats | Auto-déclaré |
| Arena Hard | 73,3 % | 10ᵉ / 26 | llm-stats | Auto-déclaré |
| PhiBench | 70,6 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| GPQA | 65,8 % | 134ᵉ / 219 | llm-stats | Auto-déclaré |
| AIME 2025 | 62,9 % | 89ᵉ / 108 | llm-stats | Auto-déclaré |
| LiveCodeBench | 53,8 % | 38ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, Phi 4 Reasoning se plaçait dans le top 29% des 92 LLM de sa génération sur GPQA, un benchmark de questions scientifiques exigeantes. Ce résultat le situait dans la partie supérieure du classement, sans en faire un modèle dominant. Sa spécialisation est cohérente avec son entraînement sur des traces de raisonnement et avec une génération structurée en deux parties, un bloc de chain-of-thought suivi d’une synthèse. La licence MIT, les poids ouverts et l’autorisation d’usage commercial facilitaient aussi son intégration et son adaptation.
Limites et points d'attention. Près d’un an après sa sortie, ses performances sont largement dépassées par les générations plus récentes, et les modèles de cet âge sont souvent retirés des catalogues de leur éditeur. Son périmètre est en outre étroit : Microsoft l’a conçu et testé pour le raisonnement mathématique uniquement, avec un usage principalement en anglais. Les données d’entraînement couvrent également les sciences, le codage, la sécurité et l’IA responsable, mais cette diversité ne constitue pas une validation générale de ses capacités. Enfin, la production explicite d’un bloc de chain-of-thought impose de traiter séparément le raisonnement généré et la synthèse finale.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).