Phi 4 Reasoning

Sorti le 30 avril 2025, Phi 4 Reasoning est déjà un modèle ancien à l’échelle de l’IA. Microsoft l’a conçu comme une déclinaison de Phi-4 spécialisée dans le raisonnement mathématique, avec une architecture Transformer dense decoder-only de 14 milliards de paramètres.

Sorti le 30 avril 2025, Phi 4 Reasoning est déjà un modèle ancien à l’échelle de l’IA. Microsoft l’a conçu comme une déclinaison de Phi-4 spécialisée dans le raisonnement mathématique, avec une architecture Transformer dense decoder-only de 14 milliards de paramètres.

Distribué sous licence MIT avec ses poids ouverts et un usage commercial autorisé, il accepte du texte, de préférence en ChatML, sur une fenêtre de 32 768 tokens. Son entraînement combine affinage supervisé sur des traces de raisonnement et reinforcement learning, à partir de données centrées sur les mathématiques, les sciences, le code, la sécurité et l’IA responsable.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie30 avril 2025
Connaissances jusqu'à2025-03-01
Multimodalnon
Paramètres14 milliards
Fenêtre de contexte32 768 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
HumanEval+92,9 %1ᵉ / 10llm-statsAuto-déclaré
IFEval83,4 %45ᵉ / 65llm-statsAuto-déclaré
AIME 202475,3 %33ᵉ / 52llm-statsAuto-déclaré
MMLU-Pro74,3 %70ᵉ / 125llm-statsAuto-déclaré
Arena Hard73,3 %10ᵉ / 26llm-statsAuto-déclaré
PhiBench70,6 %2ᵉ / 3llm-statsAuto-déclaré
GPQA65,8 %134ᵉ / 219llm-statsAuto-déclaré
AIME 202562,9 %89ᵉ / 108llm-statsAuto-déclaré
LiveCodeBench53,8 %38ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Phi 4 Reasoning se plaçait dans le top 29% des 92 LLM de sa génération sur GPQA, un benchmark de questions scientifiques exigeantes. Ce résultat le situait dans la partie supérieure du classement, sans en faire un modèle dominant. Sa spécialisation est cohérente avec son entraînement sur des traces de raisonnement et avec une génération structurée en deux parties, un bloc de chain-of-thought suivi d’une synthèse. La licence MIT, les poids ouverts et l’autorisation d’usage commercial facilitaient aussi son intégration et son adaptation.

Limites et points d'attention. Près d’un an après sa sortie, ses performances sont largement dépassées par les générations plus récentes, et les modèles de cet âge sont souvent retirés des catalogues de leur éditeur. Son périmètre est en outre étroit : Microsoft l’a conçu et testé pour le raisonnement mathématique uniquement, avec un usage principalement en anglais. Les données d’entraînement couvrent également les sciences, le codage, la sécurité et l’IA responsable, mais cette diversité ne constitue pas une validation générale de ses capacités. Enfin, la production explicite d’un bloc de chain-of-thought impose de traiter séparément le raisonnement généré et la synthèse finale.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).