Phi 4 Reasoning Plus
Sorti le 30 avril 2025, Phi 4 Reasoning Plus est un LLM de Microsoft aujourd’hui ancien à l’échelle de l’IA. Ce modèle open-weights sous licence MIT autorise l’usage commercial, mais sa génération est désormais largement dépassée par les modèles plus récents.
Sorti le 30 avril 2025, Phi 4 Reasoning Plus est un LLM de Microsoft aujourd’hui ancien à l’échelle de l’IA. Ce modèle open-weights sous licence MIT autorise l’usage commercial, mais sa génération est désormais largement dépassée par les modèles plus récents.
Cette déclinaison de Phi-4 repose sur un Transformer dense decoder-only de 14 milliards de paramètres, affiné sur des traces de chaîne de pensée puis par reinforcement learning. Elle traite du texte sur une fenêtre de 32 768 tokens et produit un bloc de raisonnement suivi d’une synthèse.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 30 avril 2025 |
| Connaissances jusqu'à | 2025-03-01 |
| Multimodal | non |
| Paramètres | 14 milliards |
| Fenêtre de contexte | 32 768 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HumanEval+ | 92,3 % | 2ᵉ / 10 | llm-stats | Auto-déclaré |
| IFEval | 84,9 % | 38ᵉ / 65 | llm-stats | Auto-déclaré |
| AIME 2024 | 81,3 % | 23ᵉ / 52 | llm-stats | Auto-déclaré |
| Arena Hard | 79,0 % | 7ᵉ / 26 | llm-stats | Auto-déclaré |
| AIME 2025 | 78,0 % | 69ᵉ / 108 | llm-stats | Auto-déclaré |
| MMLU-Pro | 76,0 % | 65ᵉ / 125 | llm-stats | Auto-déclaré |
| PhiBench | 74,2 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| GPQA | 68,9 % | 122ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 53,1 % | 40ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, Phi 4 Reasoning Plus se classait dans le top 23% des 92 LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Ce résultat le plaçait dans le haut du panier de son époque pour le raisonnement scientifique. Son entraînement couvre les mathématiques, les sciences et le code, sous forme de questions-réponses et de conversations, avec des données consacrées à la vérité et à la sécurité. Le modèle est particulièrement orienté vers l’anglais et le raisonnement mathématique. Le format ChatML est le mieux adapté à ses échanges. Sa licence MIT et ses poids ouverts facilitent les usages commerciaux et le déploiement indépendant.
Limites et points d’attention. Près d’un an après sa sortie, Phi 4 Reasoning Plus appartient à une génération très ancienne au rythme d’évolution de l’IA. Ses performances sont aujourd’hui largement dépassées, et les modèles de cet âge sont souvent retirés des catalogues de leur éditeur. Ses connaissances s’arrêtent au 1er mars 2025. Son orientation vers l’anglais, les mathématiques, les sciences et le code le rend moins généraliste que son appellation pourrait le suggérer. L’inférence repose en outre sur un échantillonnage recommandé avec temperature=0.8, top_k=50, top_p=0.95 et do_sample=True, des réglages à reproduire pour rester proche du comportement prévu.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).