Phi 4
Publié par Microsoft le 12 décembre 2024, Phi 4 est un LLM open-weights sous licence MIT, utilisable commercialement. Près de deux ans représentent une très longue période en IA : ce modèle de 15 milliards de paramètres appartient désormais à une génération probablement dépassée et peut…
Publié par Microsoft le 12 décembre 2024, Phi 4 est un LLM open-weights sous licence MIT, utilisable commercialement. Près de deux ans représentent une très longue période en IA : ce modèle de 15 milliards de paramètres appartient désormais à une génération probablement dépassée et peut avoir disparu des catalogues actuels.
Ce Transformer dense à décodeur seul a été entraîné sur des données synthétiques, des sites publics filtrés, des livres académiques acquis et des jeux de questions-réponses. Affiné pour le suivi d’instructions et la sécurité, il cible surtout l’anglais, le raisonnement et les environnements contraints en calcul, avec un contexte de 16 384 tokens et un tarif très économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 12 décembre 2024 |
| Connaissances jusqu'à | 2024-06-01 |
| Multimodal | non |
| Paramètres | 15 milliards |
| Fenêtre de contexte | 16 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMLU | 84,8 % | 43ᵉ / 98 | llm-stats | Auto-déclaré |
| HumanEval+ | 82,8 % | 5ᵉ / 10 | llm-stats | Auto-déclaré |
| HumanEval | 82,6 % | 40ᵉ / 65 | llm-stats | Auto-déclaré |
| MGSM | 80,6 % | 18ᵉ / 30 | llm-stats | Auto-déclaré |
| MATH | 80,4 % | 19ᵉ / 70 | llm-stats | Auto-déclaré |
| DROP | 75,5 % | 18ᵉ / 29 | llm-stats | Auto-déclaré |
| Arena Hard | 75,4 % | 9ᵉ / 26 | llm-stats | Auto-déclaré |
| MMLU-Pro | 70,4 % | 78ᵉ / 125 | llm-stats | Auto-déclaré |
| IFEval | 63,0 % | 62ᵉ / 65 | llm-stats | Auto-déclaré |
| PhiBench | 56,2 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| GPQA | 56,1 % | 152ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveBench | 47,6 % | 36ᵉ / 38 | llm-stats | Auto-déclaré |
| SimpleQA | 3,0 % | 43ᵉ / 45 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,07 $ | 0,14 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 97 % en dessous de la moyenne des LLM similaires, et 78,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 3 min 35 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Phi 4 obtient un résultat parfait et la première place sur Ethics (Baseline). Ses scores restent élevés en connaissances générales, en maîtrise des hallucinations et en classification d’e-mails, même si leurs rangs relatifs sont moins favorables. Sur MATH level 5, il se place dans la première moitié du classement. À sa sortie, il figurait dans le top 8% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Ce positionnement confirmait alors de solides aptitudes en raisonnement scientifique. Son affinage combine supervised fine-tuning et direct preference optimization pour améliorer le suivi d’instructions et la sécurité.
Limites et points d'attention. Près de deux ans après sa sortie, ses performances sont probablement largement dépassées et le modèle peut ne plus être proposé par Microsoft. Ses classements actuels sur GPQA diamond, les connaissances générales et les hallucinations se situent loin des premières places, tandis que la classification d’e-mails apparaît en bas de tableau. Ses connaissances s’arrêtent au 1er juin 2024, son contexte reste limité à 16 384 tokens et ses usages visés sont principalement anglophones. Son principal avantage actuel est économique : sa tarification se situe 96% sous la moyenne des LLM similaires et environ 78,6 fois sous celle des modèles frontière.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).