Phi 4

Publié par Microsoft le 12 décembre 2024, Phi 4 est un LLM open-weights sous licence MIT, utilisable commercialement. Près de deux ans représentent une très longue période en IA : ce modèle de 15 milliards de paramètres appartient désormais à une génération probablement dépassée et peut…

Publié par Microsoft le 12 décembre 2024, Phi 4 est un LLM open-weights sous licence MIT, utilisable commercialement. Près de deux ans représentent une très longue période en IA : ce modèle de 15 milliards de paramètres appartient désormais à une génération probablement dépassée et peut avoir disparu des catalogues actuels.

Ce Transformer dense à décodeur seul a été entraîné sur des données synthétiques, des sites publics filtrés, des livres académiques acquis et des jeux de questions-réponses. Affiné pour le suivi d’instructions et la sécurité, il cible surtout l’anglais, le raisonnement et les environnements contraints en calcul, avec un contexte de 16 384 tokens et un tarif très économique.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie12 décembre 2024
Connaissances jusqu'à2024-06-01
Multimodalnon
Paramètres15 milliards
Fenêtre de contexte16 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MMLU84,8 %43ᵉ / 98llm-statsAuto-déclaré
HumanEval+82,8 %5ᵉ / 10llm-statsAuto-déclaré
HumanEval82,6 %40ᵉ / 65llm-statsAuto-déclaré
MGSM80,6 %18ᵉ / 30llm-statsAuto-déclaré
MATH80,4 %19ᵉ / 70llm-statsAuto-déclaré
DROP75,5 %18ᵉ / 29llm-statsAuto-déclaré
Arena Hard75,4 %9ᵉ / 26llm-statsAuto-déclaré
MMLU-Pro70,4 %78ᵉ / 125llm-statsAuto-déclaré
IFEval63,0 %62ᵉ / 65llm-statsAuto-déclaré
PhiBench56,2 %3ᵉ / 3llm-statsAuto-déclaré
GPQA56,1 %152ᵉ / 219llm-statsAuto-déclaré
LiveBench47,6 %36ᵉ / 38llm-statsAuto-déclaré
SimpleQA3,0 %43ᵉ / 45llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,07 $0,14 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 97 % en dessous de la moyenne des LLM similaires, et 78,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable3 min 35 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Phi 4 obtient un résultat parfait et la première place sur Ethics (Baseline). Ses scores restent élevés en connaissances générales, en maîtrise des hallucinations et en classification d’e-mails, même si leurs rangs relatifs sont moins favorables. Sur MATH level 5, il se place dans la première moitié du classement. À sa sortie, il figurait dans le top 8% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Ce positionnement confirmait alors de solides aptitudes en raisonnement scientifique. Son affinage combine supervised fine-tuning et direct preference optimization pour améliorer le suivi d’instructions et la sécurité.

Limites et points d'attention. Près de deux ans après sa sortie, ses performances sont probablement largement dépassées et le modèle peut ne plus être proposé par Microsoft. Ses classements actuels sur GPQA diamond, les connaissances générales et les hallucinations se situent loin des premières places, tandis que la classification d’e-mails apparaît en bas de tableau. Ses connaissances s’arrêtent au 1er juin 2024, son contexte reste limité à 16 384 tokens et ses usages visés sont principalement anglophones. Son principal avantage actuel est économique : sa tarification se situe 96% sous la moyenne des LLM similaires et environ 78,6 fois sous celle des modèles frontière.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).