Phi 4 Mini

Sorti le 30 avril 2025, Phi 4 Mini est déjà ancien à l’échelle de l’IA : près d’un an suffit à le séparer nettement des modèles actuels. Microsoft l’a positionné comme un LLM léger de 4 milliards de paramètres, adapté aux environnements contraints en mémoire ou en calcul et aux…

Sorti le 30 avril 2025, Phi 4 Mini est déjà ancien à l’échelle de l’IA : près d’un an suffit à le séparer nettement des modèles actuels. Microsoft l’a positionné comme un LLM léger de 4 milliards de paramètres, adapté aux environnements contraints en mémoire ou en calcul et aux applications sensibles à la latence.

Ce modèle open-weights sous licence MIT autorise les usages commerciaux. Son contexte atteint 131 072 tokens et ses connaissances s’arrêtent au 1er juin 2024. Son entraînement combine données synthétiques, sites publics filtrés, fine-tuning supervisé et optimisation directe des préférences, avec un accent sur le raisonnement, le multilingue, le suivi d’instructions, la sécurité et le function calling.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie30 avril 2025
Connaissances jusqu'à2024-06-01
Multimodalnon
Paramètres4 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50094,6 %18ᵉ / 31llm-statsAuto-déclaré
GSM8k88,6 %31ᵉ / 47llm-statsAuto-déclaré
ARC-C83,7 %15ᵉ / 34llm-statsAuto-déclaré
BoolQ81,2 %7ᵉ / 10llm-statsAuto-déclaré
OpenBookQA79,2 %2ᵉ / 5llm-statsAuto-déclaré
PIQA77,6 %10ᵉ / 11llm-statsAuto-déclaré
Social IQa72,5 %3ᵉ / 9llm-statsAuto-déclaré
BIG-Bench Hard70,4 %11ᵉ / 20llm-statsAuto-déclaré
HellaSwag69,1 %26ᵉ / 27llm-statsAuto-déclaré
MMLU67,3 %88ᵉ / 98llm-statsAuto-déclaré
Winogrande67,0 %19ᵉ / 22llm-statsAuto-déclaré
TruthfulQA66,4 %4ᵉ / 18llm-statsAuto-déclaré
MATH64,0 %44ᵉ / 70llm-statsAuto-déclaré
MGSM63,9 %23ᵉ / 30llm-statsAuto-déclaré
MMLU-Pro52,8 %107ᵉ / 125llm-statsAuto-déclaré
Multilingual MMLU49,3 %5ᵉ / 5llm-statsAuto-déclaré
Arena Hard32,8 %24ᵉ / 26llm-statsAuto-déclaré
GPQA25,2 %213ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Phi 4 Mini se situait dans le top 97% des LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Ce résultat le plaçait favorablement parmi 92 modèles publiés au cours des quelque 18 mois précédents, malgré un format limité à 4 milliards de paramètres. Son architecture orientée vers l’efficacité et son vocabulaire élargi ciblent les déploiements multilingues disposant de peu de mémoire ou de puissance de calcul. La fenêtre de 131 072 tokens autorise aussi le traitement de contenus longs. Le post-entraînement vise directement le suivi d’instructions, le function calling, les mathématiques et la logique.

Limites et points d’attention. Son ancienneté est son principal handicap. À l’échelle très rapide des LLM, un modèle proche d’un an est probablement largement dépassé par les générations récentes et peut déjà avoir été retiré du catalogue courant de son éditeur. Son classement GPQA décrit sa position en avril 2025, pas sa compétitivité actuelle. La coupure des connaissances au 1er juin 2024 exclut en outre les événements et informations postérieurs. Phi 4 Mini conserve surtout un intérêt comme modèle ouvert, compact et exploitable commercialement, plutôt que comme référence de performance contemporaine.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).