Phi-3.5-mini-instruct

Sorti le 23 août 2024, Phi-3.5-mini-instruct est un LLM léger de Microsoft comptant 4 milliards de paramètres. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les performances sont probablement dépassées par celles des modèles plus…

Sorti le 23 août 2024, Phi-3.5-mini-instruct est un LLM léger de Microsoft comptant 4 milliards de paramètres. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les performances sont probablement dépassées par celles des modèles plus récents.

Son positionnement repose sur une fenêtre de contexte de 128 000 tokens et sur un fonctionnement adapté aux environnements contraints en mémoire ou en calcul, ainsi qu’aux scénarios sensibles à la latence. Distribué sous licence MIT avec usage commercial autorisé, ce modèle open-weights vise des usages multilingues de recherche et de production, principalement avec des prompts au format chat.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie23 août 2024
Multimodalnon
Paramètres4 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
GSM8k86,2 %33ᵉ / 47llm-statsAuto-déclaré
ARC-C84,6 %14ᵉ / 34llm-statsAuto-déclaré
RULER84,1 %4ᵉ / 4llm-statsAuto-déclaré
PIQA81,0 %5ᵉ / 11llm-statsAuto-déclaré
OpenBookQA79,2 %2ᵉ / 5llm-statsAuto-déclaré
BoolQ78,0 %8ᵉ / 10llm-statsAuto-déclaré
Social IQa74,7 %2ᵉ / 9llm-statsAuto-déclaré
MBPP69,6 %23ᵉ / 33llm-statsAuto-déclaré
HellaSwag69,4 %25ᵉ / 27llm-statsAuto-déclaré
BIG-Bench Hard69,0 %14ᵉ / 20llm-statsAuto-déclaré
MMLU69,0 %85ᵉ / 98llm-statsAuto-déclaré
Winogrande68,5 %18ᵉ / 22llm-statsAuto-déclaré
TruthfulQA64,0 %5ᵉ / 18llm-statsAuto-déclaré
HumanEval62,8 %61ᵉ / 65llm-statsAuto-déclaré
MMMLU55,4 %48ᵉ / 49llm-statsAuto-déclaré
MATH48,5 %56ᵉ / 70llm-statsAuto-déclaré
MGSM47,9 %30ᵉ / 30llm-statsAuto-déclaré
MMLU-Pro47,4 %113ᵉ / 125llm-statsAuto-déclaré
Arena Hard37,0 %23ᵉ / 26llm-statsAuto-déclaré
GPQA30,4 %209ᵉ / 219llm-statsAuto-déclaré
SQuALITY24,3 %1ᵉ / 5llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Phi-3.5-mini-instruct associe un format compact de 4 milliards de paramètres à un contexte de 128 000 tokens, une combinaison pensée pour traiter de longues entrées avec des ressources limitées. Microsoft le destine notamment au raisonnement en code, en mathématiques et en logique, ainsi qu’aux usages multilingues. À sa sortie, son résultat sur GPQA le plaçait dans le top 91% des 34 LLM de sa génération. Son post-entraînement combine fine-tuning supervisé, proximal policy optimization et direct preference optimization. La licence MIT autorise par ailleurs les usages commerciaux et facilite l’exploitation de ses poids ouverts.

Limites et points d’attention. Son ancienneté est désormais importante dans un secteur qui évolue rapidement. Ses performances sont aujourd’hui probablement largement dépassées par celles des modèles récents, et les modèles de cette période sont souvent retirés du catalogue de leur éditeur. Ses connaissances s’arrêtent au 31 mars 2024, ce qui limite sa pertinence sur les événements et informations postérieurs. Son positionnement reste celui d’un petit modèle optimisé pour les contraintes de mémoire, de calcul et de latence, plutôt que celui d’un modèle haut de gamme. Les données d’entraînement reposent sur des contenus synthétiques et des sites web publics filtrés utilisés pour Phi-3.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).