Phi-3.5-mini-instruct
Sorti le 23 août 2024, Phi-3.5-mini-instruct est un LLM léger de Microsoft comptant 4 milliards de paramètres. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les performances sont probablement dépassées par celles des modèles plus…
Sorti le 23 août 2024, Phi-3.5-mini-instruct est un LLM léger de Microsoft comptant 4 milliards de paramètres. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les performances sont probablement dépassées par celles des modèles plus récents.
Son positionnement repose sur une fenêtre de contexte de 128 000 tokens et sur un fonctionnement adapté aux environnements contraints en mémoire ou en calcul, ainsi qu’aux scénarios sensibles à la latence. Distribué sous licence MIT avec usage commercial autorisé, ce modèle open-weights vise des usages multilingues de recherche et de production, principalement avec des prompts au format chat.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 23 août 2024 |
| Multimodal | non |
| Paramètres | 4 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 86,2 % | 33ᵉ / 47 | llm-stats | Auto-déclaré |
| ARC-C | 84,6 % | 14ᵉ / 34 | llm-stats | Auto-déclaré |
| RULER | 84,1 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| PIQA | 81,0 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| OpenBookQA | 79,2 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
| BoolQ | 78,0 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| Social IQa | 74,7 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| MBPP | 69,6 % | 23ᵉ / 33 | llm-stats | Auto-déclaré |
| HellaSwag | 69,4 % | 25ᵉ / 27 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 69,0 % | 14ᵉ / 20 | llm-stats | Auto-déclaré |
| MMLU | 69,0 % | 85ᵉ / 98 | llm-stats | Auto-déclaré |
| Winogrande | 68,5 % | 18ᵉ / 22 | llm-stats | Auto-déclaré |
| TruthfulQA | 64,0 % | 5ᵉ / 18 | llm-stats | Auto-déclaré |
| HumanEval | 62,8 % | 61ᵉ / 65 | llm-stats | Auto-déclaré |
| MMMLU | 55,4 % | 48ᵉ / 49 | llm-stats | Auto-déclaré |
| MATH | 48,5 % | 56ᵉ / 70 | llm-stats | Auto-déclaré |
| MGSM | 47,9 % | 30ᵉ / 30 | llm-stats | Auto-déclaré |
| MMLU-Pro | 47,4 % | 113ᵉ / 125 | llm-stats | Auto-déclaré |
| Arena Hard | 37,0 % | 23ᵉ / 26 | llm-stats | Auto-déclaré |
| GPQA | 30,4 % | 209ᵉ / 219 | llm-stats | Auto-déclaré |
| SQuALITY | 24,3 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Phi-3.5-mini-instruct associe un format compact de 4 milliards de paramètres à un contexte de 128 000 tokens, une combinaison pensée pour traiter de longues entrées avec des ressources limitées. Microsoft le destine notamment au raisonnement en code, en mathématiques et en logique, ainsi qu’aux usages multilingues. À sa sortie, son résultat sur GPQA le plaçait dans le top 91% des 34 LLM de sa génération. Son post-entraînement combine fine-tuning supervisé, proximal policy optimization et direct preference optimization. La licence MIT autorise par ailleurs les usages commerciaux et facilite l’exploitation de ses poids ouverts.
Limites et points d’attention. Son ancienneté est désormais importante dans un secteur qui évolue rapidement. Ses performances sont aujourd’hui probablement largement dépassées par celles des modèles récents, et les modèles de cette période sont souvent retirés du catalogue de leur éditeur. Ses connaissances s’arrêtent au 31 mars 2024, ce qui limite sa pertinence sur les événements et informations postérieurs. Son positionnement reste celui d’un petit modèle optimisé pour les contraintes de mémoire, de calcul et de latence, plutôt que celui d’un modèle haut de gamme. Les données d’entraînement reposent sur des contenus synthétiques et des sites web publics filtrés utilisés pour Phi-3.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).