Phi-3.5-MoE-instruct
Sorti le 23 août 2024, Phi-3.5-MoE-instruct est un LLM open-weights de Microsoft sous licence MIT, avec usage commercial autorisé. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont désormais probablement dépassées.
Sorti le 23 août 2024, Phi-3.5-MoE-instruct est un LLM open-weights de Microsoft sous licence MIT, avec usage commercial autorisé. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont désormais probablement dépassées.
Ce Transformer décodeur seul de 60 milliards de paramètres repose sur un mélange de 16 experts de 3,8 milliards de paramètres. Deux experts sont mobilisés à la fois, soit 6,6 milliards de paramètres actifs. Le modèle accepte un contexte de 128K tokens, traite plusieurs langues et privilégie les prompts au format chat.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 23 août 2024 |
| Multimodal | non |
| Paramètres | 60 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| ARC-C | 91,0 % | 10ᵉ / 34 | llm-stats | Auto-déclaré |
| OpenBookQA | 89,6 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| GSM8k | 88,7 % | 29ᵉ / 47 | llm-stats | Auto-déclaré |
| PIQA | 88,6 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| RULER | 87,1 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| BoolQ | 84,6 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| HellaSwag | 83,8 % | 14ᵉ / 27 | llm-stats | Auto-déclaré |
| Winogrande | 81,3 % | 9ᵉ / 22 | llm-stats | Auto-déclaré |
| MBPP | 80,8 % | 12ᵉ / 33 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 79,1 % | 8ᵉ / 20 | llm-stats | Auto-déclaré |
| MMLU | 78,9 % | 66ᵉ / 98 | llm-stats | Auto-déclaré |
| Social IQa | 78,0 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| TruthfulQA | 77,5 % | 2ᵉ / 18 | llm-stats | Auto-déclaré |
| HumanEval | 70,7 % | 56ᵉ / 65 | llm-stats | Auto-déclaré |
| MMMLU | 69,9 % | 44ᵉ / 49 | llm-stats | Auto-déclaré |
| MATH | 59,5 % | 48ᵉ / 70 | llm-stats | Auto-déclaré |
| MGSM | 58,7 % | 25ᵉ / 30 | llm-stats | Auto-déclaré |
| MMLU-Pro | 45,3 % | 116ᵉ / 125 | llm-stats | Auto-déclaré |
| Arena Hard | 37,9 % | 22ᵉ / 26 | llm-stats | Auto-déclaré |
| GPQA | 36,8 % | 196ᵉ / 219 | llm-stats | Auto-déclaré |
| SQuALITY | 24,1 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, Phi-3.5-MoE-instruct se classait dans le top 65% des 34 LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son architecture à mélange d’experts limite le nombre de paramètres actifs à chaque génération, malgré une capacité totale de 60 milliards de paramètres. Ce choix répond aux environnements contraints en mémoire ou en calcul ainsi qu’aux scénarios sensibles à la latence. Son contexte de 128K tokens autorise le traitement de longues entrées. Le modèle couvre notamment l’anglais, le français, l’arabe, le chinois, l’allemand, l’espagnol et le japonais. Ses usages visés incluent le raisonnement, le code, les mathématiques et la logique. La licence MIT facilite par ailleurs l’exploitation commerciale et l’adaptation des poids.
Limites et points d'attention. Son classement sur GPQA le situait dans les deux tiers supérieurs de sa génération, sans le placer parmi les références dominantes de l’époque. Avec environ deux ans d’ancienneté, ses performances sont aujourd’hui largement dépassées par celles de générations plus récentes. Comme beaucoup de modèles anciens, il est aussi susceptible d’avoir été retiré du catalogue actif de son éditeur. Son vocabulaire de 32 064 tokens et son orientation chat définissent enfin un cadre technique précis, plutôt qu’un modèle présenté comme universel.
Sources des données : LLM-Stats (llm-stats.com).