Phi-3.5-MoE-instruct

Sorti le 23 août 2024, Phi-3.5-MoE-instruct est un LLM open-weights de Microsoft sous licence MIT, avec usage commercial autorisé. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont désormais probablement dépassées.

Sorti le 23 août 2024, Phi-3.5-MoE-instruct est un LLM open-weights de Microsoft sous licence MIT, avec usage commercial autorisé. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont désormais probablement dépassées.

Ce Transformer décodeur seul de 60 milliards de paramètres repose sur un mélange de 16 experts de 3,8 milliards de paramètres. Deux experts sont mobilisés à la fois, soit 6,6 milliards de paramètres actifs. Le modèle accepte un contexte de 128K tokens, traite plusieurs langues et privilégie les prompts au format chat.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie23 août 2024
Multimodalnon
Paramètres60 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ARC-C91,0 %10ᵉ / 34llm-statsAuto-déclaré
OpenBookQA89,6 %1ᵉ / 5llm-statsAuto-déclaré
GSM8k88,7 %29ᵉ / 47llm-statsAuto-déclaré
PIQA88,6 %1ᵉ / 11llm-statsAuto-déclaré
RULER87,1 %3ᵉ / 4llm-statsAuto-déclaré
BoolQ84,6 %3ᵉ / 10llm-statsAuto-déclaré
HellaSwag83,8 %14ᵉ / 27llm-statsAuto-déclaré
Winogrande81,3 %9ᵉ / 22llm-statsAuto-déclaré
MBPP80,8 %12ᵉ / 33llm-statsAuto-déclaré
BIG-Bench Hard79,1 %8ᵉ / 20llm-statsAuto-déclaré
MMLU78,9 %66ᵉ / 98llm-statsAuto-déclaré
Social IQa78,0 %1ᵉ / 9llm-statsAuto-déclaré
TruthfulQA77,5 %2ᵉ / 18llm-statsAuto-déclaré
HumanEval70,7 %56ᵉ / 65llm-statsAuto-déclaré
MMMLU69,9 %44ᵉ / 49llm-statsAuto-déclaré
MATH59,5 %48ᵉ / 70llm-statsAuto-déclaré
MGSM58,7 %25ᵉ / 30llm-statsAuto-déclaré
MMLU-Pro45,3 %116ᵉ / 125llm-statsAuto-déclaré
Arena Hard37,9 %22ᵉ / 26llm-statsAuto-déclaré
GPQA36,8 %196ᵉ / 219llm-statsAuto-déclaré
SQuALITY24,1 %2ᵉ / 5llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Phi-3.5-MoE-instruct se classait dans le top 65% des 34 LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son architecture à mélange d’experts limite le nombre de paramètres actifs à chaque génération, malgré une capacité totale de 60 milliards de paramètres. Ce choix répond aux environnements contraints en mémoire ou en calcul ainsi qu’aux scénarios sensibles à la latence. Son contexte de 128K tokens autorise le traitement de longues entrées. Le modèle couvre notamment l’anglais, le français, l’arabe, le chinois, l’allemand, l’espagnol et le japonais. Ses usages visés incluent le raisonnement, le code, les mathématiques et la logique. La licence MIT facilite par ailleurs l’exploitation commerciale et l’adaptation des poids.

Limites et points d'attention. Son classement sur GPQA le situait dans les deux tiers supérieurs de sa génération, sans le placer parmi les références dominantes de l’époque. Avec environ deux ans d’ancienneté, ses performances sont aujourd’hui largement dépassées par celles de générations plus récentes. Comme beaucoup de modèles anciens, il est aussi susceptible d’avoir été retiré du catalogue actif de son éditeur. Son vocabulaire de 32 064 tokens et son orientation chat définissent enfin un cadre technique précis, plutôt qu’un modèle présenté comme universel.


Sources des données : LLM-Stats (llm-stats.com).