phi-3-medium 14B

Publié par Microsoft le 23 avril 2024, phi-3-medium 14B est un LLM désormais ancien à l’échelle de l’IA. Près de deux ans après sa sortie, il appartient à une génération probablement dépassée et souvent retirée des catalogues des éditeurs.

Publié par Microsoft le 23 avril 2024, phi-3-medium 14B est un LLM désormais ancien à l’échelle de l’IA. Près de deux ans après sa sortie, il appartient à une génération probablement dépassée et souvent retirée des catalogues des éditeurs.

À son lancement, le modèle se classait dans le top 82% des LLM de sa génération sur GPQA diamond. Cette position modeste dès 2024 invite surtout à l’examiner comme un jalon de la gamme phi-3 de Microsoft, plutôt que comme une référence actuelle.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids▫ n.d.
Date de sortie23 avril 2024

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond27,6 %77ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 517,6 %47ᵉ / 59epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Yi-1.5-34B32 %
▶ phi-3-medium 14B28 %

Epoch: MATH level 5

GPT-598 %
Hermes 2 Theta Llama-3 …23 %
▶ phi-3-medium 14B18 %
DBRX12 %

Notre analyse

Forces. Le résultat le moins faible apparaît sur MATH level 5, où phi-3-medium 14B évite les toutes dernières places du classement. Sur GPQA diamond, qui mesure la capacité à répondre à des questions scientifiques de niveau doctorat, son classement à la sortie le situait dans le top 82% des 28 LLM publiés au cours des quelque 18 mois précédents. Les résultats disponibles reposent sur deux sources de données concordantes.

Limites et points d’attention. Les performances absolues restent basses sur les deux évaluations. Le modèle se place 128e sur 137 à GPQA diamond, avec 28%, et 70e sur 84 à MATH level 5, avec 18%. Ces positions indiquent des difficultés marquées en raisonnement scientifique avancé et sur les problèmes mathématiques les plus exigeants. Son ancienneté est également déterminante : près de deux ans représentent une durée très longue dans l’IA, ce qui rend ses performances probablement largement dépassées aujourd’hui. Un modèle de cette période peut aussi ne plus être proposé au catalogue de son éditeur.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.