Phi-4-multimodal-instruct

Sorti le 1er février 2025, Phi-4-multimodal-instruct est un modèle de fondation multimodal léger de Microsoft. Ses 6 milliards de paramètres traitent conjointement le texte, l’image et l’audio, avec une sortie exclusivement textuelle et une fenêtre de contexte de 131 072 tokens.

Sorti le 1er février 2025, Phi-4-multimodal-instruct est un modèle de fondation multimodal léger de Microsoft. Ses 6 milliards de paramètres traitent conjointement le texte, l’image et l’audio, avec une sortie exclusivement textuelle et une fenêtre de contexte de 131 072 tokens.

Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et susceptible de ne plus figurer au catalogue de l’éditeur. Sa licence MIT autorise néanmoins l’usage commercial de ses poids ouverts, tandis que ses connaissances s’arrêtent au 1er juin 2024.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie1 février 2025
Connaissances jusqu'à2024-06-01
Multimodaloui
Paramètres6 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA93,2 %13ᵉ / 26llm-statsAuto-déclaré
MMBench86,7 %3ᵉ / 9llm-statsAuto-déclaré
OCRBench84,4 %16ᵉ / 22llm-statsAuto-déclaré
AI2D82,3 %27ᵉ / 32llm-statsAuto-déclaré
ChartQA81,4 %19ᵉ / 24llm-statsAuto-déclaré
TextVQA75,6 %10ᵉ / 15llm-statsAuto-déclaré
InfoVQA72,7 %5ᵉ / 9llm-statsAuto-déclaré
MathVista62,4 %24ᵉ / 38llm-statsAuto-déclaré
BLINK61,3 %13ᵉ / 13llm-statsAuto-déclaré
MMMU55,1 %50ᵉ / 61llm-statsAuto-déclaré
Video-MME55,0 %17ᵉ / 17llm-statsAuto-déclaré
MMMU-Pro38,5 %61ᵉ / 64llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Phi-4-multimodal-instruct réunit dans un modèle de 6 milliards de paramètres la compréhension de textes, d’images et de contenus audio. Son long contexte se prête au traitement de documents volumineux. Ses usages couvrent le raisonnement mathématique et logique, l’appel de fonctions et d’outils, l’OCR, ainsi que l’analyse de tableaux et de graphiques. Le volet audio comprend la reconnaissance vocale, la traduction, les questions-réponses, le résumé et la compréhension. Le texte est multilingue, tandis que l’audio couvre l’anglais, le chinois, l’allemand, le français, l’italien, le japonais, l’espagnol et le portugais. L’entraînement associe fine-tuning supervisé, direct preference optimization et RLHF afin de renforcer le suivi d’instructions et les mesures de sécurité.

Limites et points d'attention. Malgré son positionnement multimodal, la sortie reste limitée au texte. La compréhension visuelle est prise en charge en anglais, ce qui restreint les traitements d’images comportant d’autres langues. Son ancienneté est également significative dans un secteur qui évolue rapidement : ses performances sont aujourd’hui probablement largement dépassées, et les modèles de cette période sont souvent retirés des catalogues des éditeurs. Enfin, la limite des connaissances à juin 2024 exclut les événements et informations postérieurs.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).