Phi-4-multimodal-instruct
Sorti le 1er février 2025, Phi-4-multimodal-instruct est un modèle de fondation multimodal léger de Microsoft. Ses 6 milliards de paramètres traitent conjointement le texte, l’image et l’audio, avec une sortie exclusivement textuelle et une fenêtre de contexte de 131 072 tokens.
Sorti le 1er février 2025, Phi-4-multimodal-instruct est un modèle de fondation multimodal léger de Microsoft. Ses 6 milliards de paramètres traitent conjointement le texte, l’image et l’audio, avec une sortie exclusivement textuelle et une fenêtre de contexte de 131 072 tokens.
Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et susceptible de ne plus figurer au catalogue de l’éditeur. Sa licence MIT autorise néanmoins l’usage commercial de ses poids ouverts, tandis que ses connaissances s’arrêtent au 1er juin 2024.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 1 février 2025 |
| Connaissances jusqu'à | 2024-06-01 |
| Multimodal | oui |
| Paramètres | 6 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 93,2 % | 13ᵉ / 26 | llm-stats | Auto-déclaré |
| MMBench | 86,7 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| OCRBench | 84,4 % | 16ᵉ / 22 | llm-stats | Auto-déclaré |
| AI2D | 82,3 % | 27ᵉ / 32 | llm-stats | Auto-déclaré |
| ChartQA | 81,4 % | 19ᵉ / 24 | llm-stats | Auto-déclaré |
| TextVQA | 75,6 % | 10ᵉ / 15 | llm-stats | Auto-déclaré |
| InfoVQA | 72,7 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| MathVista | 62,4 % | 24ᵉ / 38 | llm-stats | Auto-déclaré |
| BLINK | 61,3 % | 13ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMU | 55,1 % | 50ᵉ / 61 | llm-stats | Auto-déclaré |
| Video-MME | 55,0 % | 17ᵉ / 17 | llm-stats | Auto-déclaré |
| MMMU-Pro | 38,5 % | 61ᵉ / 64 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Phi-4-multimodal-instruct réunit dans un modèle de 6 milliards de paramètres la compréhension de textes, d’images et de contenus audio. Son long contexte se prête au traitement de documents volumineux. Ses usages couvrent le raisonnement mathématique et logique, l’appel de fonctions et d’outils, l’OCR, ainsi que l’analyse de tableaux et de graphiques. Le volet audio comprend la reconnaissance vocale, la traduction, les questions-réponses, le résumé et la compréhension. Le texte est multilingue, tandis que l’audio couvre l’anglais, le chinois, l’allemand, le français, l’italien, le japonais, l’espagnol et le portugais. L’entraînement associe fine-tuning supervisé, direct preference optimization et RLHF afin de renforcer le suivi d’instructions et les mesures de sécurité.
Limites et points d'attention. Malgré son positionnement multimodal, la sortie reste limitée au texte. La compréhension visuelle est prise en charge en anglais, ce qui restreint les traitements d’images comportant d’autres langues. Son ancienneté est également significative dans un secteur qui évolue rapidement : ses performances sont aujourd’hui probablement largement dépassées, et les modèles de cette période sont souvent retirés des catalogues des éditeurs. Enfin, la limite des connaissances à juin 2024 exclut les événements et informations postérieurs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).