Phi-3.5-vision-instruct
Publié par Microsoft le 23 août 2024, Phi-3.5-vision-instruct est un modèle multimodal ouvert de la famille Phi-3. Avec près de deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.
Publié par Microsoft le 23 août 2024, Phi-3.5-vision-instruct est un modèle multimodal ouvert de la famille Phi-3. Avec près de deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.
Son architecture de 4,2 milliards de paramètres associe un encodeur d’image, un connecteur, un projecteur et Phi-3 Mini. Le modèle reçoit du texte et des images, puis produit du texte, avec une fenêtre de contexte de 128 000 tokens. Sa licence MIT autorise les usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 23 août 2024 |
| Multimodal | oui |
| Paramètres | 4 milliards |
| Fenêtre de contexte | 128 000 tokens |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMBench | 81,9 % | 6ᵉ / 9 | llm-stats | Auto-déclaré |
| ChartQA | 81,8 % | 17ᵉ / 24 | llm-stats | Auto-déclaré |
| AI2D | 78,1 % | 30ᵉ / 32 | llm-stats | Auto-déclaré |
| TextVQA | 72,0 % | 12ᵉ / 15 | llm-stats | Auto-déclaré |
| MathVista | 43,9 % | 37ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 43,0 % | 59ᵉ / 61 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 132ᵉ | minicpm-v-2_6 | 963 |
| 133ᵉ | internvl2-4b | 958 |
| 134ᵉ | Phi-3.5-vision-instruct | 920 |
| 135ᵉ | phi-3-vision-128k-instruct | 882 |
Notre analyse
Forces. Phi-3.5-vision-instruct réunit traitement du texte et analyse d’images dans un modèle relativement compact, ouvert et exploitable commercialement. Sa fenêtre de 128 000 tokens convient aux entrées longues et aux ensembles de plusieurs images. Ses usages couvrent la compréhension générale d’images, l’OCR, l’interprétation de graphiques et de tableaux, la comparaison d’images ainsi que le résumé de séquences multi-image ou de clips vidéo. Il est particulièrement adapté aux prompts structurés comme une conversation. L’ouverture des poids et la licence MIT restent ses principaux atouts pour la recherche, l’expérimentation et les déploiements contrôlés.
Limites et points d’attention. Son classement dans Arena vision le place presque au dernier rang du panel évalué, très loin du modèle en tête. Ce résultat indique une qualité visuelle aujourd’hui largement dépassée par les modèles haut de gamme. Son ancienneté renforce ce constat : les modèles de sa période sont fréquemment remplacés ou retirés des catalogues des éditeurs. Enfin, Phi-3.5-vision-instruct vise principalement les usages en anglais et offre des performances moins bonnes dans les autres langues, ce qui limite sa pertinence pour des contenus francophones ou multilingues.
Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai).