Phi-3.5-vision-instruct

Publié par Microsoft le 23 août 2024, Phi-3.5-vision-instruct est un modèle multimodal ouvert de la famille Phi-3. Avec près de deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.

Publié par Microsoft le 23 août 2024, Phi-3.5-vision-instruct est un modèle multimodal ouvert de la famille Phi-3. Avec près de deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.

Son architecture de 4,2 milliards de paramètres associe un encodeur d’image, un connecteur, un projecteur et Phi-3 Mini. Le modèle reçoit du texte et des images, puis produit du texte, avec une fenêtre de contexte de 128 000 tokens. Sa licence MIT autorise les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie23 août 2024
Multimodaloui
Paramètres4 milliards
Fenêtre de contexte128 000 tokens

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MMBench81,9 %6ᵉ / 9llm-statsAuto-déclaré
ChartQA81,8 %17ᵉ / 24llm-statsAuto-déclaré
AI2D78,1 %30ᵉ / 32llm-statsAuto-déclaré
TextVQA72,0 %12ᵉ / 15llm-statsAuto-déclaré
MathVista43,9 %37ᵉ / 38llm-statsAuto-déclaré
MMMU43,0 %59ᵉ / 61llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
132ᵉminicpm-v-2_6963
133ᵉinternvl2-4b958
134ᵉPhi-3.5-vision-instruct920
135ᵉphi-3-vision-128k-instruct882

Notre analyse

Forces. Phi-3.5-vision-instruct réunit traitement du texte et analyse d’images dans un modèle relativement compact, ouvert et exploitable commercialement. Sa fenêtre de 128 000 tokens convient aux entrées longues et aux ensembles de plusieurs images. Ses usages couvrent la compréhension générale d’images, l’OCR, l’interprétation de graphiques et de tableaux, la comparaison d’images ainsi que le résumé de séquences multi-image ou de clips vidéo. Il est particulièrement adapté aux prompts structurés comme une conversation. L’ouverture des poids et la licence MIT restent ses principaux atouts pour la recherche, l’expérimentation et les déploiements contrôlés.

Limites et points d’attention. Son classement dans Arena vision le place presque au dernier rang du panel évalué, très loin du modèle en tête. Ce résultat indique une qualité visuelle aujourd’hui largement dépassée par les modèles haut de gamme. Son ancienneté renforce ce constat : les modèles de sa période sont fréquemment remplacés ou retirés des catalogues des éditeurs. Enfin, Phi-3.5-vision-instruct vise principalement les usages en anglais et offre des performances moins bonnes dans les autres langues, ce qui limite sa pertinence pour des contenus francophones ou multilingues.


Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai).