Pixtral Large

Sorti le 18 novembre 2024, Pixtral Large est un LLM multimodal français de Mistral AI. Ce modèle de 124 milliards de paramètres associe un décodeur multimodal de 123 milliards à un encodeur visuel de 1 milliard, sur une base Mistral Large 2.

Sorti le 18 novembre 2024, Pixtral Large est un LLM multimodal français de Mistral AI. Ce modèle de 124 milliards de paramètres associe un décodeur multimodal de 123 milliards à un encodeur visuel de 1 milliard, sur une base Mistral Large 2.

Déjà ancien à l’échelle rapide de l’IA, il combine traitement du texte et analyse de documents, de graphiques et d’images naturelles. Sa fenêtre de contexte de 128 000 tokens accepte au minimum 30 images en haute résolution, un format adapté aux entrées visuelles volumineuses.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceMistral Research License (MRL) for research; Mistral Commercial License for commercial use
Date de sortie18 novembre 2024
Multimodaloui
Paramètres124 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AI2D93,8 %4ᵉ / 32llm-statsAuto-déclaré
DocVQA93,3 %11ᵉ / 26llm-statsAuto-déclaré
ChartQA88,1 %7ᵉ / 24llm-statsAuto-déclaré
VQAv280,9 %1ᵉ / 3llm-statsAuto-déclaré
MM-MT-Bench74,0 %3ᵉ / 17llm-statsAuto-déclaré
MathVista69,4 %15ᵉ / 38llm-statsAuto-déclaré
MMMU64,0 %37ᵉ / 61llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
104ᵉAllenAI: Molmo2 8B1107
105ᵉGPT-4o mini1098
106ᵉPixtral Large1095
107ᵉGPT-4.1 nano1089
108ᵉqwen-vl-max-11191085

Entraînement & empreinte

IndicateurValeur
PaysFrance

Notre analyse

Forces. Pixtral Large réunit dans un même modèle l’analyse visuelle et les capacités textuelles de Mistral Large 2. Son contexte étendu peut accueillir au minimum 30 images haute résolution, ce qui favorise l’examen conjoint de documents illustrés, de graphiques et d’images naturelles. Son architecture consacre 1 milliard de paramètres à l’encodage visuel et 123 milliards au décodeur multimodal. Le template instruct renforce en outre la prise en charge des prompts système.

Limites et points d'attention. Son classement dans Arena vision se situe près du bas du tableau, très loin du modèle en tête, ce qui traduit un niveau aujourd’hui largement dépassé face aux systèmes visuels plus récents. Son millésime 2024 est désormais ancien dans un secteur renouvelé rapidement. L’implémentation Transformers n’est pas fonctionnelle, l’exécution repose donc sur vLLM. Les poids ne sont pas ouverts : la Mistral Research License encadre la recherche, tandis qu’une Mistral Commercial License est requise pour les usages commerciaux.


Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.