Pixtral Large
Sorti le 18 novembre 2024, Pixtral Large est un LLM multimodal français de Mistral AI. Ce modèle de 124 milliards de paramètres associe un décodeur multimodal de 123 milliards à un encodeur visuel de 1 milliard, sur une base Mistral Large 2.
Sorti le 18 novembre 2024, Pixtral Large est un LLM multimodal français de Mistral AI. Ce modèle de 124 milliards de paramètres associe un décodeur multimodal de 123 milliards à un encodeur visuel de 1 milliard, sur une base Mistral Large 2.
Déjà ancien à l’échelle rapide de l’IA, il combine traitement du texte et analyse de documents, de graphiques et d’images naturelles. Sa fenêtre de contexte de 128 000 tokens accepte au minimum 30 images en haute résolution, un format adapté aux entrées visuelles volumineuses.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Mistral Research License (MRL) for research; Mistral Commercial License for commercial use |
| Date de sortie | 18 novembre 2024 |
| Multimodal | oui |
| Paramètres | 124 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AI2D | 93,8 % | 4ᵉ / 32 | llm-stats | Auto-déclaré |
| DocVQA | 93,3 % | 11ᵉ / 26 | llm-stats | Auto-déclaré |
| ChartQA | 88,1 % | 7ᵉ / 24 | llm-stats | Auto-déclaré |
| VQAv2 | 80,9 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 74,0 % | 3ᵉ / 17 | llm-stats | Auto-déclaré |
| MathVista | 69,4 % | 15ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 64,0 % | 37ᵉ / 61 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 104ᵉ | AllenAI: Molmo2 8B | 1107 |
| 105ᵉ | GPT-4o mini | 1098 |
| 106ᵉ | Pixtral Large | 1095 |
| 107ᵉ | GPT-4.1 nano | 1089 |
| 108ᵉ | qwen-vl-max-1119 | 1085 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | France |
Notre analyse
Forces. Pixtral Large réunit dans un même modèle l’analyse visuelle et les capacités textuelles de Mistral Large 2. Son contexte étendu peut accueillir au minimum 30 images haute résolution, ce qui favorise l’examen conjoint de documents illustrés, de graphiques et d’images naturelles. Son architecture consacre 1 milliard de paramètres à l’encodage visuel et 123 milliards au décodeur multimodal. Le template instruct renforce en outre la prise en charge des prompts système.
Limites et points d'attention. Son classement dans Arena vision se situe près du bas du tableau, très loin du modèle en tête, ce qui traduit un niveau aujourd’hui largement dépassé face aux systèmes visuels plus récents. Son millésime 2024 est désormais ancien dans un secteur renouvelé rapidement. L’implémentation Transformers n’est pas fonctionnelle, l’exécution repose donc sur vLLM. Les poids ne sont pas ouverts : la Mistral Research License encadre la recherche, tandis qu’une Mistral Commercial License est requise pour les usages commerciaux.
Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.