Pixtral-12B
Sorti le 17 septembre 2024, Pixtral-12B est un LLM multimodal de Mistral AI, aujourd’hui ancien à l’échelle de l’IA. Près de deux ans après son lancement, il appartient à une génération probablement dépassée par les modèles récents et susceptible de ne plus figurer dans les catalogues…
Sorti le 17 septembre 2024, Pixtral-12B est un LLM multimodal de Mistral AI, aujourd’hui ancien à l’échelle de l’IA. Près de deux ans après son lancement, il appartient à une génération probablement dépassée par les modèles récents et susceptible de ne plus figurer dans les catalogues actuels.
Son architecture associe un décodeur multimodal de 12 milliards de paramètres à un encodeur vision de 400 millions de paramètres. Entraîné nativement sur des séquences mêlant images et texte, il accepte des images de tailles variables, plusieurs images par message et des conversations multi-tours, avec une fenêtre de contexte de 128 000 tokens.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 17 septembre 2024 |
| Multimodal | oui |
| Paramètres | 12 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 90,7 % | 18ᵉ / 26 | llm-stats | Auto-déclaré |
| ChartQA | 81,8 % | 17ᵉ / 24 | llm-stats | Auto-déclaré |
| VQAv2 | 78,6 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MT-Bench | 76,8 % | 11ᵉ / 12 | llm-stats | Auto-déclaré |
| HumanEval | 72,0 % | 54ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU | 69,2 % | 84ᵉ / 98 | llm-stats | Auto-déclaré |
| IFEval | 61,3 % | 64ᵉ / 65 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 60,5 % | 4ᵉ / 17 | llm-stats | Auto-déclaré |
| MathVista | 58,0 % | 27ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 52,5 % | 54ᵉ / 61 | llm-stats | Auto-déclaré |
| MATH | 48,1 % | 57ᵉ / 70 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Pixtral-12B réunit traitement du texte et analyse d’images dans un modèle open-weights sous licence Apache 2.0, avec usage commercial autorisé. Sa longue fenêtre de contexte convient aux séquences associant de nombreux contenus textuels et visuels. Le modèle prend en charge les URL d’images, les échanges comportant plusieurs images et les conversations multi-tours. Son déploiement est prévu avec vLLM en serveur et client, ainsi qu’avec mistral-inference depuis une interface en ligne de commande ou Python.
Limites et points d’attention. À sa sortie, Pixtral-12B se situait seulement dans les 72% les mieux classés sur MATH parmi les LLM de sa génération, un résultat qui ne le plaçait pas dans le haut du panier en raisonnement mathématique. Son ancienneté est désormais très importante dans un secteur qui évolue rapidement, et ses performances sont probablement largement dépassées par celles des modèles récents. Ses connaissances s’arrêtent au 30 juin 2024. Il ne comporte par ailleurs aucun mécanisme de modération, un point critique pour toute exposition à des contenus non contrôlés ou tout déploiement public.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).