IBM Granite 4.0 Tiny Preview
Sorti le 2 mai 2025, IBM Granite 4.0 Tiny Preview est déjà ancien à l’échelle de l’IA. Ce LLM instruct de 7 milliards de paramètres occupait néanmoins une position élevée à son lancement, dans le top 98% des modèles de sa génération sur MMLU.
Sorti le 2 mai 2025, IBM Granite 4.0 Tiny Preview est déjà ancien à l’échelle de l’IA. Ce LLM instruct de 7 milliards de paramètres occupait néanmoins une position élevée à son lancement, dans le top 98% des modèles de sa génération sur MMLU.
IBM combine une architecture hybride mixture-of-experts fine-grained, un supervised fine-tuning et un alignement par reinforcement learning. Le modèle couvre notamment le résumé, la classification, l’extraction, la question-réponse, le RAG, le code, le function calling et le dialogue dans douze langues, dont le français. Ses poids ouverts sous licence Apache 2.0 autorisent les usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 2 mai 2025 |
| Multimodal | non |
| Paramètres | 7 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AttaQ | 86,1 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| HumanEval | 82,4 % | 41ᵉ / 65 | llm-stats | Auto-déclaré |
| HumanEval+ | 78,3 % | 6ᵉ / 10 | llm-stats | Auto-déclaré |
| GSM8k | 70,1 % | 43ᵉ / 47 | llm-stats | Auto-déclaré |
| IFEval | 63,0 % | 62ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU | 60,4 % | 95ᵉ / 98 | llm-stats | Auto-déclaré |
| TruthfulQA | 58,1 % | 10ᵉ / 18 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 55,7 % | 15ᵉ / 20 | llm-stats | Auto-déclaré |
| DROP | 46,2 % | 27ᵉ / 29 | llm-stats | Auto-déclaré |
| AlpacaEval 2.0 | 35,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| Arena Hard | 26,7 % | 26ᵉ / 26 | llm-stats | Auto-déclaré |
| PopQA | 22,9 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, IBM Granite 4.0 Tiny Preview figurait dans le haut du panier de sa génération sur MMLU, un benchmark consacré aux connaissances et au raisonnement général. Son format de chat structuré et son affinage à partir de Granite-4.0-Tiny-Base-Preview le destinent au suivi d’instructions. Son éventail fonctionnel réunit des tâches générales, le RAG, le code, le function calling et les traitements à long contexte. La prise en charge de l’anglais, de l’allemand, de l’espagnol, du français, du japonais, du portugais, de l’arabe, du tchèque, de l’italien, du coréen, du néerlandais et du chinois élargit son champ d’application. La licence Apache 2.0 facilite en outre la réutilisation et l’exploitation commerciale des poids.
Limites et points d'attention. Après environ un an, ce modèle est très ancien au rythme actuel du secteur. Son bon positionnement doit être interprété face aux 65 LLM sortis durant les quelque 18 mois précédant son lancement, et non face aux modèles actuels. Ses performances sont aujourd’hui largement dépassées, tandis que les anciennes versions de prévisualisation sont souvent retirées des catalogues des éditeurs. L’évaluation repose par ailleurs sur une seule source de données concordante, ce qui invite à ne pas généraliser son classement au-delà de MMLU.
Sources des données : LLM-Stats (llm-stats.com).