IBM Granite 4.0 Tiny Preview

Sorti le 2 mai 2025, IBM Granite 4.0 Tiny Preview est déjà ancien à l’échelle de l’IA. Ce LLM instruct de 7 milliards de paramètres occupait néanmoins une position élevée à son lancement, dans le top 98% des modèles de sa génération sur MMLU.

Sorti le 2 mai 2025, IBM Granite 4.0 Tiny Preview est déjà ancien à l’échelle de l’IA. Ce LLM instruct de 7 milliards de paramètres occupait néanmoins une position élevée à son lancement, dans le top 98% des modèles de sa génération sur MMLU.

IBM combine une architecture hybride mixture-of-experts fine-grained, un supervised fine-tuning et un alignement par reinforcement learning. Le modèle couvre notamment le résumé, la classification, l’extraction, la question-réponse, le RAG, le code, le function calling et le dialogue dans douze langues, dont le français. Ses poids ouverts sous licence Apache 2.0 autorisent les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurIBM
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie2 mai 2025
Multimodalnon
Paramètres7 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AttaQ86,1 %3ᵉ / 3llm-statsAuto-déclaré
HumanEval82,4 %41ᵉ / 65llm-statsAuto-déclaré
HumanEval+78,3 %6ᵉ / 10llm-statsAuto-déclaré
GSM8k70,1 %43ᵉ / 47llm-statsAuto-déclaré
IFEval63,0 %62ᵉ / 65llm-statsAuto-déclaré
MMLU60,4 %95ᵉ / 98llm-statsAuto-déclaré
TruthfulQA58,1 %10ᵉ / 18llm-statsAuto-déclaré
BIG-Bench Hard55,7 %15ᵉ / 20llm-statsAuto-déclaré
DROP46,2 %27ᵉ / 29llm-statsAuto-déclaré
AlpacaEval 2.035,2 %4ᵉ / 4llm-statsAuto-déclaré
Arena Hard26,7 %26ᵉ / 26llm-statsAuto-déclaré
PopQA22,9 %3ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, IBM Granite 4.0 Tiny Preview figurait dans le haut du panier de sa génération sur MMLU, un benchmark consacré aux connaissances et au raisonnement général. Son format de chat structuré et son affinage à partir de Granite-4.0-Tiny-Base-Preview le destinent au suivi d’instructions. Son éventail fonctionnel réunit des tâches générales, le RAG, le code, le function calling et les traitements à long contexte. La prise en charge de l’anglais, de l’allemand, de l’espagnol, du français, du japonais, du portugais, de l’arabe, du tchèque, de l’italien, du coréen, du néerlandais et du chinois élargit son champ d’application. La licence Apache 2.0 facilite en outre la réutilisation et l’exploitation commerciale des poids.

Limites et points d'attention. Après environ un an, ce modèle est très ancien au rythme actuel du secteur. Son bon positionnement doit être interprété face aux 65 LLM sortis durant les quelque 18 mois précédant son lancement, et non face aux modèles actuels. Ses performances sont aujourd’hui largement dépassées, tandis que les anciennes versions de prévisualisation sont souvent retirées des catalogues des éditeurs. L’évaluation repose par ailleurs sur une seule source de données concordante, ce qui invite à ne pas généraliser son classement au-delà de MMLU.


Sources des données : LLM-Stats (llm-stats.com).