granite-4.0-h-micro
Sorti le 20 octobre 2025, granite-4.0-h-micro est un LLM à poids ouverts développé par IBM. Ce modèle d’instructions de 3 milliards de paramètres se distingue par une fenêtre de contexte de 131 000 tokens. Il a été affiné à partir de Granite-4.0-H-Micro-Base avec des jeux d’instructions…
Sorti le 20 octobre 2025, granite-4.0-h-micro est un LLM à poids ouverts développé par IBM. Ce modèle d’instructions de 3 milliards de paramètres se distingue par une fenêtre de contexte de 131 000 tokens. Il a été affiné à partir de Granite-4.0-H-Micro-Base avec des jeux d’instructions ouverts et des données synthétiques internes.
Son positionnement est très économique, avec une tarification inférieure de 99% à la moyenne des LLM similaires et environ 323.5 fois moins chère que celle des modèles frontière. Il prend en charge douze langues, l’appel de fonctions, le RAG, le code et les complétions Fill-In-the-Middle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 20 octobre 2025 |
| Multimodal | non |
| Fenêtre de contexte | 131 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 97,8 % | 125ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 91,4 % | 132ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 88,5 % | 153ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 57,5 % | 126ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 46,2 % | 120ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 44,7 % | 130ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 22,7 % | 147ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 0,0 % | 133ᵉ / 140 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : General Knowledge (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Cloudflare | 0,017 $ | 0,112 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 99 % en dessous de la moyenne des LLM similaires, et 323,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 6 min 22 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Les meilleurs résultats Benchable de granite-4.0-h-micro concernent Ethics, General Knowledge et Email Classification, avec des scores bruts élevés. Sa fenêtre de 131 000 tokens répond aux traitements nécessitant un contexte long. Son format de chat structuré couvre le dialogue multilingue, le résumé, la classification, l’extraction et les questions-réponses. Le modèle gère aussi l’appel d’outils et de fonctions, le RAG et plusieurs tâches de code. Son entraînement combine apprentissage supervisé, alignement par renforcement et fusion de modèles. Les poids ouverts et le tarif très bas renforcent son intérêt économique.
Limites et points d'attention. Les classements Benchable placent granite-4.0-h-micro en retrait dans les six évaluations disponibles. Email Classification figure presque en fin de classement malgré son score brut élevé. Ethics et General Knowledge restent également derrière une large majorité des modèles comparés. Les résultats les plus faibles concernent Instruction Following et Reasoning. Hallucinations se situe aussi dans le bas du classement, ce qui appelle une validation des réponses dans les usages sensibles. Le modèle convient surtout aux expérimentations à très faible coût, aux traitements multilingues et aux scénarios à contexte long qui tolèrent des performances modestes en raisonnement et en suivi d’instructions.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).