Thinking Machines: Inkling
Thinking Machines: Inkling est un LLM multimodal à poids ouverts, publié le 17 juillet 2026 par Thinking Machines. Sa fenêtre de contexte atteint 1 048 576 tokens. Son tarif très économique se situe 52% sous la moyenne des LLM similaires.
Thinking Machines: Inkling est un LLM multimodal à poids ouverts, publié le 17 juillet 2026 par Thinking Machines. Sa fenêtre de contexte atteint 1 048 576 tokens. Son tarif très économique se situe 52% sous la moyenne des LLM similaires.
Ce transformeur autorégressif de 66 couches repose sur une architecture sparse Mixture-of-Experts et combine attention locale et globale. Il accepte le texte, les images et l’audio, encode aussi la vidéo dans un espace partagé, puis produit du texte. Il cible notamment les agents avec outils, le code, les chatbots et la génération augmentée par récupération.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Thinking Machines |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 17 juillet 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,audio → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 52ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 97,9 % | 31ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 95,8 % | 77ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,8 % | 18ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 92,2 % | 55ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 75,0 % | 42ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : General Knowledge (Baseline)
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Together | 1 $ | 4,05 $ | 0,17 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,19 $ |
| Latence moyenne par benchmark — Benchable | 18 min 56 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Inkling se classe dans le premier cinquième en Reasoning et dans le premier tiers en Email Classification. Son architecture multimodale réunit texte, image, audio et vidéo dans un même espace caché. La fenêtre d’environ un million de tokens constitue un autre atout pour les traitements nécessitant un contexte étendu. Les poids ouverts et la prise en charge du déploiement local par plusieurs bibliothèques élargissent les possibilités d’intégration. Le coût renforce ce positionnement : l’entrée est facturée 1 $ par million de tokens et la sortie 4,05 $, soit environ 5,5 fois moins que les modèles frontière.
Limites et points d'attention. Le résultat en Hallucinations reste en milieu de tableau. Les scores parfaits en General Knowledge et Ethics sont peu révélateurs : Inkling les partage respectivement avec 41 et 71 autres modèles sur des benchmarks plafonnés. Mathematics offre aussi une lecture limitée, malgré une 18e place partagée, car ce benchmark est également plafonné et non discriminant. La multimodalité sert à analyser plusieurs formats, mais la sortie reste exclusivement textuelle. Inkling convient surtout aux déploiements locaux, aux assistants de codage, aux chatbots, aux systèmes agentiques et aux applications sensibles au coût d’inférence.
Sources des données : OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai) · LLM-Stats (llm-stats.com).