Arcee AI: Trinity Large Thinking
Arcee AI: Trinity Large Thinking est un LLM à poids ouverts sorti le 1 avril 2026. Cette variante de Trinity-Large cible le raisonnement, la planification en plusieurs étapes, les workflows agentiques et les trajectoires d’appels d’outils.
Arcee AI: Trinity Large Thinking est un LLM à poids ouverts sorti le 1 avril 2026. Cette variante de Trinity-Large cible le raisonnement, la planification en plusieurs étapes, les workflows agentiques et les trajectoires d’appels d’outils.
Son architecture sparse Mixture-of-Experts compte environ 398 milliards de paramètres au total, dont 13 milliards actifs par token. Le modèle produit des traces explicites dans des blocs <think>, accessibles via reasoning_content avec vLLM. Il fonctionne aussi avec Transformers et via API, notamment OpenRouter.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Arcee AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 1 avril 2026 |
| Multimodal | non |
| Paramètres actifs | 13 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 24.5 | 83ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 97,5 % | 2ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 96,5 % | 106ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 92,9 % | 52ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 92,0 % | 84ᵉ / 146 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 65,7 % | 14ᵉ / 19 | pinchbench | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 0,0 % | 145ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Benchable : Reasoning (Baseline)
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 161ᵉ | Claude 3.7 Sonnet | 1371 |
| 162ᵉ | Qwen3-Next-80B-A3B-Thinking | 1370 |
| 163ᵉ | Arcee AI: Trinity Large Thinking | 1369 |
| 164ᵉ | GLM-4.7-Flash | 1368 |
| 165ᵉ | amazon-nova-experimental-chat-11-10 | 1366 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 85ᵉ | Gemini 3.1 Flash-Lite | 1253 |
| 86ᵉ | Qwen3.5-35B-A3B | 1250 |
| 87ᵉ | Arcee AI: Trinity Large Thinking | 1243 |
| 88ᵉ | GPT-5.1 Codex Mini | 1240 |
| 89ᵉ | Qwen: Qwen3.5-Flash | 1237 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Arcee AI | 0,25 $ | 0,8 $ | 0,06 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 22 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 3,05 $ |
| Durée d'exécution — PinchBench | 3 h 40 min |
| Indice valeur/coût — PinchBench | 55,21 |
| Coût moyen par benchmark — Benchable | 0,12 $ |
| Latence moyenne par benchmark — Benchable | 30 min 59 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Trinity Large Thinking se distingue surtout en Mathematics, où il figure dans le top 10. Sa fenêtre de 262 144 tokens apporte une capacité étendue pour les longs contextes. Ses poids ouverts et sa compatibilité avec vLLM et Transformers facilitent son intégration technique. Son tarif est très économique, 88% sous la moyenne des LLM similaires et environ 22 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Son Intelligence Index se situe en retrait du classement. Les scores maximaux en Reasoning et Ethics sont partagés avec de nombreux modèles sur des benchmarks plafonnés, donc peu discriminants. Dans l’Arena text, il se place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Dans l’Arena code, il reste derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. L’écart avec Kimi K3 est important. Le modèle reste pertinent pour des workflows agentiques à budget contraint et des déploiements fondés sur des poids ouverts. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Kimi K3.
Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).