Arcee AI: Trinity Large Thinking

Arcee AI: Trinity Large Thinking est un LLM à poids ouverts sorti le 1 avril 2026. Cette variante de Trinity-Large cible le raisonnement, la planification en plusieurs étapes, les workflows agentiques et les trajectoires d’appels d’outils.

Arcee AI: Trinity Large Thinking est un LLM à poids ouverts sorti le 1 avril 2026. Cette variante de Trinity-Large cible le raisonnement, la planification en plusieurs étapes, les workflows agentiques et les trajectoires d’appels d’outils.

Son architecture sparse Mixture-of-Experts compte environ 398 milliards de paramètres au total, dont 13 milliards actifs par token. Le modèle produit des traces explicites dans des blocs <think>, accessibles via reasoning_content avec vLLM. Il fonctionne aussi avec Transformers et via API, notamment OpenRouter.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurArcee AI
Poids🟢 Poids ouverts
Date de sortie1 avril 2026
Multimodalnon
Paramètres actifs13 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index24.583ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 155benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)97,5 %2ᵉ / 140benchable✅ Mesuré
Benchable : General Knowledge (Baseline)96,5 %106ᵉ / 161benchable✅ Mesuré
Benchable : Coding (Baseline)92,9 %52ᵉ / 162benchable✅ Mesuré
Benchable : Hallucinations (Baseline)92,0 %84ᵉ / 146benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)65,7 %14ᵉ / 19pinchbench✅ Mesuré
Benchable : Instruction Following (Baseline)0,0 %145ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Trinity Large…24.5
Nova 2.0 Pro Preview21.8

Benchable : Reasoning (Baseline)

▶ Trinity Large…100 %

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
161ᵉClaude 3.7 Sonnet1371
162ᵉQwen3-Next-80B-A3B-Thinking1370
163ᵉArcee AI: Trinity Large Thinking1369
164ᵉGLM-4.7-Flash1368
165ᵉamazon-nova-experimental-chat-11-101366

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
85ᵉGemini 3.1 Flash-Lite1253
86ᵉQwen3.5-35B-A3B1250
87ᵉArcee AI: Trinity Large Thinking1243
88ᵉGPT-5.1 Codex Mini1240
89ᵉQwen: Qwen3.5-Flash1237

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Arcee AI0,25 $0,8 $0,06 $

Prix en dollars US par million de tokens.

Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 22 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)3,05 $
Durée d'exécution — PinchBench3 h 40 min
Indice valeur/coût — PinchBench55,21
Coût moyen par benchmark — Benchable0,12 $
Latence moyenne par benchmark — Benchable30 min 59 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Trinity Large Thinking se distingue surtout en Mathematics, où il figure dans le top 10. Sa fenêtre de 262 144 tokens apporte une capacité étendue pour les longs contextes. Ses poids ouverts et sa compatibilité avec vLLM et Transformers facilitent son intégration technique. Son tarif est très économique, 88% sous la moyenne des LLM similaires et environ 22 fois inférieur à celui des modèles frontière.

Limites et points d'attention. Son Intelligence Index se situe en retrait du classement. Les scores maximaux en Reasoning et Ethics sont partagés avec de nombreux modèles sur des benchmarks plafonnés, donc peu discriminants. Dans l’Arena text, il se place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Dans l’Arena code, il reste derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. L’écart avec Kimi K3 est important. Le modèle reste pertinent pour des workflows agentiques à budget contraint et des déploiements fondés sur des poids ouverts. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Kimi K3.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).