Hy3

Hy3 est un LLM instruct à poids ouverts lancé par Tencent le 6 juillet 2026. Distribué sous licence Apache 2.0, il autorise l’usage commercial. À sa sortie, ses résultats sur GPQA le plaçaient dans le top 10% des LLM de sa génération.

Hy3 est un LLM instruct à poids ouverts lancé par Tencent le 6 juillet 2026. Distribué sous licence Apache 2.0, il autorise l’usage commercial. À sa sortie, ses résultats sur GPQA le plaçaient dans le top 10% des LLM de sa génération.

Son architecture Mixture-of-Experts compte 295 milliards de paramètres, dont 21 milliards actifs, 192 experts avec sélection top-8 et une couche MTP de 3,8 milliards de paramètres. Sa fenêtre de contexte atteint 256K. Trois modes, « no_think », « low » et « high », règlent l’effort de raisonnement.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurTencent
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie6 juillet 2026
Multimodalnon
Paramètres295 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,7 %26ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)92,9 %54ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)81,2 %68ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)74,0 %46ᵉ / 163benchable✅ Mesuré
Benchable : Ethics (Baseline)45,9 %146ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)36,0 %148ᵉ / 161benchable✅ Mesuré
DeepSearchQA91,0 %4ᵉ / 8llm-statsAuto-déclaré
GPQA90,4 %18ᵉ / 219llm-statsAuto-déclaré
IMO-AnswerBench90,0 %3ᵉ / 19llm-statsAuto-déclaré
BrowseComp84,2 %13ᵉ / 57llm-statsAuto-déclaré
MCP Atlas79,1 %7ᵉ / 30llm-statsAuto-déclaré
SWE-Bench Verified78,0 %19ᵉ / 102llm-statsAuto-déclaré
WideSearch76,4 %3ᵉ / 9llm-statsAuto-déclaré
SWE-bench Multilingual75,8 %9ᵉ / 34llm-statsAuto-déclaré
FrontierScience Olympiad74,8 %3ᵉ / 3llm-statsAuto-déclaré
AA-LCR73,4 %1ᵉ / 15llm-statsAuto-déclaré
USAMO 202672,0 %3ᵉ / 3llm-statsAuto-déclaré
Terminal-Bench 2.171,7 %9ᵉ / 13llm-statsAuto-déclaré
Claw-Eval68,5 %4ᵉ / 13llm-statsAuto-déclaré
SWE-Bench Pro57,9 %17ᵉ / 41llm-statsAuto-déclaré
SkillsBench55,3 %2ᵉ / 6llm-statsAuto-déclaré
SuperChem54,9 %3ᵉ / 3llm-statsAuto-déclaré
WildClawBench53,6 %3ᵉ / 4llm-statsAuto-déclaré
Toolathlon48,5 %16ᵉ / 30llm-statsAuto-déclaré
NL2Repo45,6 %4ᵉ / 12llm-statsAuto-déclaré
MathArena Apex38,7 %4ᵉ / 7llm-statsAuto-déclaré
DeepSWE28,0 %8ᵉ / 9llm-statsAuto-déclaré
APEX-Agents25,6 %7ᵉ / 7llm-statsAuto-déclaré
FrontierScience Research21,3 %4ᵉ / 4llm-statsAuto-déclaré
HorizonMath7,1 %1ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Hy398 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
skyfall-36b-v298 %
▶ Hy398 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable5 h 16 min

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Hy3 se distingue surtout en Mathematics, où il figure dans le haut du classement Benchable. Ses résultats restent solides en Coding et en Instruction Following. Son positionnement dans le top 10% sur GPQA à sa sortie confirme un bon niveau en raisonnement scientifique à l’échelle de sa génération. Le modèle gère aussi les appels d’outils, les échanges multi-tours et les tâches à contexte long. Il peut être servi avec vLLM ou SGLang au moyen d’une API compatible OpenAI. Des pipelines couvrent le fine-tuning et le post-entraînement par renforcement GRPO.

Limites et points d’attention. Hy3 se situe davantage en milieu de tableau sur Reasoning et Coding que parmi les tout premiers modèles. Les résultats de Hallucinations et Email Classification sont peu discriminants : ces benchmarks sont plafonnés, et Hy3 y partage sa place avec respectivement 18 et 42 autres modèles. Le total de 295 milliards de paramètres implique des poids volumineux, même si l’architecture MoE limite l’activation à 21 milliards de paramètres. Hy3 convient surtout aux déploiements contrôlés qui recherchent des poids ouverts, un long contexte, des appels d’outils et plusieurs niveaux d’effort de raisonnement.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).