HunyuanImage 3.0 Instruct (Fal)

Publié par Tencent le 25 janvier 2026, HunyuanImage 3.0 Instruct (Fal) est un modèle de génération et d’édition d’images. Son architecture autorégressive unifie la modélisation du texte et de l’image, avec génération directe, réécriture des prompts et transformation image-vers-image.

Publié par Tencent le 25 janvier 2026, HunyuanImage 3.0 Instruct (Fal) est un modèle de génération et d’édition d’images. Son architecture autorégressive unifie la modélisation du texte et de l’image, avec génération directe, réécriture des prompts et transformation image-vers-image.

Le modèle se place dans le groupe de tête d’Arena pour l’édition, mais nettement plus bas en text-to-image, loin du leader GPT Image 2. Il peut être installé localement et utilisé avec Transformers, notamment pour l’édition ou la fusion de plusieurs images.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération d'images
ÉditeurTencent
Poids🟢 Poids ouverts
Date de sortie25 janvier 2026

Classements Arena (Elo)

Arena Image Editing · 70 modèles classés

RangModèleElo
1ᵉGPT Image 21414
2ᵉRiverflow 2.01395
3ᵉGPT Image 1.5 (high)1381
5ᵉMicrosoft: MAI-Image-2.51356
6ᵉLuma UNI 1 Max1352
7ᵉHunyuanImage 3.0 Instruct (Fal)1350
8ᵉGoogle: Nano Banana Pro (Gemini 3 Pro Image)1349
9ᵉKling Image 3.0 Omni1341

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
78ᵉRecraft: Recraft V4.11137
79ᵉFLUX.2 [dev] Turbo1135
80ᵉHunyuanImage 3.0 Instruct (Fal)1135
81ᵉGoogle: Nano Banana (Gemini 2.5 Flash Image)1135
82ᵉEigen Image1135

Notre analyse

Forces. Son principal atout est son positionnement parmi les dix premiers d’Arena image-editing, signe d’une forte préférence humaine pour les résultats d’édition. La prise en charge de plusieurs images étend son intérêt aux compositions, aux variantes et aux fusions de contenus visuels. La réécriture de prompt peut aussi structurer une consigne avant la génération. L’architecture Mixture of Experts compte 64 experts et 80 milliards de paramètres au total, dont 13 milliards activés par token, une empreinte particulièrement importante pour un modèle d’image utilisable localement.

Limites et points d’attention. Son classement Arena text-to-image est sensiblement moins favorable que celui obtenu en édition, avec un écart marqué face à GPT Image 2. Ce contraste oriente davantage le modèle vers la transformation de visuels existants que vers la génération pure lorsqu’une préférence humaine élevée constitue le critère principal. Son importante architecture implique aussi un déploiement local plus exigeant qu’un modèle de taille réduite. Usages pertinents : retouche guidée, fusion de plusieurs images, déclinaisons créatives, illustration, design et création publicitaire.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).