HunyuanImage 3.0 Instruct (Fal)
Publié par Tencent le 25 janvier 2026, HunyuanImage 3.0 Instruct (Fal) est un modèle de génération et d’édition d’images. Son architecture autorégressive unifie la modélisation du texte et de l’image, avec génération directe, réécriture des prompts et transformation image-vers-image.
Publié par Tencent le 25 janvier 2026, HunyuanImage 3.0 Instruct (Fal) est un modèle de génération et d’édition d’images. Son architecture autorégressive unifie la modélisation du texte et de l’image, avec génération directe, réécriture des prompts et transformation image-vers-image.
Le modèle se place dans le groupe de tête d’Arena pour l’édition, mais nettement plus bas en text-to-image, loin du leader GPT Image 2. Il peut être installé localement et utilisé avec Transformers, notamment pour l’édition ou la fusion de plusieurs images.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle de génération d'images |
| Éditeur | Tencent |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 25 janvier 2026 |
Classements Arena (Elo)
Arena Image Editing · 70 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1414 |
| 2ᵉ | Riverflow 2.0 | 1395 |
| 3ᵉ | GPT Image 1.5 (high) | 1381 |
| ⋯ | ⋯ | |
| 5ᵉ | Microsoft: MAI-Image-2.5 | 1356 |
| 6ᵉ | Luma UNI 1 Max | 1352 |
| 7ᵉ | HunyuanImage 3.0 Instruct (Fal) | 1350 |
| 8ᵉ | Google: Nano Banana Pro (Gemini 3 Pro Image) | 1349 |
| 9ᵉ | Kling Image 3.0 Omni | 1341 |
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 78ᵉ | Recraft: Recraft V4.1 | 1137 |
| 79ᵉ | FLUX.2 [dev] Turbo | 1135 |
| 80ᵉ | HunyuanImage 3.0 Instruct (Fal) | 1135 |
| 81ᵉ | Google: Nano Banana (Gemini 2.5 Flash Image) | 1135 |
| 82ᵉ | Eigen Image | 1135 |
Notre analyse
Forces. Son principal atout est son positionnement parmi les dix premiers d’Arena image-editing, signe d’une forte préférence humaine pour les résultats d’édition. La prise en charge de plusieurs images étend son intérêt aux compositions, aux variantes et aux fusions de contenus visuels. La réécriture de prompt peut aussi structurer une consigne avant la génération. L’architecture Mixture of Experts compte 64 experts et 80 milliards de paramètres au total, dont 13 milliards activés par token, une empreinte particulièrement importante pour un modèle d’image utilisable localement.
Limites et points d’attention. Son classement Arena text-to-image est sensiblement moins favorable que celui obtenu en édition, avec un écart marqué face à GPT Image 2. Ce contraste oriente davantage le modèle vers la transformation de visuels existants que vers la génération pure lorsqu’une préférence humaine élevée constitue le critère principal. Son importante architecture implique aussi un déploiement local plus exigeant qu’un modèle de taille réduite. Usages pertinents : retouche guidée, fusion de plusieurs images, déclinaisons créatives, illustration, design et création publicitaire.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).