Z-Image Turbo
Publié par Qwen le 2 décembre 2025, Z-Image Turbo est un modèle de génération d’images à 6 milliards de paramètres. Cette variante distillée de la famille Z-Image transforme des descriptions en visuels, avec un positionnement axé sur le photoréalisme, le suivi d’instructions et le rendu…
Publié par Qwen le 2 décembre 2025, Z-Image Turbo est un modèle de génération d’images à 6 milliards de paramètres. Cette variante distillée de la famille Z-Image transforme des descriptions en visuels, avec un positionnement axé sur le photoréalisme, le suivi d’instructions et le rendu de texte en anglais et en chinois.
Dans Arena text-to-image, il se situe en retrait des modèles les mieux classés, malgré des résultats qui le placent dans la première moitié du tableau selon les évaluations disponibles. Son utilisation passe par Diffusers et ZImagePipeline, avec prise en charge de Flash Attention, de la compilation et de l’offloading CPU.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle de génération d'images |
| Éditeur | Qwen |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 2 décembre 2025 |
Classements Arena (Elo)
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 126ᵉ | HiDream-I1-Fast | 1093 |
| 127ᵉ | Reve Image (Halfmoon) | 1092 |
| 128ᵉ | Z-Image Turbo | 1092 |
| 129ᵉ | FLUX.2 [klein] Base 9B | 1088 |
| 130ᵉ | Imagen 4 Fast Preview 0606 | 1087 |
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 126ᵉ | HiDream-I1-Fast | 1093 |
| 127ᵉ | Reve Image (Halfmoon) | 1092 |
| 128ᵉ | Z-Image Turbo | 1092 |
| 129ᵉ | FLUX.2 [klein] Base 9B | 1088 |
| 130ᵉ | Imagen 4 Fast Preview 0606 | 1087 |
Notre analyse
Forces. Z-Image Turbo repose sur une architecture Scalable Single-Stream DiT, qui réunit dans un même flux les tokens textuels, les représentations visuelles sémantiques et les données issues du VAE d’image. Sa distillation permet une génération en 8 NFEs, sans CFG. Son entraînement combine pré-entraînement, SFT et RL. Le modèle cible particulièrement les images photoréalistes, le respect des consignes et l’intégration de texte bilingue anglais-chinois, des caractéristiques utiles pour l’illustration, les maquettes de design et les créations publicitaires comportant des éléments typographiques.
Limites et points d'attention. Son positionnement Arena reste nettement derrière les meilleurs modèles évalués, notamment GPT Image 2 et MAI-Image-2.5. Il convient donc davantage aux projets privilégiant un pipeline Diffusers et des options d’optimisation comme Flash Attention, la compilation ou l’offloading CPU qu’aux productions recherchant la préférence humaine la plus élevée dans Arena. Usages pertinents : prototypage visuel, illustration photoréaliste, design bilingue et création publicitaire, mais pour un résultat plus abouti, on lui préférera OpenAI GPT Image 2 ou Microsoft MAI-Image-2.5.
Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).