GLM-Image
GLM-Image est un modèle de génération d’images publié par Zhipu AI le 13 janvier 2026. Il transforme une description en image et accepte aussi une image existante pour l’édition, le transfert de style, la préservation d’identité et la composition cohérente de plusieurs sujets.
GLM-Image est un modèle de génération d’images publié par Zhipu AI le 13 janvier 2026. Il transforme une description en image et accepte aussi une image existante pour l’édition, le transfert de style, la préservation d’identité et la composition cohérente de plusieurs sujets.
Son architecture hybride associe un générateur autorégressif initialisé depuis GLM-4-9B-0414 à un décodeur de diffusion DiT en espace latent. Dans Arena, ses résultats le placent en retrait, aussi bien en text-to-image qu’en image-editing.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle de génération d'images |
| Éditeur | Zhipu AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 13 janvier 2026 |
Classements Arena (Elo)
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 132ᵉ | HiDream-O1-Image-Dev | 1086 |
| 133ᵉ | Phoenix 1.0 Ultra | 1085 |
| 134ᵉ | GLM-Image | 1083 |
| 135ᵉ | HiDream-I1-Dev | 1082 |
| 136ᵉ | seedream-3 | 1082 |
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 132ᵉ | HiDream-O1-Image-Dev | 1086 |
| 133ᵉ | Phoenix 1.0 Ultra | 1085 |
| 134ᵉ | GLM-Image | 1083 |
| 135ᵉ | HiDream-I1-Dev | 1082 |
| 136ᵉ | seedream-3 | 1082 |
Arena Image Editing · 70 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1414 |
| 2ᵉ | Riverflow 2.0 | 1395 |
| 3ᵉ | GPT Image 1.5 (high) | 1381 |
| ⋯ | ⋯ | |
| 64ᵉ | HiDream-E1.1 | 1047 |
| 65ᵉ | Gemini 2.0 Flash Preview | 1000 |
| 66ᵉ | GLM-Image | 999 |
| 67ᵉ | OmniGen V2 | 972 |
| 68ᵉ | Bagel | 950 |
Notre analyse
Forces. GLM-Image réunit génération et édition dans un même modèle, avec des fonctions adaptées à l’illustration, au design et à la création publicitaire. Son module Glyph Encoder vise le rendu de texte intégré aux images. L’architecture combine des tokens visuels traités par le générateur autorégressif et un décodeur de diffusion chargé de produire l’image. Le post-entraînement emploie un apprentissage par renforcement découplé avec GRPO, avec des signaux de retour distincts pour les deux modules.
Limites et points d’attention. Les deux relevés text-to-image disponibles situent GLM-Image dans la seconde moitié d’Arena, loin des modèles de tête. Son positionnement est encore plus faible en image-editing, où il figure près du bas du classement. Ces résultats limitent son intérêt lorsque la préférence humaine mesurée par Arena constitue le principal indicateur de qualité. Usages pertinents : prototypage d’illustrations, essais de styles, compositions multi-sujets et retouches avec préservation d’identité ; pour un résultat plus abouti, on lui préférera GPT Image 2, MAI-Image-2.5 ou Riverflow 2.0.
Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).