Cosmos3-Super-Text2Image (agentic)
Cosmos3-Super-Text2Image (agentic) est un modèle de génération d’images de NVIDIA, sorti le 31 mai 2026. Il transforme une description textuelle en image cohérente avec celle-ci et s’inscrit dans la plateforme omnimodale Cosmos3, orientée vers la Physical AI.
Cosmos3-Super-Text2Image (agentic) est un modèle de génération d’images de NVIDIA, sorti le 31 mai 2026. Il transforme une description textuelle en image cohérente avec celle-ci et s’inscrit dans la plateforme omnimodale Cosmos3, orientée vers la Physical AI.
Son positionnement dans l’Arena text-to-image varie fortement selon les relevés disponibles : il atteint le top 10 dans l’un d’eux, mais apparaît autour de la 56e place dans deux autres. Il reste derrière les meilleurs résultats de GPT Image 2 et de MAI-Image-2.5.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle de génération d'images |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 31 mai 2026 |
Classements Arena (Elo)
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 13ᵉ | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1250 |
| 14ᵉ | gemini-3-pro-image-2k (nano-banana-pro) | 1245 |
| 15ᵉ | Cosmos3-Super-Text2Image (agentic) | 1245 |
| 16ᵉ | Riverflow 2.0 | 1244 |
| 17ᵉ | gpt-image-1.5-high-fidelity | 1240 |
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 13ᵉ | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1250 |
| 14ᵉ | gemini-3-pro-image-2k (nano-banana-pro) | 1245 |
| 15ᵉ | Cosmos3-Super-Text2Image (agentic) | 1245 |
| 16ᵉ | Riverflow 2.0 | 1244 |
| 17ᵉ | gpt-image-1.5-high-fidelity | 1240 |
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 13ᵉ | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1250 |
| 14ᵉ | gemini-3-pro-image-2k (nano-banana-pro) | 1245 |
| 15ᵉ | Cosmos3-Super-Text2Image (agentic) | 1245 |
| 16ᵉ | Riverflow 2.0 | 1244 |
| 17ᵉ | gpt-image-1.5-high-fidelity | 1240 |
Notre analyse
Forces. La meilleure mesure Arena place Cosmos3-Super-Text2Image (agentic) parmi les dix premiers modèles sur 225, signe d’une préférence humaine élevée dans ce relevé. Ses 64 milliards de paramètres entraînables reposent sur une architecture Mixture-of-Transformers, combinant une tour autorégressive pour les tokens discrets et une tour diffusion transformer pour la génération multimodale continue. Les contenus non textuels sont produits par débruitage itératif. Cette conception l’intègre à un ensemble destiné notamment à la robotique, aux véhicules autonomes et aux environnements intelligents.
Limites et points d'attention. Les trois sources concordent sur l’identité du modèle, mais les relevés Arena décrivent un positionnement irrégulier : deux mesures le situent autour des 56e et 57e places, nettement sous son meilleur classement et derrière GPT Image 2 ainsi que MAI-Image-2.5. Cette dispersion invite à ne pas résumer sa qualité au seul rang le plus favorable. Usages pertinents : génération d’illustrations, conception visuelle, création publicitaire et production d’images pour des scénarios de Physical AI.
Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).