Cosmos3-Super-Text2Image (agentic)

Cosmos3-Super-Text2Image (agentic) est un modèle de génération d’images de NVIDIA, sorti le 31 mai 2026. Il transforme une description textuelle en image cohérente avec celle-ci et s’inscrit dans la plateforme omnimodale Cosmos3, orientée vers la Physical AI.

Cosmos3-Super-Text2Image (agentic) est un modèle de génération d’images de NVIDIA, sorti le 31 mai 2026. Il transforme une description textuelle en image cohérente avec celle-ci et s’inscrit dans la plateforme omnimodale Cosmos3, orientée vers la Physical AI.

Son positionnement dans l’Arena text-to-image varie fortement selon les relevés disponibles : il atteint le top 10 dans l’un d’eux, mais apparaît autour de la 56e place dans deux autres. Il reste derrière les meilleurs résultats de GPT Image 2 et de MAI-Image-2.5.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération d'images
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Date de sortie31 mai 2026

Classements Arena (Elo)

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
13ᵉgemini-3.1-flash-lite-image (nano-banana-2-lite)1250
14ᵉgemini-3-pro-image-2k (nano-banana-pro)1245
15ᵉCosmos3-Super-Text2Image (agentic)1245
16ᵉRiverflow 2.01244
17ᵉgpt-image-1.5-high-fidelity1240

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
13ᵉgemini-3.1-flash-lite-image (nano-banana-2-lite)1250
14ᵉgemini-3-pro-image-2k (nano-banana-pro)1245
15ᵉCosmos3-Super-Text2Image (agentic)1245
16ᵉRiverflow 2.01244
17ᵉgpt-image-1.5-high-fidelity1240

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
13ᵉgemini-3.1-flash-lite-image (nano-banana-2-lite)1250
14ᵉgemini-3-pro-image-2k (nano-banana-pro)1245
15ᵉCosmos3-Super-Text2Image (agentic)1245
16ᵉRiverflow 2.01244
17ᵉgpt-image-1.5-high-fidelity1240

Notre analyse

Forces. La meilleure mesure Arena place Cosmos3-Super-Text2Image (agentic) parmi les dix premiers modèles sur 225, signe d’une préférence humaine élevée dans ce relevé. Ses 64 milliards de paramètres entraînables reposent sur une architecture Mixture-of-Transformers, combinant une tour autorégressive pour les tokens discrets et une tour diffusion transformer pour la génération multimodale continue. Les contenus non textuels sont produits par débruitage itératif. Cette conception l’intègre à un ensemble destiné notamment à la robotique, aux véhicules autonomes et aux environnements intelligents.

Limites et points d'attention. Les trois sources concordent sur l’identité du modèle, mais les relevés Arena décrivent un positionnement irrégulier : deux mesures le situent autour des 56e et 57e places, nettement sous son meilleur classement et derrière GPT Image 2 ainsi que MAI-Image-2.5. Cette dispersion invite à ne pas résumer sa qualité au seul rang le plus favorable. Usages pertinents : génération d’illustrations, conception visuelle, création publicitaire et production d’images pour des scénarios de Physical AI.


Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).