Hace dos años, pedirle a un generador de imágenes que produjera un menú de restaurante daba resultados absurdos. Eran palabras fantasma, inventadas píxel por píxel por un modelo que reconstruía sin comprender. Con ChatGPT Images 2.0, lanzado oficialmente el 21 de abril, ese tiempo parece haber quedado atrás. El mismo menú ahora sale limpio, legible e inmediatamente utilizable.
OpenAI presenta ChatGPT Images 2.0 como un modelo pensado para el trabajo más que para la experimentación visual. Los avances se centran en dos aspectos: una mayor fidelidad a las instrucciones y a los detalles finos, por un lado, y un nuevo modo de razonamiento, por otro.
Un modelo más potente, fiel a las instrucciones y al texto
El modelo mejora justo donde los generadores de imágenes suelen mostrar sus límites: composiciones complejas, textos pequeños, iconos, elementos de interfaz y restricciones estilísticas sutiles. ChatGPT Images 2.0 admite distintos formatos de imagen, desde 3:1 hasta 1:3, para cubrir usos profesionales como banners, anuncios, carteles o visuales para móvil. La resolución máxima alcanza 2K a través de la API.
En cuanto a estilos, OpenAI muestra avances importantes en fotografía, renders cinematográficos, pixel art y manga. La representación de texto también se extiende a lenguas no latinas, como japonés, coreano y chino.
La representación tipográfica fue durante mucho tiempo el talón de Aquiles de los modelos de imagen. Images 2.0 ahora maneja composiciones densas (menús, diagramas científicos, portadas de revistas) con una legibilidad profesional. El soporte multilingüe se extiende al japonés, coreano, chino, hindi y bengalí, con caracteres no latinos renderizados de forma coherente e integrados de manera nativa en la maquetación.
Images 2.0 genera hasta 8 imágenes a partir de un solo prompt, manteniendo la continuidad de personajes y objetos entre los visuales. Esto abre la puerta a mangas, libros ilustrados o familias de assets de marketing coherentes. Produce planos arquitectónicos, rejillas de imágenes, fichas de personajes desde varios ángulos, infografías completas con texto denso y legible, así como interfaces de usuario realistas e incluso capturas de pantalla que imitan sitios existentes.
Un modo Thinking para razonar y generar múltiples imágenes
Images 2.0 introduce una lógica agéntica: antes de generar tu imagen, el modelo es capaz de realizar una búsqueda en la web en tiempo real, analizar un documento subido, planificar la estructura visual y luego generar.
Esta es una de las principales novedades: ChatGPT Images 2.0 es el primer modelo de imágenes de OpenAI con capacidades de razonamiento. Cuando el modo Thinking está activado en ChatGPT, el generador puede consultar la web para obtener información actualizada, estructurar la imagen antes de generarla y verificar sus creaciones.
Cómo acceder a ChatGPT Images 2.0
El despliegue sigue el esquema habitual: la versión estándar del modelo está disponible para todos, mientras que las capacidades de razonamiento están reservadas a suscriptores.
Accesos a ChatGPT Images 2.0:
- Modo Instant: todos los usuarios de ChatGPT y Codex, incluido el plan gratuito
- Modo Thinking: suscriptores ChatGPT Plus, Pro y Business
- API: modelo gpt-image-2, con tarificación por token según calidad y resolución
OpenAI responde a Google en la generación de imágenes
A finales de febrero, Google sorprendió con Nano Banana 2, un modelo capaz de producir resultados muy realistas. ChatGPT Images 2.0 es claramente la respuesta de OpenAI, con ejemplos de alta calidad. El modelo iguala sus puntos fuertes y va más allá con el modo Thinking y la generación simultánea de múltiples imágenes, con mejoras especialmente interesantes para profesionales.

Prompt: a photorealistic, taken by phone photo of a handwritten essay in pencil, bold but elegant handwriting, but messy and somewhat uneven, on an 8.5×11 piece of lined paper, about the history of baseball in toronto. make sure there is variance in the writing in a very human way. give it a slight coffee stain on the top right corner
Show more

Prompt: 1960s French New Wave theatrical poster, bold photomontage composition, torn-paper collage sensibility, pop-art color bursts, high-contrast black-and-white imagery with selective red blue and yellow accents, hand-made offset-print texture, slightly off-register ink, expressive asymmetry, art-house poster cool, graphic spontaneity, street-poster energy, adventurous typography-led design.
Poster text:
– Large title at the bottom: «GPT Image 2.0»
– Smaller headline at the top: «Image generation with a point of view»
– Small footer text: «Coming soon»
Keep all visible text in English. Use a theatrical poster composition.


Prompt: The portraits are taken outdoors, indoors, in specific, intimate, suburban settings. I don’t want to replicate this; I want to maintain the same photographic style and realism, with shots taken using view cameras with colour film and medium-format cameras with colour film, but pushing the strangeness of the subjects and locations further. Not so much in a poor and grubby way, but more in the direction of kitsch and the middle classes, yet with elements that could not exist in reality, either aesthetically or physically.
Show less




