Curso de Marketing Digital 360°

Curso de Gestión de RRSS

Curso avanzado de Canva

Curso de Social Ads en Meta y TikTok

Novedades de Google en IA visual: Veo 3, Imagen 4 y Flow

Google multiplica los anuncios en torno a la inteligencia artificial generativa, con nuevas herramientas para la creación de imágenes, videos con sonido y videoconferencias en 3D.
flow, veo 3 e imagen 4

La conferencia anual organizada por Google I/O está dirigida a desarrolladores. Este año, el tema principal fue la inteligencia artificial. Google presentó novedades importantes para su IA Gemini, así como para su motor de búsqueda. Pero también puso énfasis en la creación visual: Presentó nuevos modelos para la generación de imágenes y videos, además de una interfaz de creación de video llamada Flow: Veo 3 Imagen 4 Flow IA video.

Veo 3: Videos con pistas sonoras

Google presentó su nuevo modelo de generación de video, Veo 3, que ahora incluye sonido, permitiendo crear bandas sonoras adaptadas a tus videos, además de efectos sonoros e incluso diálogos. Aunque aún queda por demostrar el nivel de precisión de esta funcionalidad, los primeros ejemplos publicados por la empresa son prometedores. Esta novedad podría representar un avance importante en la generación de video, que hasta ahora se limitaba a producciones mudas.

“Veo 3 destaca en todos los ámbitos, ya sea texto o imagen, física real o sincronización labial precisa. Es excelente para la comprensión: puedes contar una breve historia en tu mensaje y el modelo te devuelve un clip que le da vida”, explica Google.

Disponible desde hoy en la aplicación Gemini y en Flow para los suscriptores de Ultra, así como para empresas en Vertex AI, Veo 3 también ofrece una mejor calidad de video que su versión anterior. Pero este último no ha sido abandonado: Veo 2 incorpora funciones inéditas, como mayor control creativo con la colocación o eliminación de objetos, movimientos de cámara precisos y la posibilidad de ampliar automáticamente el encuadre de la escena.

Imagen 4: nuevo modelo de generación de imágenes

La generación de imágenes de Google también se renueva con la llegada del modelo Imagen 4. Entre las mejoras, Google destaca una mayor nitidez, especialmente en los detalles finos como las texturas, la capacidad para producir imágenes en una mayor variedad de estilos y mejores resultados en tipografía y ortografía.

Imagen 4 ya está disponible en la aplicación Gemini, Whisk, Vertex AI y en el ecosistema Workspace. También se prepara una variante “10 veces más rápida” que Imagen 3.

Flow, la plataforma combina los modelos Veo, Imagen y Gemini

Para agrupar las capacidades de sus diferentes modelos, Google ha desarrollado una nueva plataforma llamada Flow, presentada como la evolución de VideoFX. Dedicada a la creación de películas, esta solución está impulsada por Veo 3, Imagen 4 y Gemini. En concreto, Flow permite introducir directrices precisas de cámara (movimientos, ángulos, perspectivas), modificar o ampliar una escena en el plano narrativo y organizar los prompts dentro de su interfaz.

Una sección llamada Flow TV estará dedicada al descubrimiento de contenido creado con Veo por otros usuarios, incluyendo los detalles de los prompts, que podrán servir de inspiración.

Gracias a la combinación de los distintos modelos, Flow permite crear extractos precisos. Por ejemplo, se pueden importar imágenes y escribir un prompt para animarlas (ver imagen de portada).

Sin embargo, Google advierte que su herramienta aún está “en pañales”. Para explotar todo el potencial de Flow, la empresa ha recurrido a videastas especializados en IA. Los cortometrajes presentados ofrecen una muestra del potencial de la plataforma, aunque también muestran muchas distorsiones propias de las producciones con IA.

Flow está disponible para suscriptores de los planes Google AI Pro y Google AI Ultra en Estados Unidos, y pronto se extenderá a otros países.

Google Beam apuesta por la videollamada en 3D

¿Y si las capacidades de video desarrolladas por Google transformarán nuestras interacciones a distancia? Ese es el objetivo de Google Beam, nueva versión del Project Starline, que busca hacer las videollamadas más naturales, como si los interlocutores estuvieran realmente cara a cara.

La tecnología se basa en una pantalla con campo de luz desarrollada con HP, sensores de movimiento y un modelo de inteligencia artificial capaz de crear imágenes tridimensionales a partir de flujos de video convencionales. La ilusión de profundidad permite el contacto visual, la percepción de gestos y expresiones, lo que mejora la calidad de las conversaciones.

En Meet, Beam también incluye una opción de traducción en tiempo real, que hace posibles las conversaciones entre personas de diferentes idiomas sin perder la entonación ni los matices.

Artículos relacionados

seedance 2.0
¿Y si Google decidiera por sí mismo el título de tus artículos
Guia de video con AI
AI google studio
IA y creatividad
project genie google