Cuando pensábamos que el mundo de la inteligencia artificial para generación de imágenes ya no tenía sorpresas, ¡pum! Google aparece con algo que nos deja con la boca abierta. No estamos hablando solo de un nuevo modelo, sino de una herramienta que podría cambiar la forma en la que editamos imágenes. Y lo mejor: ¡es gratis!
Se llama Gemini 2.0 Flash y no es solo otro generador de imágenes como DALL·E 3 o Imagen 3. Su verdadera revolución es que puede entender y modificar imágenes en tiempo real con instrucciones de texto. Sí, como si fuera un Photoshop mágico que responde a lo que le pidas, sin que tengas que hacer ni un solo clic.
¿Y sabes qué es lo mejor? Ya lo puedes probar gratis en Google AI Studio. Sí, GRATIS. Y, por supuesto, nosotros ya lo hemos puesto a prueba.
Una IA multimodal que entiende imágenes como nunca antes
Si hay algo que hace especial a Gemini 2.0 Flash, es su capacidad multimodal. Es decir, puede procesar diferentes tipos de datos (texto, imágenes, audio) en un mismo flujo de trabajo. Algo que OpenAI prometió con GPT-4o, pero que todavía no hemos visto en acción.
Con este nuevo modelo de Google, no solo puedes crear imágenes desde cero, sino que puedes editar fotos reales con una precisión increíble. ¿Cómo funciona? Subes una imagen y simplemente le das instrucciones en lenguaje natural.
Por ejemplo, si subimos la foto de unos croissants y escribimos «añadir chocolate derretido por encima». En segundos, ¡wow! La misma imagen, pero con chocolate agregado de forma hiperrealista.
Poniendo a prueba Gemini 2.0 Flash: ¿de qué es capaz?
Para ver hasta dónde llega esta inteligencia artificial, hicimos varias pruebas locas:
- Eliminar objetos: Quitamos la Torre Eiffel de una foto de París. No dejó ni rastro.
- Modificar el clima: Le pedimos que cambiara un paisaje de verano a uno invernal con nieve. Lo hizo en segundos.
- Alterar la perspectiva: Le pedimos que alejara la cámara para ver más entorno en la imagen. Y lo entendió.
- Transformar fotos urbanas: Sustituyó la Torre Eiffel por la Estatua de la Libertad con un realismo impresionante.
¿Dónde están sus límites?
Como todo modelo de inteligencia artificial en español, Gemini 2.0 Flash tiene sus fallos. Por ejemplo:
- Cuando intentamos fusionar varias imágenes, no siempre entendió qué parte debía modificar.
- Al cambiar elementos en fotos de personas, en algunos casos la integración no fue perfecta.
- La calidad final de las imágenes aún puede mejorarse, pero esto se soluciona con herramientas como Magnific, que permite hacer upscaling sin perder detalles.
Edición de imágenes con IA: ¿estamos viendo el futuro del diseño?
Uno de los usos más interesantes es en prototipado de moda y diseño. Probamos a cambiar los colores de la ropa en una imagen y el modelo lo hizo bastante bien. También lo pusimos a prueba con diseño de interiores, modificando muebles, colores de paredes y distribución de objetos, ¡y los resultados fueron sorprendentes!
¿Google le acaba de ganar la partida a OpenAI?
Esto es lo que nos queda claro después de probar Gemini 2.0 Flash: Google no solo ha lanzado un generador de imágenes, sino que ha creado una herramienta de edición de imágenes con IA que cualquiera puede usar sin conocimientos técnicos.
La pregunta ahora es: ¿qué hará OpenAI para responder a esto? Porque si no aceleran la activación de su modelo multimodal, Google podría tomar la delantera en el mundo de la inteligencia artificial aplicada a la edición de imágenes.
¿Te imaginas un futuro en el que la edición de fotos se haga solo con palabras? Pues ya está pasando. Y Google nos lo está poniendo en bandeja.


