Google presentó Nano Banana 2.1, un modelo de imágenes que apuesta por precisión, edición y contexto de hasta 1 millón de tokens
Está basado en Gemini 3.6 Flash. Con capacidad para trabajar con texto e imágenes, y generación de imágenes de hasta 4K, la compañía busca convertir la IA visual en una herramienta de producción más precisa, consistente e iterativa.

La carrera por la generación de imágenes con inteligencia artificial está entrando en una nueva etapa. Ya no alcanza con producir una imagen atractiva a partir de un prompt. El desafío empieza cuando el usuario quiere modificarla, conservar determinados elementos, trabajar con varias referencias o generar una serie completa de piezas visualmente coherentes.
Ese es el terreno en el que Google DeepMind quiere posicionar a Nano Banana 2.1, su nuevo modelo de generación y edición de imágenes, publicado el 6 de octubre.
El sistema forma parte de la familia Gemini 3 y está basado en Gemini 3.6 Flash. Es multimodal, por lo que puede recibir texto e imágenes como entrada y producir imágenes o texto como resultado. Su ventana de contexto llega hasta 1 millón de tokens, mientras que puede generar imágenes de hasta 4K tokens y respuestas de texto de hasta 64K tokens.
Google lo está integrando en Gemini, Google AI Studio, Gemini API, Google Search AI Mode, Google Ads, Google Flow y Google Stitch. No requiere hardware ni software específico para su utilización.
Pero la principal apuesta de Nano Banana 2.1 no está solamente en generar imágenes desde cero. Google pone especial énfasis en la edición y en la capacidad del modelo para mantener la coherencia entre diferentes versiones de una misma creación.
El sistema puede trabajar sobre imágenes existentes, modificar elementos específicos y combinar múltiples referencias. También está diseñado para mantener consistentes personajes, productos y escenarios a través de distintas iteraciones.
Esa capacidad resulta particularmente relevante para usos profesionales. Una empresa que necesita producir una campaña, por ejemplo, no busca solamente una imagen aislada. Necesita que un producto mantenga su apariencia en diferentes escenas, que un personaje conserve sus características y que una identidad visual pueda trasladarse a múltiples piezas.
Nano Banana 2.1 también puede trabajar con texto dentro de las imágenes, incluyendo posters, diagramas e infografías. Google destaca su capacidad para representar texto en distintos idiomas y para utilizar conocimiento del mundo real en la creación de contenidos visuales.
La compañía también incorporó capacidades orientadas a la edición más precisa. El modelo puede trabajar con máscaras o dibujos para indicar qué parte de una imagen debe modificarse, además de permitir ediciones a partir de múltiples imágenes de referencia.
El sistema incluye además un modo "Thinking", diseñado para dedicar más procesamiento al razonamiento antes de generar el resultado. La idea es mejorar la capacidad del modelo para interpretar instrucciones complejas y ejecutar tareas visuales que requieren varios pasos.
La diferencia con los primeros generadores de imágenes de IA está justamente ahí. El usuario ya no tiene que aceptar una imagen como resultado final de una única instrucción. Puede utilizar el modelo como una herramienta de trabajo, avanzar mediante sucesivas modificaciones y mantener elementos específicos a lo largo del proceso.
Google reconoce, sin embargo, que la tecnología todavía tiene límites. Nano Banana 2.1 puede producir alucinaciones, presentar problemas ocasionales de velocidad o tiempos de espera y mostrar dificultades con textos pequeños o párrafos extensos. La compañía también admite que la consistencia de personajes entre imágenes no es perfecta y que pueden aparecer errores al interpretar determinadas relaciones espaciales, como izquierda y derecha.
También persisten limitaciones en tareas que requieren razonamiento tridimensional, conocimiento especializado del mundo real o un elevado nivel de factualidad.
En materia de seguridad, Google señala que Nano Banana 2.1 fue sometido a pruebas de red teaming realizadas por equipos especializados externos al grupo de desarrollo.
La compañía afirma además que el modelo alcanzó los umbrales establecidos para su lanzamiento en materia de seguridad infantil y que su desempeño general de seguridad es similar o superior al de Gemini 3 Flash.
El cambio más importante que plantea Nano Banana 2.1, sin embargo, no es una cifra de rendimiento sino una evolución en la forma de utilizar estos sistemas. Google está intentando que el generador de imágenes deje de ser una máquina de producir resultados aislados y se convierta en una herramienta capaz de participar en un proceso creativo completo.
Generar una imagen espectacular puede ser el comienzo. Mantener un personaje, un producto, una estética y una composición a través de decenas de modificaciones es el problema que aparece cuando la inteligencia artificial entra realmente en un flujo profesional.
Nano Banana 2.1 está diseñado para ese segundo escenario. Y ahí es donde Google quiere que comience la próxima etapa de la IA visual.




Comentarios