Google DeepMind presentó la ficha técnica oficial de Nano Banana 2.1, una actualización de su sistema de razonamiento multimodal que expande las capacidades visuales y de diseño de la serie Gemini 3. Desarrollado como un modelo ligero y de alta velocidad especializado en la comprensión y generación simultánea de contenidos, este sistema combina el procesamiento de imágenes con la elaboración de respuestas complejas en formato escrito. De acuerdo con el documento de evaluación divulgado por la división de investigación de la compañía en octubre de 2026, el modelo está construido sobre la arquitectura de Gemini 3.6 Flash y ha sido optimizado para la creación de gráficos e infografías, ofreciendo además una ventana de contexto de hasta un millón de tokens para la ingesta de datos.
Entre sus especificaciones operativas, Nano Banana 2.1 admite entradas compuestas por cadenas de texto e imágenes, entregando respuestas con un límite de salida de 64 000 tokens para texto y 4 000 tokens para imágenes. En las pruebas comparativas internas de rendimiento publicadas por el desarrollador, la variante configurada con capacidad de razonamiento activo (thinking) alcanzó una puntuación Elo de preferencia general de 1050 puntos en generación de texto a imagen, superando las versiones previas de la serie como Gemini 3.1 Flash Image, que registró 990 puntos, y Gemini 3 Pro Image, con 935 puntos. En tareas de edición especializada, el modelo obtuvo 1026 puntos en edición general y 1106 puntos en consistencia de múltiples personajes.
La estrategia de distribución informada por la compañía abarca tanto sus canales orientados al consumidor como las herramientas para desarrolladores e infraestructura corporativa. El modelo estará disponible en la aplicación Gemini, Google AI Studio, la API de Gemini, el modo de búsqueda con inteligencia artificial de Google, la plataforma publicitaria Google Ads, así como en los servicios Google Flow y Google Stitch. Para los clientes corporativos y de desarrollo, el acceso se canaliza a través de las condiciones del servicio de Google Cloud y Gemini API, manteniendo un esquema sin requerimientos de hardware especializado en el cliente para su ejecución local.
La actualización se produce en un escenario global donde las grandes empresas tecnológicas intensifican la competencia por modelos de generación y edición de imágenes con alta fidelidad y control preciso de texto. Competidores en el mercado de la inteligencia artificial generativa, como OpenAI con las capacidades visuales integradas en sus modelos GPT y Midjourney en la generación especializada de imágenes, buscan reducir los costos de cómputo y mejorar la renderización de texto tipográfico e infografías complejas. Las soluciones ligeras y de alta velocidad, representadas por las variantes «Flash», representan un esfuerzo de la industria por optimizar la relación entre el costo operativo de servidor y la latencia de respuesta para despliegues masivos.
A pesar de las mejoras registradas en las pruebas, la ficha técnica documenta limitaciones persistentes en el sistema. Google DeepMind detalló que el modelo aún presenta fallas ocasionales en la renderización de textos de tamaño reducido o párrafos extensos, inconsistencias en el mantenimiento de personajes entre imágenes de entrada y salida, confusión en la localización espacial de elementos e interrupciones temporales por latencia. Asimismo, la fecha de corte de conocimiento de la base del modelo se sitúa en marzo de 2026, con ciertos dominios limitados a información de enero de 2025.
En el apartado de seguridad y evaluación de riesgos, la empresa informó que sometió el sistema a pruebas de equipo rojo (red teaming) independiente, verificando el cumplimiento de las políticas de protección infantil y seguridad de contenidos. Según las evaluaciones enmarcadas en el marco de seguridad de frontera de la organización, el modelo no alcanzó los niveles de capacidad crítica que requerirían protocolos de mitigación extraordinarios.
Fuente: DeepMind Google | Editado por CDOL









































