DiffusionGemma es la IA más rápida de Google hasta el momento, pero tiene una gran desventaja

TL;DR
  • DiffusionGemma escribe una gran cantidad de texto de una sola vez y luego lo sigue pulindo en lugar de construirlo palabra por palabra.
  • Google dice que puede ser hasta 4 veces más rápido, alcanzando más de 1000 tokens por segundo en NVIDIA H100 y alrededor de 700 en un RTX 5090, gracias al procesamiento paralelo.
  • La calidad de salida sigue siendo inferior a la de Gemma 4, por lo que es más una herramienta experimental que un producto terminado.

Google ha lanzado DiffusionGemma, un modelo experimental de IA que adopta un enfoque muy diferente a cómo la mayoría de los chatbots generan texto en la actualidad. En lugar de escribir una palabra tras otra en una secuencia estricta, genera un bloque completo de texto a la vez y luego lo sigue refinando hasta que sea legible. La idea es impulsar la velocidad y la eficiencia del hardware, incluso si eso significa renunciar a algo de pulido en el resultado final.

Este nuevo modelo de IA es de código abierto bajo la licencia Apache 2.0 y está dirigido a desarrolladores e investigadores en lugar de a usuarios cotidianos. Para comprender por qué esto es importante, es útil observar cómo funcionan la mayoría de los modelos de lenguaje grandes. Sistemas como Gemma 4 de Google generan texto paso a paso, un token a la vez. Cada nueva palabra depende de lo que la precedió, lo que hace que el proceso sea inherentemente secuencial y más difícil de acelerar.

DiffusionGemma, por otro lado, comienza con un lienzo completo de tokens aleatorios, esencialmente texto ruidoso e ilegible, y luego lo limpia repetidamente en múltiples pasadas. Con cada pasada, el resultado se vuelve más estructurado y coherente hasta convertirse en una respuesta final. Una forma sencilla de imaginarlo es que los modelos tradicionales escriben, mientras DiffusionGemma redacta y edita todo a la vez.

Ese cambio tiene un impacto directo en el desempeño. Según afirma Google, DiffusionGemma puede ser hasta cuatro veces más rápido que los modelos autorregresivos estándar en escenarios de baja concurrencia, donde un solo usuario o proceso usa la GPU. En hardware de alta gama, los números son aún más agresivos. La compañía afirma más de 1000 tokens por segundo en una NVIDIA H100 y más de 700 tokens por segundo en una RTX 5090.

Debajo del capó, DiffusionGemma es un modelo de mezcla de expertos de 26 mil millones de parámetros, pero no activa todo eso a la vez. Durante la inferencia solo se utilizan alrededor de 3.800 millones de parámetros, lo que ayuda a mantener manejables los requisitos informáticos. Google dice que esto hace posible ejecutar el modelo en GPU de consumo de alta gama cuando está cuantificado, con una huella de memoria de alrededor de 18 GB de VRAM.

Donde las cosas se ponen más interesantes es cómo el modelo realmente genera texto. Puede producir hasta 256 tokens en paralelo en un solo paso, y cada token puede atender a todos los demás tokens del bloque. Eso le da al modelo una visión global de la salida en lugar de una visión estrictamente lineal.

Esto lo hace más adecuado para tareas estructuradas o basadas en reglas. Por ejemplo, puede ayudar a completar secciones faltantes de código, completar formatos estructurados como JSON, resolver problemas con mucha lógica, como acertijos estilo Sudoku, o manejar patrones matemáticos donde la coherencia en toda la salida importa más que el flujo oración por oración. Debido a que ve el bloque completo a la vez, también puede corregir contradicciones dentro del mismo ciclo de generación, en lugar de esperar a que un token posterior las solucione.

Pero hay un problema y Google es sincero al respecto. DiffusionGemma no iguala la calidad de salida de sus modelos Gemma 4 estándar. La escritura puede ser menos estable, menos refinada y no tan confiable para respuestas complejas o matizadas. Entonces, obtienes velocidad pero pierdes algo de brillo.

Es por eso que Google lo está posicionando como una herramienta experimental: está diseñado para escenarios donde la capacidad de respuesta importa más que la perfección, como herramientas de inteligencia artificial en tiempo real, asistentes de escritura o codificación en línea y flujos de trabajo rápidos e iterativos donde los usuarios se preocupan más por la retroalimentación instantánea que por el texto de calidad final.

Por lo tanto, DiffusionGemma no pretende reemplazar los modelos Gemini o Gemma existentes. Es un experimento que prioriza la velocidad y que cambia la calidad del resultado por eficiencia y capacidad de respuesta. Pero también sugiere una dirección diferente para la generación de texto con IA, donde los modelos no solo predicen la siguiente palabra, sino que generan y refinan bloques enteros de texto simultáneamente.