El último modelo de IA en el dispositivo de Google está hecho a medida para su computadora portátil

TL;DR
  • Google ha lanzado el modelo Gemma 4 12B dirigido a portátiles de consumo con al menos 16 GB de RAM.
  • Gemma 4 12B es el primer modelo de tamaño mediano de la compañía que admite entrada de audio nativa.
  • Utiliza una arquitectura sin codificadores para ofrecer rendimiento multimodal sin la latencia introducida por los codificadores. El nuevo modelo tiene un rendimiento cercano al modelo Gemma 4 26B MoE en los puntos de referencia.

En abril, Google lanzó sus modelos Gemma E2B y E4B aptos para dispositivos móviles, que llevan la IA multimodal integrada a dispositivos Android e iOS. También lanzó los modelos de gama alta 26B Mixture of Experts (MoE) y 31B Dense para dispositivos de gama alta con GPU AI dedicadas. Ahora, la compañía está lanzando otro modelo Gemma que se ubica muy bien entre los cuatro.

Google anunció hoy el modelo Gemma 4 12B destinado a llevar las capacidades de IA del dispositivo a las computadoras portátiles. Ofrece funciones multimodales y es el primer modelo mediano de Google que admite entrada de audio nativa.

La compañía afirma que su modelo de 12B ofrece un rendimiento similar al modelo MoE de 26B en los puntos de referencia, al tiempo que es lo suficientemente pequeño como para funcionar en portátiles de consumo normales con 16 GB de RAM.

Para lograr esto, la empresa ideó soluciones únicas para admitir entradas multimodales sin aumentar la latencia ni el uso de memoria. Gemma 4 12B utiliza una arquitectura sin codificador para evitar los costos de memoria asociados con los codificadores que normalmente se usan en la mayoría de los modelos de IA multimodal.

Para la visión, utiliza un módulo liviano que utiliza “multiplicación de matriz única, incrustación posicional y normalizaciones”, lo que permite pasar datos de imágenes al LLM sin requerir un codificador en el medio.

También elimina por completo la codificación de las entradas de audio. Google pudo proyectar la señal de audio sin procesar directamente en el mismo espacio dimensional que los tokens de texto.

Lo que eso significa es que Gemma 4 12B puede manejar entradas multimodales, al igual que los otros modelos Gemma, pero sin la sobrecarga adicional de codificar dichas entradas. Esto debería dar como resultado un rendimiento mucho mejor en las computadoras portátiles sin la necesidad de hardware de IA dedicado.

Los usuarios interesados ​​pueden probar el nuevo modelo ahora mismo en LM Studio, Ollama, Google AI Edge Gallery y más. Si está interesado en ejecutarlo localmente en su computadora portátil, los pesos están disponibles para descargar desde Hugging Face y Kaggle.

Noticias
IAGoogle
Seguir

Gracias por ser parte de nuestra comunidad. Lea nuestra Política de comentarios antes de publicar.