Así es como Google está reinventando silenciosamente cómo usas tu teléfono Android

Los asistentes de inteligencia artificial como ChatGPT y Gemini están bien equipados para resumir textos extensos y responder nuestras preguntas cotidianas en un lenguaje que podamos entender. Sin embargo, estos asistentes de IA de la nueva era todavía se sienten un poco paralizados cuando les pides que completen tareas dentro de las aplicaciones, especialmente en nuestros teléfonos inteligentes.

En Google I/O, Google mostró cómo quiere que Gemini se convierta en un asistente real y maneje las tareas en su nombre. Si bien parece futurista, casi de ciencia ficción, suceden muchas cosas interesantes debajo del capó. El nuevo marco AppFunctions de Google está sentando las bases para que Android se convierta en un sistema operativo donde la IA (no sólo Gemini) pueda coordinar aplicaciones en su nombre.

¿Cuál es su mayor preocupación sobre las acciones de las aplicaciones que maneja la IA?

¿Qué es exactamente AppFunctions?

El nombre en sí insinúa cómo este marco ayudará a la IA a comunicarse con sus aplicaciones, pero permítame desglosarlo.

Tú y yo navegamos por las aplicaciones usando los botones y menús en la pantalla. Usamos nuestros teléfonos principalmente en función de la retroalimentación visual, pero no es así como la IA realizaría tareas en nuestro nombre. Una aplicación necesitaría exponer sus funciones internas a la IA (de ahí el nombre) para que algo como Gemini o Siri pueda interactuar directamente con sus acciones.

Por ejemplo, Uber podría exponer su flujo de viajes compartidos a la IA para que pueda reservarle un viaje, mientras que Amazon podría permitir que la IA vea los artículos que pide con frecuencia y realice su pedido mensual de comestibles. Ahí es donde entra en juego el nuevo marco AppFunctions de Android, que permite que las aplicaciones y la IA se comuniquen directamente en segundo plano sin que usted tenga que observar cada acción en la pantalla.

Este lenguaje compartido tiene que ver con la eficiencia

Imagine darle a la IA una tarea de varios pasos para que la complete en su nombre. Supongamos que desea buscar una receta de su canal de YouTube favorito, crear una lista de compras en Google Keep y pedir todos los ingredientes en Amazon para una fiesta de fin de semana.

Herramientas como Perplexity Comet ya pueden realizar tareas como estas al controlar una ventana del navegador, abrir pestañas y navegar por sitios web en su nombre. El problema es que este enfoque es bastante ineficiente. La IA no está familiarizada con todos los sitios web y servicios que utiliza. Por lo tanto, tiene que analizar páginas visualmente, identificar botones, navegar por menús y confiar en prueba y error para realizar incluso tareas simples como encontrar el botón del carrito.

Pasa por cada paso uno por uno mientras se enfrenta a muchos aciertos y errores en el camino, lo que hace que todo el proceso sea más lento de lo que debería ser. Más de una vez, me encontré con ganas de señalar la pantalla y decirle dónde estaba el botón de menú. Pero terminé recuperando el control porque la IA dedicaba demasiado tiempo a descubrir algo simple.

Los agentes de IA actuales no son eficientes, ya que tienen que analizar páginas visualmente y confiar en el ensayo y error para realizar incluso tareas simples como encontrar el botón del carrito.

En el lado empresarial, existe algo llamado MCP, o Protocolo de contexto modelo, para ayudar a los sistemas de inteligencia artificial a interactuar con herramientas, conjuntos de datos y servicios sin ocupar una pantalla o pretender ser una persona invisible que usa una computadora. Google está intentando llevar una idea similar a los consumidores a través de AppFunctions.

Entonces, si le pidiera a Gemini que comparara el precio de un auricular en particular en Amazon y Best Buy, no necesitaría navegar visualmente por ambas aplicaciones como lo haría un agente de navegador. En cambio, podría interactuar directamente con esos servicios a través de funciones expuestas para recopilar la información y devolver los resultados.

Este enfoque es bastante útil para flujos de trabajo de múltiples pasos y múltiples aplicaciones. Gemini podría verificar la disponibilidad de su calendario, ver mensajes o correos electrónicos relevantes y luego ayudarlo a reservar un vuelo, reservar un hotel u organizar un viaje en Uber. Todo esto podría suceder en segundo plano mientras continúas usando tu teléfono.

Por qué Android le da a Google una ventaja única

Casi todas las empresas importantes de inteligencia artificial están creando algún tipo de agente. Ya contamos con agentes basados ​​en navegador; piense en la barra lateral Gemini en Chrome, además de productos dedicados como Perplexity Comet. La diferencia es que empresas como OpenAI y Anthropic interactúan en gran medida con las aplicaciones a través de navegadores e integraciones, pero aún carecen de acceso a nivel de sistema operativo. Pero adivina quién no.

A diferencia de la mayoría de sus competidores, Google tiene las capacidades de inteligencia artificial de Gemini y Android. Eso le da la capacidad de incorporar la funcionalidad de IA directamente en el sistema operativo en lugar de superponerla. AppFunctions son un buen ejemplo de ello. En lugar de enseñarle a Gemini cómo «usar» Android, Google está creando la infraestructura que permite que Android funcione de forma nativa con Gemini.

Apple intentó hacer algo similar con Siri hace un par de años, pero Google parece estar tomando medidas más concretas.

Con AppFunctions integradas en el sistema operativo, Gemini podría obtener un acceso mucho más profundo a las aplicaciones y servicios del sistema, al tiempo que estaría mejor equipado para ejecutar flujos de trabajo entre aplicaciones. Dado que los dispositivos Android ya están en manos de miles de millones de usuarios, Google está en la posición perfecta para implementar estas capacidades a una escala que pocas empresas pueden igualar. Este pequeño cambio hace que la IA pase de funcionar sobre Android a convertirse en parte del propio Android.

Apple intentó hacer algo similar con Siri hace un par de años, pero Google parece estar dando un paso más concreto al construir primero el marco subyacente.

Parece de ensueño hasta que consideras los riesgos.

Con toda la IA y la cantidad de información personal involucrada, la privacidad se convierte quizás en la mayor preocupación. Pero lo cierto es que Google ya tiene acceso a gran parte de esta información. Sin embargo, Gemini ahora podrá orquestar esos datos y hacer que funcionen en conjunto de maneras que no habíamos experimentado antes.

Pero un problema más fundamental es la falta de controles manuales en cada paso. ¿Qué sucede si Gemini selecciona el contacto equivocado, crea un recordatorio que nunca pretendiste configurar o realiza una compra incorrecta? Alucinar dentro de un chatbot es una cosa, pero las alucinaciones que resultan en una acción en tu nombre son un problema mucho mayor.

¿Qué sucede si Gemini selecciona el contacto equivocado, crea un recordatorio que nunca pretendiste configurar o realiza una compra incorrecta?

La otra preocupación, menos discutida, es la capacidad de descubrimiento de las aplicaciones. Si las aplicaciones eventualmente se convierten en utilidades en segundo plano que simplemente se conectan a los sistemas de inteligencia artificial, los usuarios pueden dejar de preocuparse por cómo se completa una tarea siempre que el resultado sea satisfactorio. Ya estamos viendo indicios de esto con herramientas como Perplexity Computer, que elige automáticamente el modelo más adecuado de su lista en función de la tarea. Siempre que ofrezca el resultado correcto, no me importa especialmente qué modelo utilice.

La misma lógica podría aplicarse también a las aplicaciones. Si a los usuarios deja de importarles qué servicio completa una tarea, los desarrolladores pueden tener menos incentivos para diferenciarse a través de interfaces y experiencias únicas. Seguramente eso no sucederá pronto, pero tampoco es imposible.

A pesar de las preocupaciones, esto parece un cambio fundamental para Android, quizás el mayor desde el inicio de la plataforma. La existencia misma de AppFunctions debajo de la capa de Android es una prueba de que Google está avanzando hacia un futuro en el que la IA pueda coordinar acciones entre aplicaciones en lugar de simplemente hablar contigo como un chatbot.

La comunicación subyacente entre la IA y sus aplicaciones podría significar que no usaremos las aplicaciones tan directamente o tanto como lo hacemos hoy, con la IA coordinando tareas en nuestro nombre como un asistente humano. AppFunctions no fue lo más destacado de la E/S de este año, pero es precisamente lo que traerá cambios monumentales en la forma en que conocemos y usamos Android hoy.

Características
AndroidGoogle Géminis
Seguir

Gracias por ser parte de nuestra comunidad. Lea nuestra Política de comentarios antes de publicar.