Inferencia híbrida

Google ofrece una amplia selección de modelos de IA y APIs líderes en la industria para la inferencia tanto basada en la nube como integrada en el dispositivo. La inferencia híbrida te permite equilibrar sin problemas las cargas de trabajo de IA entre el dispositivo local y la nube, lo que optimiza el rendimiento, el costo y la disponibilidad.

La inferencia híbrida proporciona dos ventajas principales para tu app para Android:

  • Maximizar el alcance: Los modelos basados en la nube son una alternativa fundamental cuando los modelos integrados en el dispositivo, como Gemini Nano, no están disponibles debido a limitaciones de hardware o del SO del dispositivo. Esto ayuda a garantizar que tus funciones de IA sigan funcionando en la mayor cantidad posible de dispositivos de los usuarios.
  • Costo y capacidades sin conexión: Los modelos integrados en el dispositivo ayudan a garantizar que tus funciones basadas en IA funcionen sin problemas cuando el usuario no tiene conexión. Además, descargar tareas rutinarias en el dispositivo local ayuda a reducir los costos de inferencia en la nube.

A continuación, se indican los beneficios de la inferencia integrada en el dispositivo y la inferencia en la nube, respectivamente:

Inferencia integrada en el dispositivo Inferencia en la nube
Disponible sin conexión Compatible con cualquier dispositivo
Sin costo de inferencia Capacidades avanzadas del modelo

Opciones de implementación

Puedes implementar la inferencia híbrida con los siguientes enfoques:

API híbrida de Firebase AI Logic

La API híbrida de Firebase AI Logic proporciona una interfaz única y unificada para enrutar la inferencia entre los modelos en la nube y los modelos integrados en el dispositivo.

  • Cambio automático: Puedes configurar tu app para que ejecute tareas de IA integrado en el dispositivo siempre que sea posible. Esto significa que la función de tu app funciona sin conexión, tiene privacidad mejorada y no genera costos de inferencia en la nube. Si el modelo integrado en el dispositivo no está disponible, el SDK puede enrutar automáticamente la solicitud al modelo de Gemini alojado en la nube.
  • Protección contra abusos: Llamar directamente a las APIs de Cloud desde una app para dispositivos móviles puede exponer las credenciales y generar cargos no deseados. Sin embargo, cuando usas Firebase AI Logic, también aplicas la Verificación de aplicaciones de Firebase, que puede ayudar a prevenir abusos verificando que solo tu app genuina y sin alteraciones pueda acceder a la API de Gemini Cloud.
  • Límites de inversión: Cuando enrutes solicitudes a modelos alojados en la nube, puedes configurar límites de inversión para proteger tu presupuesto de la nube y evitar cargos inesperados.

En tu app, defines el parámetro onDeviceConfig para controlar el modo de inferencia y administrar el enrutamiento:

  • PREFER_ON_DEVICE: Intenta usar el modelo integrado en el dispositivo. Si el modelo integrado en el dispositivo no está disponible o no es compatible con la solicitud, se recurre automáticamente al modelo alojado en la nube.

  • PREFER_IN_CLOUD: Intenta usar el modelo alojado en la nube cuando el dispositivo está en línea y el modelo está disponible. Solo recurre al modelo integrado en el dispositivo si el dispositivo está sin conexión.

  • ONLY_ON_DEVICE: Intenta usar el modelo integrado en el dispositivo y arroja una excepción si el modelo integrado en el dispositivo no está disponible o no es compatible con la solicitud.

  • ONLY_IN_CLOUD: Intenta usar el modelo alojado en la nube cuando el dispositivo está en línea y el modelo está disponible; arroja una excepción en todos los demás casos.

val model = Firebase.ai(backend = GenerativeBackend.Companion.googleAI())
    .generativeModel(
        modelName = "gemini-3.5-flash",
        onDeviceConfig = OnDeviceConfig(mode = InferenceMode.Companion.PREFER_ON_DEVICE)
    )

val response = model.generateContent("Write a story about a green robot.")
print(response.text)

Para obtener detalles de la implementación, consulta la documentación de Firebase y explora la muestra de IA híbrida en el catálogo de IA.

La transición de cargas de trabajo a la nube puede exponer extremos de la API de Cloud. Cuando usas Firebase AI Logic, puedes acceder de forma segura a los modelos de Gemini basados en la nube directamente desde tus apps del cliente aplicando la Verificación de aplicaciones de Firebase, que ayuda a proteger la inferencia basada en la nube del acceso no autorizado y el abuso de facturación. Esto ayuda a mantener tu mecanismo de resguardo híbrido disponible y seguro.

Enrutamiento personalizado

Si tu app tiene requisitos específicos de UX o empresariales, también puedes implementar lógica de enrutamiento personalizada. Esto te permite determinar de forma dinámica la ruta de inferencia según factores en tiempo real, como los siguientes:

  • Latencia de red
  • Estado del sistema del dispositivo (por ejemplo, niveles de batería y carga del procesador)
  • Complejidad de la búsqueda del usuario

Las principales apps que implementaron su propio enrutamiento personalizado utilizan este enfoque de inferencia híbrida personalizada para ofrecer experiencias confiables basadas en IA, como las siguientes:

  • GBoard: Gboard usa la inferencia híbrida personalizada para potenciar las herramientas de escritura, como la revisión y la reescritura.

  • Kakao Mobility: Kakao Mobility creó una herramienta de extracción de entidades con inferencia híbrida personalizada para su servicio de entrega de paquetes que extrae automáticamente los nombres, las direcciones y los números de teléfono de los destinatarios de los mensajes en lenguaje natural para optimizar los formularios de pedidos.