Google menyediakan berbagai pilihan model dan API AI terdepan di industri untuk inferensi berbasis cloud dan di perangkat. Inferensi hybrid memungkinkan Anda menyeimbangkan workload AI dengan lancar antara perangkat lokal dan cloud, sehingga mengoptimalkan performa, biaya, dan ketersediaan.
Inferensi hybrid memberikan dua keuntungan utama untuk aplikasi Android Anda:
- Memaksimalkan jangkauan: Model cloud berfungsi sebagai pengganti penting saat model di perangkat, seperti Gemini Nano, tidak tersedia karena batasan hardware atau OS perangkat. Hal ini membantu memastikan fitur AI Anda tetap berfungsi di berbagai perangkat pengguna seluas mungkin.
- Biaya dan kemampuan offline: Model di perangkat membantu memastikan fitur AI Anda berfungsi dengan lancar saat pengguna offline. Selain itu, mengalihkan tugas rutin ke perangkat lokal membantu mengurangi biaya inferensi cloud.
Berikut adalah manfaat inferensi di perangkat dan inferensi cloud:
| Inferensi pada perangkat | Inferensi cloud |
|---|---|
| Tersedia offline | Kompatibel dengan perangkat apa pun |
| Tidak ada biaya inferensi | Kemampuan model lanjutan |
Opsi penerapan
Anda dapat menerapkan inferensi hibrida menggunakan pendekatan berikut:
Firebase AI Logic Hybrid API
Firebase AI Logic Hybrid API menyediakan antarmuka tunggal dan terpadu untuk membagi inferensi antara lingkungan cloud dan di perangkat.
Hal ini mencakup parameter onDeviceConfig yang menyediakan kontrol untuk menentukan
mode inferensi dan mengelola perutean:
PREFER_ON_DEVICE: mencoba menggunakan model di perangkat, dan otomatis melakukan pengalihan ke model yang dihosting di cloud jika model di perangkat tidak tersedia atau tidak didukung untuk permintaan.PREFER_IN_CLOUD: mencoba menggunakan model yang dihosting di cloud saat perangkat sedang online dan model tersedia, serta kembali ke model di perangkat hanya jika perangkat sedang offline.ONLY_ON_DEVICE: mencoba menggunakan model di perangkat, tetapi akan memunculkan pengecualian jika tidak tersedia atau tidak didukung untuk permintaan.ONLY_IN_CLOUD: mencoba menggunakan model yang dihosting di cloud saat perangkat sedang online dan model tersedia, serta akan memunculkan pengecualian dalam kasus lainnya.
val model = Firebase.ai(backend = GenerativeBackend.Companion.googleAI()) .generativeModel( modelName = "gemini-3.5-flash", onDeviceConfig = OnDeviceConfig(mode = InferenceMode.Companion.PREFER_ON_DEVICE) ) val response = model.generateContent("Write a story about a green robot.") print(response.text)
Untuk mengetahui detail penerapan, tinjau dokumentasi Firebase dan pelajari contoh AI Hybrid di katalog AI.
Pemilihan rute kustom
Jika aplikasi Anda memiliki persyaratan bisnis atau UX tertentu, Anda juga dapat menerapkan logika perutean kustom. Hal ini memungkinkan Anda menentukan jalur inferensi secara dinamis berdasarkan faktor real-time, seperti:
- Latensi jaringan
- Kondisi sistem perangkat (misalnya, level baterai dan beban prosesor)
- Kompleksitas kueri pengguna
Pendekatan inferensi hibrida kustom ini digunakan oleh aplikasi terkemuka yang menerapkan perutean kustomnya sendiri untuk memberikan pengalaman AI yang andal, termasuk:
Gboard: Gboard menggunakan inferensi hibrida kustom untuk mendukung alat penulisan seperti pemeriksaan tata bahasa dan penulisan ulang.
Kakao Mobility: Kakao Mobility membuat alat Ekstraksi Entitas menggunakan inferensi hibrida kustom untuk layanan pengiriman paket mereka yang secara otomatis mengekstrak nama penerima, alamat, dan nomor telepon dari pesan natural language untuk menyederhanakan formulir pesanan.