Inferensi hybrid

Google menyediakan berbagai pilihan model AI dan API terdepan di industri untuk inferensi berbasis cloud dan di perangkat. Inferensi hybrid memungkinkan Anda menyeimbangkan workload AI dengan lancar antara perangkat lokal dan cloud, sehingga mengoptimalkan performa, biaya, dan ketersediaan.

Inferensi hybrid memberikan dua keuntungan utama untuk aplikasi Android Anda:

  • Memaksimalkan jangkauan: Model cloud berfungsi sebagai pengganti penting saat model di perangkat, seperti Gemini Nano, tidak tersedia karena batasan hardware atau OS perangkat. Hal ini membantu memastikan fitur AI Anda tetap berfungsi di berbagai perangkat pengguna seluas mungkin.
  • Biaya dan kemampuan offline: Model di perangkat membantu memastikan fitur AI Anda berfungsi dengan lancar saat pengguna offline. Selain itu, mengalihkan tugas rutin ke perangkat lokal membantu mengurangi biaya inferensi cloud.

Berikut adalah manfaat inferensi di perangkat dan inferensi cloud:

Inferensi pada perangkat Inferensi cloud
Tersedia offline Kompatibel dengan perangkat apa pun
Tidak ada biaya inferensi Kemampuan model lanjutan

Opsi penerapan

Anda dapat menerapkan inferensi hibrida menggunakan pendekatan berikut:

Firebase AI Logic Hybrid API

Firebase AI Logic Hybrid API menyediakan antarmuka tunggal dan terpadu untuk merutekan inferensi antara model di cloud dan di perangkat.

  • Pengalihan otomatis: Anda dapat mengonfigurasi aplikasi untuk menjalankan tugas AI di perangkat jika memungkinkan. Artinya, fitur aplikasi Anda berfungsi offline, memiliki privasi yang ditingkatkan, dan tidak menimbulkan biaya inferensi cloud. Jika model di perangkat tidak tersedia, SDK dapat otomatis merutekan permintaan ke model Gemini yang dihosting di cloud.
  • Perlindungan terhadap penyalahgunaan: Memanggil API cloud secara langsung dari aplikasi seluler dapat berisiko mengekspos kredensial dan menyebabkan tagihan yang tidak diinginkan. Namun, saat menggunakan Firebase AI Logic, Anda juga menerapkan Firebase App Check yang dapat membantu mencegah penyalahgunaan dengan memverifikasi bahwa hanya aplikasi Anda yang asli dan tidak dimodifikasi yang dapat mengakses Gemini API di cloud.
  • Batas pembelanjaan: Saat merutekan permintaan ke model yang dihosting di cloud, Anda dapat mengonfigurasi batas pembelanjaan untuk membantu melindungi anggaran cloud dan menghindari tagihan yang tidak terduga.

Di aplikasi Anda, tentukan parameter onDeviceConfig untuk mengontrol mode inferensi dan mengelola perutean:

  • PREFER_ON_DEVICE: Mencoba menggunakan model di perangkat; otomatis beralih ke model yang dihosting di cloud jika model di perangkat tidak tersedia atau tidak didukung untuk permintaan.

  • PREFER_IN_CLOUD: Berupaya menggunakan model yang dihosting di cloud saat perangkat online dan model tersedia; kembali ke model di perangkat hanya jika perangkat offline.

  • ONLY_ON_DEVICE: Upaya untuk menggunakan model di perangkat; akan memunculkan pengecualian jika model di perangkat tidak tersedia atau tidak didukung untuk permintaan.

  • ONLY_IN_CLOUD: Berupaya menggunakan model yang dihosting di cloud saat perangkat terhubung ke internet dan model tersedia; menampilkan pengecualian dalam semua kasus lainnya.

val model = Firebase.ai(backend = GenerativeBackend.Companion.googleAI())
    .generativeModel(
        modelName = "gemini-3.5-flash",
        onDeviceConfig = OnDeviceConfig(mode = InferenceMode.Companion.PREFER_ON_DEVICE)
    )

val response = model.generateContent("Write a story about a green robot.")
print(response.text)

Untuk mengetahui detail penerapan, tinjau dokumentasi Firebase dan pelajari contoh AI Hybrid di katalog AI.

Mengalihkan beban kerja ke cloud dapat mengekspos endpoint API cloud. Saat menggunakan Firebase AI Logic, Anda dapat mengakses model Gemini berbasis cloud secara aman langsung dari aplikasi sisi klien dengan menerapkan Firebase App Check, yang membantu melindungi inferensi berbasis cloud dari akses yang tidak sah dan penyalahgunaan penagihan. Tindakan ini membantu menjaga ketersediaan dan keamanan mekanisme penggantian hybrid Anda.

Pemilihan rute kustom

Jika aplikasi Anda memiliki persyaratan bisnis atau UX tertentu, Anda juga dapat menerapkan logika perutean kustom. Hal ini memungkinkan Anda menentukan jalur inferensi secara dinamis berdasarkan faktor real-time, seperti:

  • Latensi jaringan
  • Kondisi sistem perangkat (misalnya, level baterai dan beban prosesor)
  • Kompleksitas kueri pengguna

Pendekatan inferensi hibrida kustom ini digunakan oleh aplikasi terkemuka yang menerapkan perutean kustomnya sendiri untuk memberikan pengalaman AI yang andal, termasuk:

  • Gboard: Gboard menggunakan inferensi hibrida kustom untuk mendukung alat penulisan seperti pemeriksaan tata bahasa dan tulis ulang.

  • Kakao Mobility: Kakao Mobility membuat alat Ekstraksi Entitas menggunakan inferensi hibrida kustom untuk layanan pengiriman paket mereka yang secara otomatis mengekstrak nama penerima, alamat, dan nomor telepon dari pesan bahasa alami untuk menyederhanakan formulir pesanan.