ハイブリッド推論

Google は、クラウドベースとオンデバイスの両方の推論に対応する、業界をリードする AI モデルと API を幅広く提供しています。ハイブリッド推論を使用すると、ローカル デバイスとクラウドの間で AI ワークロードをシームレスにバランスさせ、パフォーマンス、費用、可用性を最適化できます。

ハイブリッド推論には、Android アプリに次の 2 つの主なメリットがあります。

  • リーチを最大化する: Gemini Nano などのオンデバイス モデルがデバイスのハードウェアや OS の制約により利用できない場合、クラウドモデルは重要なフォールバックとして機能します。これにより、AI 機能が可能な限り幅広いユーザーのデバイスで機能し続けることが保証されます。
  • 費用とオフライン機能: オンデバイス モデルは、ユーザーがオフラインのときに AI 機能がシームレスに動作するようにします。また、ルーティン タスクをローカル デバイスにオフロードすることで、クラウド推論の費用を削減できます。

デバイス上の推論とクラウド推論のメリットは次のとおりです。

デバイスでの推論 クラウドでの推論
オフラインで使用可 あらゆるデバイスに対応
推論費用なし 高度なモデル機能

実装オプション

ハイブリッド推論は、次の方法で実装できます。

Firebase AI Logic ハイブリッド API

Firebase AI Logic Hybrid API は、クラウド環境とオンデバイス環境の間で推論を分割するための単一の統合インターフェースを提供します。

これには、推論モードを定義してルーティングを管理するための制御を提供する onDeviceConfig パラメータが含まれています。

  • PREFER_ON_DEVICE: オンデバイス モデルの使用を試み、オンデバイス モデルがリクエストで使用できない場合やサポートされていない場合は、クラウドホスト モデルに自動的にフォールバックします。

  • PREFER_IN_CLOUD: デバイスがオンラインでモデルが利用可能な場合はクラウドホスト型モデルを使用し、デバイスがオフラインの場合のみオンデバイス モデルにフォールバックしようとします。

  • ONLY_ON_DEVICE: オンデバイス モデルの使用を試みますが、リクエストで利用できない場合やサポートされていない場合は例外をスローします。

  • ONLY_IN_CLOUD: デバイスがオンラインでモデルが利用可能な場合は、クラウドホスト型モデルを使用しようとします。それ以外の場合は例外をスローします。

val model = Firebase.ai(backend = GenerativeBackend.Companion.googleAI())
    .generativeModel(
        modelName = "gemini-3.5-flash",
        onDeviceConfig = OnDeviceConfig(mode = InferenceMode.Companion.PREFER_ON_DEVICE)
    )

val response = model.generateContent("Write a story about a green robot.")
print(response.text)

実装の詳細については、Firebase のドキュメントを確認し、AI カタログのハイブリッド AI サンプルをご覧ください。

カスタム ルーティング

アプリに特定のビジネス要件や UX 要件がある場合は、カスタムのルーティング ロジックを実装することもできます。これにより、次のようなリアルタイムの要因に基づいて推論パスを動的に決定できます。

  • ネットワーク レイテンシ
  • デバイスのシステム ヘルス(バッテリー残量やプロセッサ負荷など)
  • ユーザー クエリの複雑さ

このカスタム ハイブリッド推論アプローチは、独自のカスタム ルーティングを実装して信頼性の高い AI エクスペリエンスを提供している主要なアプリで使用されています。たとえば、次のようなアプリがあります。

  • GBoard: Gboard は、カスタム ハイブリッド推論を使用して、校正や書き換えなどの文章作成ツールを強化します。

  • Kakao Mobility: Kakao Mobility は、荷物配送サービス用にカスタム ハイブリッド推論を使用してエンティティ抽出ツールを構築しました。このツールは、自然言語メッセージから受取人の名前、住所、電話番号を自動的に抽出し、注文フォームを効率化します。