Die richtige KI/ML-Lösung für Ihre App finden

Dieser Leitfaden soll Ihnen helfen, die Lösungen von Google für generative künstliche Intelligenz und maschinelles Lernen (KI/ML) in Ihre Anwendungen zu integrieren. Sie bietet eine Anleitung, mit der Sie sich in den verschiedenen Lösungen für künstliche Intelligenz und maschinelles Lernen zurechtfinden und die Lösung auswählen können, die am besten zu Ihren Anforderungen passt. Ziel dieses Dokuments ist es, Ihnen bei der Entscheidung zu helfen, welches Tool Sie verwenden sollten und warum. Dabei werden Ihre Anforderungen und Anwendungsfälle berücksichtigt.

Dieser Leitfaden soll Ihnen bei der Auswahl der am besten geeigneten KI-/ML-Lösung für Ihre spezifischen Anforderungen helfen. Wenn Sie eine Reihe von Fragen zu den Zielen und Einschränkungen Ihres Projekts beantworten, werden Sie im Leitfaden zu den am besten geeigneten Tools und Technologien weitergeleitet.

Dieser Leitfaden soll Ihnen helfen, die beste KI-Lösung für Ihre App auszuwählen. Berücksichtigen Sie dabei die folgenden Faktoren: den Datentyp (Text, Bilder, Audio, Video), die Komplexität der Aufgabe (einfache Zusammenfassung bis hin zu komplexen Aufgaben, die Fachwissen erfordern) und die Datengröße (kurze Eingaben im Vergleich zu großen Dokumenten). So können Sie entscheiden, ob Sie Gemini Nano auf Ihrem Gerät oder die cloudbasierte KI von Firebase (Gemini Flash oder Gemini Pro) verwenden möchten.

Entscheidungsflussdiagramm für Anwendungsfälle mit generativer KI. Zu den Kriterien gehören die Modalität (Text, Bild im Vergleich zu Audio, Video, Bildgenerierung), die Komplexität (zusammenfassen, umschreiben im Vergleich zu Fachwissen) und das Kontextfenster (kurze Eingabe/Ausgabe im Vergleich zu umfangreichen Dokumenten/Medien), was entweder zu On-Device GenAI (Gemini Nano) oder Firebase AI Logic (Gemini Flash, Pro) führt.
Abbildung 1: Diese Abbildung zeigt einen allgemeinen Lösungsleitfaden, der Ihnen bei der Auswahl der richtigen KI-/ML-Lösung für Ihre Android-App helfen soll. Eine detailliertere Aufschlüsselung der KI- und ML-Optionen finden Sie im Lösungsleitfaden weiter unten in diesem Dokument.

Vorteile der On-Device-Inferenz nutzen

Wenn Sie Ihrer Android-App KI- und ML-Funktionen hinzufügen, können Sie diese auf verschiedene Arten bereitstellen – entweder auf dem Gerät oder über die Cloud.

On‑Device-Lösungen wie Gemini Nano liefern Ergebnisse ohne zusätzliche Kosten, bieten einen besseren Datenschutz für Nutzer und ermöglichen eine zuverlässige Offline-Nutzung, da Eingabedaten lokal verarbeitet werden. Diese Vorteile können für bestimmte Anwendungsfälle wie die Zusammenfassung von Nachrichten entscheidend sein. Daher sollte bei der Auswahl der richtigen Lösungen On-Device-KI priorisiert werden.

Mit Gemini Nano können Sie Inferenz direkt auf einem Android-Gerät ausführen. Wenn Sie mit Text, Bildern oder Audio arbeiten, sollten Sie mit den GenAI-APIs von ML Kit beginnen, um sofort einsatzbereite Lösungen zu erhalten. Die ML Kit GenAI-APIs basieren auf Gemini Nano und nutzen AICore als zugrunde liegenden Systemdienst. Sie sind für bestimmte On-Device-Aufgaben optimiert. Die GenAI-APIs von ML Kit sind aufgrund ihrer Schnittstelle auf höherer Ebene und ihrer Skalierbarkeit ein idealer Weg zur Produktion für Ihre Apps. Mit diesen APIs können Sie Anfragen in natürlicher Sprache mit Text- und Bildeingaben senden. So lassen sich verschiedene Anwendungsfälle wie Bildverständnis, kurze Übersetzungen und geführte Zusammenfassungen realisieren.

Für herkömmliche Aufgaben im Bereich des maschinellen Lernens können Sie Ihre eigenen benutzerdefinierten Modelle implementieren. Wir bieten leistungsstarke Tools wie ML Kit, MediaPipe, LiteRT und Google Play-Bereitstellungsfunktionen, um den Entwicklungsprozess zu optimieren.

Für Anwendungen, die hochspezialisierte Lösungen erfordern, können Sie Ihr eigenes benutzerdefiniertes Modell verwenden, z. B. Gemma oder ein anderes Modell, das auf Ihren spezifischen Anwendungsfall zugeschnitten ist. Führen Sie Ihr Modell mit LiteRT direkt auf dem Gerät des Nutzers aus. LiteRT bietet vordefinierte Modellarchitekturen für eine optimierte Leistung.

Sie können auch eine Hybridlösung mit On-Device- und Cloud-Modellen in Betracht ziehen.

In mobilen Apps werden häufig lokale Modelle für kleine Textdaten wie Chatunterhaltungen oder Blogartikel verwendet. Bei größeren Datenquellen (z. B. PDFs) oder wenn zusätzliches Wissen erforderlich ist, kann jedoch eine cloudbasierte Lösung mit leistungsstärkeren Gemini-Modellen erforderlich sein.

Erweiterte Gemini-Modelle einbinden

Android-Entwickler können die fortschrittlichen generativen KI-Funktionen von Google, einschließlich der leistungsstarken Modelle Gemini Pro und Gemini Flash, mit dem Firebase AI Logic SDK in ihre Anwendungen einbinden. Dieses SDK wurde für größere Datenmengen entwickelt und bietet erweiterte Funktionen und Anpassungsfähigkeit, da es den Zugriff auf diese leistungsstarken, multimodalen KI-Modelle ermöglicht.

Mit dem Firebase AI Logic SDK können Entwickler mit minimalem Aufwand clientseitige Aufrufe an die KI-Modelle von Google senden. Diese Modelle, z. B. Gemini Pro und Gemini Flash, führen Inferenz in der Cloud aus und ermöglichen es Android-Apps, eine Vielzahl von Eingaben zu verarbeiten, darunter Bilder, Audio, Video und Text. Gemini Pro eignet sich hervorragend für das Lösen komplexer Probleme und die Analyse umfangreicher Daten. Die Gemini Flash-Modelle bieten eine höhere Geschwindigkeit und ein Kontextfenster, das für die meisten Aufgaben groß genug ist.

Wann sollte traditionelles maschinelles Lernen verwendet werden?

Generative KI ist zwar nützlich, um Inhalte wie Text, Bilder und Code zu erstellen und zu bearbeiten, viele reale Probleme lassen sich jedoch besser mit herkömmlichen Techniken für maschinelles Lernen (ML) lösen. Diese etablierten Methoden eignen sich hervorragend für Aufgaben wie Vorhersage, Klassifizierung, Erkennung und Analyse von Mustern in vorhandenen Daten. Sie sind oft effizienter, kostengünstiger und einfacher zu implementieren als generative Modelle.

Herkömmliche ML-Frameworks bieten robuste, optimierte und oft praktischere Lösungen für Anwendungen, die sich auf die Analyse von Eingaben, die Identifizierung von Funktionen oder die Erstellung von Vorhersagen auf der Grundlage erlernter Muster konzentrieren, anstatt völlig neue Ausgaben zu generieren. Tools wie ML Kit, LiteRT und MediaPipe von Google bieten leistungsstarke Funktionen, die auf diese nicht generativen Anwendungsfälle zugeschnitten sind, insbesondere in mobilen und Edge-Computing-Umgebungen.

Mit ML Kit die Integration von maschinellem Lernen beschleunigen

ML Kit bietet produktionsreife, für Mobilgeräte optimierte Lösungen für gängige Aufgaben im Bereich des maschinellen Lernens, für die keine ML-Vorkenntnisse erforderlich sind. Mit diesem benutzerfreundlichen mobilen SDK können Sie die ML-Expertise von Google direkt in Ihre Android- und iOS-Apps einbinden. So können Sie sich auf die Entwicklung von Funktionen konzentrieren, anstatt auf das Trainieren und Optimieren von Modellen. ML Kit bietet vorgefertigte APIs und einsatzbereite Modelle für Funktionen wie Barcode-Scanning, Texterkennung (OCR), Gesichtserkennung, Bildbeschriftung, Objekterkennung und ‑tracking, Spracherkennung und intelligente Antworten.

Diese Modelle sind in der Regel für die Ausführung auf dem Gerät optimiert und sorgen für geringe Latenz, Offline-Funktionen und einen besseren Datenschutz, da die Daten oft auf dem Gerät verbleiben. Mit ML Kit können Sie Ihrer mobilen App schnell etablierte ML-Funktionen hinzufügen, ohne Modelle trainieren oder generative Ausgaben benötigen zu müssen. Sie eignet sich ideal, um Apps mit „intelligenten“ Funktionen zu erweitern, indem Sie die optimierten Modelle von Google verwenden oder benutzerdefinierte TensorFlow Lite-Modelle bereitstellen.

Auf der ML Kit-Entwicklerwebsite finden Sie umfassende Anleitungen und Dokumentationen.

Benutzerdefiniertes ML-Deployment mit LiteRT

Wenn Sie mehr Kontrolle benötigen oder Ihre eigenen ML-Modelle bereitstellen möchten, verwenden Sie einen benutzerdefinierten ML-Stack, der auf LiteRT und Google Play-Diensten basiert. Dieser Stack bietet die Grundlagen für die Bereitstellung leistungsstarker ML-Funktionen. LiteRT ist ein Toolkit, das für die effiziente Ausführung von TensorFlow-Modellen auf ressourcenbeschränkten mobilen Geräten, eingebetteten Geräten und Edge-Geräten optimiert ist. Damit können Sie deutlich kleinere und schnellere Modelle ausführen, die weniger Arbeitsspeicher, Strom und Speicherplatz benötigen. Die LiteRT-Laufzeit ist für verschiedene Hardwarebeschleuniger (GPUs, DSPs, NPUs) auf Edge-Geräten optimiert und ermöglicht Inferenz mit niedriger Latenz.

Wählen Sie LiteRT aus, wenn Sie trainierte ML-Modelle (in der Regel für Klassifizierung, Regression oder Erkennung) effizient auf Geräten mit begrenzter Rechenleistung oder Akkulaufzeit bereitstellen müssen, z. B. auf Smartphones, IoT-Geräten oder Mikrocontrollern. Sie ist die bevorzugte Lösung für die Bereitstellung benutzerdefinierter oder standardmäßiger Vorhersagemodelle am Edge, wo Geschwindigkeit und Ressourcenschonung von größter Bedeutung sind.

Weitere Informationen zur ML-Bereitstellung mit LiteRT

Echtzeit-Wahrnehmung in Ihre Apps einbauen mit MediaPipe

MediaPipe bietet Open-Source-, plattformübergreifende und anpassbare Lösungen für maschinelles Lernen, die für Live- und Streamingmedien entwickelt wurden. Sie profitieren von optimierten, vorgefertigten Tools für komplexe Aufgaben wie Hand-Tracking, Schätzung von Körperhaltungen, Gesichtserkennung und Objekterkennung. So ist eine leistungsstarke Echtzeitinteraktion auch auf Mobilgeräten möglich.

Die auf Graphen basierenden Pipelines von MediaPipe sind hochgradig anpassbar. So können Sie Lösungen für Android-, iOS-, Web-, Desktop- und Backend-Anwendungen entwickeln. Wählen Sie MediaPipe aus, wenn Ihre Anwendung sofort auf Live-Sensordaten, insbesondere Videostreams, reagieren muss, z. B. für Anwendungsfälle wie Gestenerkennung, AR-Effekte, Fitness-Tracking oder Avatar-Steuerung. Dabei geht es vor allem um die Analyse und Interpretation von Eingaben.

Sehen Sie sich die Lösungen an und beginnen Sie mit der Entwicklung mit MediaPipe.

App in den Geräteassistenten einbinden

Bei der herkömmlichen KI-Integration geht es darum, „KI in Ihre App zu integrieren“. Sie können aber auch „Ihre App in KI integrieren“. Wenn Sie die Funktionen Ihrer App für KI-Systemfunktionen zur Verfügung stellen, können Assistenten auf Systemebene (z. B. Gemini) die Funktionen Ihrer App selbstständig erkennen und aufrufen. AppFunctions ist die primäre Methode, um diese Integration zu erreichen. So kann Ihre App Teil des breiteren Android-KI-Ökosystems werden. Wenn Ihre App hingegen In-App-Agents hostet, die interaktive Benutzeroberflächen für Nutzer zurückgeben müssen, verwenden Sie den Jetpack Compose A2UI Renderer, um von Agents gesteuerte Benutzeroberflächen nativ darzustellen.

Ansatz auswählen

Wenn Sie KI zur Verbesserung Ihrer Android-App einsetzen möchten, sollten Sie drei primäre Ansätze in Betracht ziehen: die Verarbeitung auf dem Gerät, die Nutzung cloudbasierter Modelle oder das Hinzufügen der Funktionen Ihrer App zur KI auf Systemebene. Tools wie ML Kit, Gemini Nano und LiteRT ermöglichen Funktionen auf dem Gerät, während die Gemini Cloud APIs mit Firebase AI Logic eine leistungsstarke cloudbasierte Verarbeitung bieten. „AppFunctions“ ist ein dritter Weg, um Ihre App in KI zu integrieren. Dazu machen Sie die Funktionen der App für das System als Agenten verfügbar.

Berücksichtigen Sie bei der Auswahl Ihres Ansatzes die folgenden Faktoren:

Faktor Lösungen auf dem Gerät Cloud-Lösungen
Konnektivität und Offlinefunktionen Ideal für die Offline-Nutzung; funktioniert ohne Netzwerkverbindung. Für die Kommunikation mit Remote-Servern ist eine Netzwerkverbindung erforderlich.
Datenschutz Sensible Daten werden lokal auf dem Gerät verarbeitet und gespeichert. Daten werden in die Cloud übertragen, was Vertrauen in die Sicherheit des Anbieters erfordert.
Auffindbarkeit und Reichweite Durch die direkte Betriebssystemintegration (AppFunctions) können Assistenten Funktionen erkennen. Die Auffindbarkeit ist in der Regel auf die interne Benutzeroberfläche der App oder bestimmte API-Integrationen beschränkt.
Modellfähigkeiten Optimiert für niedrige Latenz und spezifische, weniger intensive Aufgaben. Leistungsstarke Modelle, die in der Lage sind, hohe Komplexität und große Eingaben zu verarbeiten.
Kostengesichtspunkte Keine direkten Gebühren pro Nutzung; Nutzung vorhandener Gerätehardware. In der Regel fallen nutzungsabhängige Preise oder laufende Abokosten an.
Geräteressourcen Verwendet lokalen Speicher, RAM und Akku. Minimale lokale Auswirkungen; rechenintensive Aufgaben werden auf den Server ausgelagert.
Abstimmung Eingeschränkte Flexibilität; durch lokale Hardwarefunktionen begrenzt. Mehr Flexibilität für umfangreiche Anpassungen und die Abstimmung in großem Maßstab.
Plattformübergreifende Konsistenz Die Verfügbarkeit kann je nach Betriebssystem und Hardwareunterstützung variieren. Einheitliche Nutzung auf allen Plattformen mit Internetzugang.

Wenn Sie die Anforderungen Ihres Anwendungsfalls und die verfügbaren Optionen sorgfältig prüfen, können Sie die perfekte KI‑/ML-Lösung finden, um Ihre Android-App zu optimieren und Ihren Nutzern intelligente und personalisierte Funktionen zu bieten.


Leitfaden zu KI-/ML-Lösungen

Dieser Lösungsleitfaden kann Ihnen helfen, die geeigneten Entwicklertools für die Integration von KI-/ML-Technologien in Ihre Android-Projekte zu finden.

Was ist das Hauptziel der KI-Funktion?


Herkömmliches maschinelles Lernen und Wahrnehmung

Sie müssen Eingaben analysieren, Funktionen identifizieren oder Vorhersagen auf Grundlage erlernter Muster treffen, anstatt völlig neue Ausgaben zu generieren.

Welche konkrete Aufgabe führen Sie aus?

  • A) Sie benötigen eine schnelle Integration von vorgefertigten, gängigen Mobile ML-Funktionen? z.B. Barcode-Scanning, Texterkennung (OCR), Gesichtserkennung, Bildkennzeichnung, Objekterkennung und ‑tracking, Spracherkennung, einfache intelligente Antwort)
    • → Verwendung: ML Kit (herkömmliche APIs)
    • Grund: Einfachste Integration für etablierte mobile ML-Aufgaben, oft für die Verwendung auf dem Gerät optimiert (geringe Latenz, Offline, Datenschutz).
  • B) Müssen Sie Streamingdaten in Echtzeit (z. B. Video oder Audio) für Wahrnehmungsaufgaben verarbeiten? (z.B. Hand-Tracking, Haltungsschätzung, Gesichts-Mesh, Echtzeit-Objekterkennung und ‑Segmentierung in Videos)
    • → Verwenden: MediaPipe
    • Grund: Framework, das auf leistungsstarke Echtzeit-Wahrnehmungspipelines auf verschiedenen Plattformen spezialisiert ist.
  • C) Sie müssen Ihr eigenes benutzerdefiniert trainiertes ML-Modell (z. B. für Klassifizierung, Regression, Erkennung) effizient auf dem Gerät ausführen und dabei Leistung und geringen Ressourcenverbrauch priorisieren.
    • → Verwenden Sie: LiteRT (TensorFlow Lite Runtime)
    • Grund: Optimierte Laufzeit für die effiziente Bereitstellung benutzerdefinierter Modelle auf Mobilgeräten und Edge-Geräten (kleine Größe, schnelle Inferenz, Hardwarebeschleunigung).
  • D) Sie müssen ein eigenes benutzerdefiniertes ML-Modell für eine bestimmte Aufgabe trainieren?
    • → Verwenden: LiteRT (TensorFlow Lite Runtime) + benutzerdefiniertes Modelltraining
    • Grund: Bietet die Tools zum Trainieren und Bereitstellen benutzerdefinierter Modelle, die für Mobilgeräte und Edge-Geräte optimiert sind.
  • E) Benötigen Sie eine erweiterte Contentklassifizierung, Sentimentanalyse oder Übersetzung von vielen Sprachen mit hoher Nuance?
    • Überlegen Sie, ob herkömmliche ML-Modelle (die möglicherweise mit LiteRT oder in der Cloud bereitgestellt werden) geeignet sind oder ob für erweitertes NLU generative Modelle erforderlich sind (gehen Sie zurück zum Start und wählen Sie A aus). Für cloudbasierte Klassifizierung, Sentimentanalyse oder Übersetzung:
    • → Verwenden Sie cloudbasierte Lösungen (z.B. Google Cloud Natural Language API, Google Cloud Translation API, möglicherweise über ein benutzerdefiniertes Backend oder die Gemini Enterprise Agent Platform aufgerufen). (Geringere Priorität als Optionen auf dem Gerät, wenn das Gerät offline ist oder Datenschutz wichtig ist).
    • Grund: Cloud-Lösungen bieten leistungsstarke Modelle und umfangreiche Sprachunterstützung, erfordern jedoch eine Verbindung und können Kosten verursachen.

Generative KI

Sie müssen neue Inhalte erstellen, zusammenfassen, umschreiben oder komplexe Aufgaben zum Verstehen oder zur Interaktion ausführen.

Soll die KI offline funktionieren, benötigen Sie maximalen Datenschutz (Nutzerdaten werden auf dem Gerät gespeichert) oder möchten Sie Kosten für die Cloud-Inferenz vermeiden?

  • A) Ja, Offline-Funktionen, maximaler Datenschutz oder keine Cloud-Kosten sind wichtig.
  • B) Nein: Die Konnektivität ist verfügbar und akzeptabel, Cloud-Funktionen und Skalierbarkeit sind wichtiger oder für bestimmte Funktionen ist die Cloud erforderlich.

Generative KI auf dem Gerät (mit Gemini Nano)

Einschränkungen: Kompatible Android-Geräte erforderlich, eingeschränkte iOS-Unterstützung, Modelle sind weniger leistungsstark als Cloud-Pendants.

Mit der Prompt API von ML Kit können Sie Anfragen in natürlicher Sprache mit reinen Texteingaben oder Text- und Bildeingaben für eine Vielzahl von Anwendungsfällen senden, z. B. für die Bildanalyse, kurze Übersetzungen und geführte Zusammenfassungen. Wenn Ihre Anwendungsfälle mit diesen Tokenlimits abgedeckt werden können, sind die GenAI-APIs von ML Kit die beste Option für generative KI auf dem Gerät. ML Kit bietet außerdem optimierte APIs für gängige Aufgaben wie Zusammenfassung und intelligente Antwort.

  • → Verwendung: ML Kit GenAI-APIs (basierend auf Gemini Nano)
  • Warum: Die einfachste Möglichkeit, generative KI-Aufgaben auf dem Gerät mithilfe von Prompts in natürlicher Sprache zu integrieren. Die On-Device-Lösung hat höchste Priorität.

Generative KI in der Cloud

Es werden leistungsstärkere Modelle verwendet, eine Verbindung ist erforderlich, es fallen in der Regel Inferenzkosten an, die Geräteabdeckung ist größer und die plattformübergreifende (Android und iOS) Konsistenz ist einfacher.

Was ist Ihnen wichtiger: eine einfache Integration in Firebase ODER maximale Flexibilität/Kontrolle?

  • A) Sie bevorzugen eine einfache Integration und eine verwaltete API und verwenden wahrscheinlich bereits Firebase?
  • B) Sie benötigen maximale Flexibilität, Zugriff auf die größte Auswahl an Modellen (einschließlich Drittanbieter-/benutzerdefinierter Modelle) und erweitertes Fine-Tuning und sind bereit, Ihre eigene Backend-Integration zu verwalten (komplexer)?
    • → Verwenden: Gemini API mit einem benutzerdefinierten Cloud-Backend (mit Google Cloud Platform)
    • Vorteile: Bietet die größte Kontrolle, den breitesten Modellzugriff und benutzerdefinierte Trainingsoptionen, erfordert jedoch einen erheblichen Aufwand für die Backend-Entwicklung. Geeignet für komplexe, groß angelegte oder stark angepasste Anforderungen.

(Sie haben das Firebase AI Logic SDK ausgewählt.) Welche Art von generativer Aufgabe und welches Leistungsprofil benötigen Sie?

  • A) Sie benötigen ein ausgewogenes Verhältnis zwischen Leistung und Kosten, das für die allgemeine Texterstellung, Zusammenfassung oder Chatanwendungen geeignet ist, bei denen Geschwindigkeit wichtig ist?
  • B) Benötigen Sie eine höhere Qualität und Leistungsfähigkeit für die komplexe Textgenerierung, das Treffen von Schlussfolgerungen, die erweiterte Verarbeitung natürlicher Sprache oder das Befolgen von Anweisungen?

AppFunctions

Sie müssen die Funktionen Ihrer App erweitern, um sie in KI-Systemfunktionen zu integrieren (Ihre App in KI einbinden).

  • → Verwendung: AppFunctions
  • Grund: Ermöglicht es KI-Systemfunktionen wie Assistant, die Funktionen Ihrer App zu erkennen und aufzurufen.

Mit Agenten eine Benutzeroberfläche generieren, die Jetpack Compose und Material 3 verwendet

Sie müssen interaktive Benutzeroberflächen rendern, die von KI-Agents generiert oder angefordert werden.

  • → Verwenden: Jetpack Compose A2UI-Renderer
  • Grund: Ermöglicht es Agenten, mit dem Agent-to-UI-Protokoll (A2UI) „UI zu sprechen“ und dynamische Agent-Antworten als native Jetpack Compose- und Material 3-Komponenten mit vollständiger Status- und Ereignisbearbeitung zu rendern.