Как повысить вовлеченность пользователей с помощью генерации изображений на основе ИИ
Время на чтение: 5 минут
Добавление в приложение собственных изображений может значительно повысить удобство использования и вовлеченность пользователей. В этой статье рассказывается о двух новых возможностях для создания изображений с помощью Firebase AI Logic: специализированных функциях редактирования Imagen, которые сейчас доступны в предварительной версии, и общей доступности модели Gemini 2.5 Flash Image (также известной как Nano Banana), предназначенной для создания изображений на основе контекста или диалога.
Повышайте вовлеченность пользователей с помощью изображений, созданных с помощью Firebase AI Logic
Модели генерации изображений можно использовать для создания персонализированных аватаров профилей пользователей или для интеграции персонализированных визуальных объектов непосредственно в ключевые экраны.
Например, Imagen предлагает новые функции редактирования (в предварительной версии для разработчиков). Теперь вы можете нарисовать маску и использовать функцию восстановления, чтобы сгенерировать пиксели в замаскированной области. Кроме того, можно использовать функцию "Расширение", чтобы сгенерировать пиксели за пределами маски.
Imagen поддерживает восстановление фрагментов изображения, позволяя генерировать только его часть.
Модель Gemini 2.5 Flash Image (также известная как Nano Banana) может использовать расширенные знания о мире и возможности рассуждения моделей Gemini для создания контекстно релевантных изображений, что идеально подходит для создания динамических иллюстраций, соответствующих текущему опыту пользователя в приложении.
Используйте Gemini 2.5 Flash Image, чтобы создавать динамические иллюстрации, подходящие для вашего приложения.
Наконец, возможность редактировать изображения с помощью естественного языка позволяет пользователям вносить изменения в фотографии, используя разговорный стиль.
Используйте Gemini 2.5 Flash Image, чтобы редактировать изображения с помощью естественного языка.
При интеграции ИИ в приложение важно изучить принципы безопасного использования ИИ. Особенно важно оценить риски безопасности приложения, рассмотреть возможность внесения изменений для их снижения, провести тестирование безопасности, соответствующее вашему варианту использования, а также запросить отзывы пользователей и отслеживать контент.
Imagen или Gemini: выбирайте сами
Gemini 2.5 Flash Image (Nano Banana) и Imagen отличаются в первую очередь основными функциями и расширенными возможностями. Gemini 2.5 Flash Image – это модель для работы с изображениями, входящая в семейство Gemini. Она отлично подходит для редактирования изображений в чате, сохраняет контекст и единообразие объектов при нескольких итерациях, а также использует "знания о мире и рассуждения", чтобы создавать контекстуально релевантные изображения или вставлять точные изображения в длинные текстовые последовательности.
Imagen – это специализированная модель Google для генерации изображений, которая позволяет лучше контролировать творческий процесс и создавать фотореалистичные изображения с высокой детализацией, а также изображения в определенных стилях. Кроме того, она позволяет задавать соотношение сторон или формат сгенерированного изображения.
| Gemini 2.5 Flash Images (Nano Banana 🍌) | Imagen |
🌎 знания о мире и рассуждения для более контекстно релевантных изображений 💬 редактировать изображения с помощью описательного редактирования, сохраняя контекст; 📖 вставлять точные изображения в длинные фрагменты текста; | 📐 указывать соотношение сторон или формат сгенерированных изображений;
🖌️Поддержка редактирования на основе масок для дорисовывания и удаления объектов.
🎚️ более точный контроль над деталями сгенерированного изображения (качество, художественные детали и определенные стили); |
Давайте посмотрим, как их использовать в приложении.
Восстановление изображений с помощью Imagen
Несколько месяцев назад мы добавили в Imagen новые функции редактирования. Хотя Imagen уже можно использовать для создания изображений, функции редактирования пока доступны в виде предварительной версии для разработчиков.
Функции редактирования Imagen включают восстановление и расширение изображения, а также другие функции редактирования на основе масок. Теперь пользователи могут изменять отдельные области изображения, не пересоздавая его целиком. Это значит, что вы можете сохранить лучшие части изображения и изменить только то, что хотите.
Используйте функции редактирования Imagen, чтобы вносить точные изменения в отдельные части изображения, не затрагивая остальные.
При этом сохраняются основные элементы и целостность исходного изображения, а изменяется только область в маске.
Чтобы использовать Imagen для закрашивания, сначала инициализируйте imagen-3.0-capability-001 определенную модель Imagen, поддерживающую функции редактирования:
// Copyright 2025 Google LLC.
// SPDX-License-Identifier: Apache-2.0
val editingModel =
Firebase.ai(backend = GenerativeBackend.vertexAI()).imagenModel(
"imagen-3.0-capability-001",
generationConfig = ImagenGenerationConfig(
numberOfImages = 1,
aspectRatio = ImagenAspectRatio.SQUARE_1x1,
imageFormat = ImagenImageFormat.jpeg(compressionQuality = 75),
),
)Затем определите функцию дорисовки:
// Copyright 2025 Google LLC.
// SPDX-License-Identifier: Apache-2.0
val prompt = "remove the pancakes and make it an omelet instead"
suspend fun inpaintImageWithMask(sourceImage: Bitmap, maskImage: Bitmap, prompt: String, editSteps: Int = 50): Bitmap {
val imageResponse = editingModel.editImage(
referenceImages = listOf(
ImagenRawImage(sourceImage.toImagenInlineImage()),
ImagenRawMask(maskImage.toImagenInlineImage()),
),
prompt = prompt,
config = ImagenEditingConfig(
editMode = ImagenEditMode.INPAINT_INSERTION,
editSteps = editSteps,
),
)
return imageResponse.images.first().asBitmap()
}Вы предоставляете исходное изображение (sourceImage), маску (maskImage), запрос на редактирование и количество шагов редактирования.
Посмотреть, как это работает, можно в примере редактирования изображений с помощью Imagen в каталоге примеров ИИ для Android.
Кроме того, Imagen поддерживает расширение изображения, позволяющее модели генерировать пиксели за пределами маски. Вы также можете использовать функции Imagen для изменения стиля изображения или обновления объекта на нем. Подробнее об этом можно узнать в документации для разработчиков Android.
Генерация изображений в чате с помощью Gemini 2.5 Flash Image
Один из способов редактировать изображения с помощью Gemini 2.5 Flash Image – использовать многоходовые чаты.
Сначала инициализируйте модель:
// Copyright 2025 Google LLC.
// SPDX-License-Identifier: Apache-2.0
val model = Firebase.ai(backend = GenerativeBackend.googleAI()).generativeModel(
modelName = "gemini-2.5-flash-image",
// Configure the model to respond with text and images (required)
generationConfig = generationConfig {
responseModalities = listOf(ResponseModality.TEXT,
ResponseModality.IMAGE)
}
)
Чтобы получить результат, аналогичный описанному выше методу на основе маски, можно использовать API chat для начала разговора с Gemini 2.5 Flash Image.
// Copyright 2025 Google LLC.
// SPDX-License-Identifier: Apache-2.0
// Initialize the chat
val chat = model.startChat()
// Load a bitmap
val source = ImageDecoder.createSource(context.contentResolver, uri)
val bitmap = ImageDecoder.decodeBitmap(source)
// Create the initial prompt instructing the model to edit the image
val prompt = content {
image(bitmap)
text("remove the pancakes and add an omelet")
}
// To generate an initial response, send a user message with the image and text prompt
var response = chat.sendMessage(prompt)
// Inspect the returned image
var generatedImageAsBitmap = response
.candidates.first().content.parts.filterIsInstance<ImagePart>().firstOrNull()?.image
// Follow up requests do not need to specify the image again
response = chat.sendMessage("Now, center the omelet in the pan")
generatedImageAsBitmap = response
.candidates.first().content.parts.filterIsInstance<ImagePart>().firstOrNull()?.image
Вы можете посмотреть, как это работает, в примере чата с изображениями Gemini в каталоге примеров ИИ для Android и узнать больше об этом в документации Android.
Заключение
Обе модели, Imagen и Gemini 2.5 Flash Image, обладают мощными возможностями. Вы можете выбрать подходящую модель для создания изображений, чтобы персонализировать приложение и повысить вовлеченность пользователей.
-
Новости продуктовЕсли вы разработчик приложений для Android и хотите добавить в них инновационные функции на основе ИИ, ознакомьтесь с нашими новыми возможностями.
Thomas Ezan • Время на чтение: 2 минуты -
Новости продуктовСегодня мы расширяем семейство моделей Gemini 3, выпуская Gemini 3 Flash – передовую модель, которая работает быстро и стоит недорого.
Thomas Ezan • Время на чтение: 2 минуты -
Новости продуктовУ разработчиков Android есть множество вариантов выбора агентов, больших языковых моделей (LLM), инструментов и интерфейсов командной строки (CLI), которые можно использовать для разработки приложений. Наша цель – помочь вам создавать красивые и качественные приложения для Android, независимо от того, как вы это делаете.
Simona Milanovic • Время на чтение: 4 минуты
Получайте свежие новости о разработке приложений для Android на свою электронную почту каждую неделю.