Os aplicativos móveis modernos dependem muito da mídia gerada pelo usuário para impulsionar o engajamento e a retenção. Os apps observam a variabilidade natural na qualidade do conteúdo devido ao amplo espectro de recursos do dispositivo, condições de iluminação e experiência do usuário. Para apps que gerenciam grandes volumes de fotos e vídeos de várias fontes, há uma oportunidade de aumentar a qualidade básica desse conteúdo gerado pelo usuário. Para manter a qualidade ideal, é necessário um equilíbrio cuidadoso entre a compactação necessária para operações como edição, upload e download e a retenção de detalhes suficientes para consumo de alta fidelidade.
Visão geral da API Media Enhancement
A API Media Enhancement no Google Play Services oferece uma solução abrangente de IA no dispositivo para preencher essa lacuna. Ele usa a aceleração da unidade de processamento gráfico (GPU) no dispositivo para oferecer melhorias de alta qualidade e baixa latência para imagens e vídeos. Essas melhorias são alcançadas com recursos como mapeamento automático de tons, remoção de desfoque e ruído e aumento da resolução.
Fornecida nativamente pelo Google Play Services, essa API descarrega tarefas de restauração de imagens e vídeos com uso intenso de recursos computacionais diretamente para a GPU nativa e a unidade de processamento neural (NPU) do dispositivo host. A API oferece um pipeline de baixa latência e que preserva a privacidade com zero de bloat de APK, baixando modelos sob demanda apenas quando necessário para respeitar o espaço em disco do dispositivo.
Principais recursos e casos de uso
O framework tem como alvo pontos específicos de falha de mídia usando três recursos principais de aprendizado de máquina, que podem ser configurados de forma independente ou em conjunto:
| Capacidade | Funcionalidade algorítmica | Caso de uso ideal do aplicativo |
|---|---|---|
| Tonemap | Um algoritmo de mapeamento de tons local de SDR para SDR que melhora imagens de faixa dinâmica padrão (SDR) para imitar qualidades semelhantes ao HDR, como contraste local aprimorado e sombras mais claras, sem ultrapassar o intervalo SDR exibível. Esse algoritmo em tempo real e eficiente em termos de energia é otimizado para desempenho em dispositivos móveis. | Recuperar fotos de paisagens sem vida e nubladas ou retratos internos com iluminação traseira forte. |
| Remover desfoque | Reconstrói bordas nítidas estimando o kernel de desfoque matemático causado pelo movimento do objeto ou pela trepidação da câmera. Aplica filtragem espacial para suavizar o ruído cromático e atua como um filtro de desbloqueio para reduzir os artefatos de compactação perto de bordas nítidas. | Recuperar fotos tremidas ou borradas, melhorar imagens granuladas com pouca luz e remover artefatos blocados de imagens JPEG compactadas e transmissões de vídeo. |
| Sofisticado | Usa um modelo generativo de superresolução para multiplicar a contagem de pixels e reconstruir detalhes de alta frequência ausentes. | Ajustar miniaturas pequenas ou arquivos de vídeo de definição padrão para exibição em tela cheia. |
Requisitos de hardware
A execução da inferência no dispositivo com modelos de machine learning ou aprendizado profundo leva tempo, e a performance depende muito dos aceleradores de hardware usados pelo dispositivo. A API Media Enhancement é otimizada para dispositivos premium equipados com núcleos tensores dedicados e memória de alta largura de banda (por exemplo, Pixel 10 Pro ou Samsung Galaxy S26 Ultra).
Se o hardware de um dispositivo não atender aos limites mínimos de performance, o processo de inicialização será interrompido e vai informar um status sem suporte para evitar quedas de frames ou limitação térmica.