O Google oferece uma ampla seleção de modelos e APIs de IA líderes do setor para inferência baseada na nuvem e no dispositivo. Com a inferência híbrida, é possível equilibrar as cargas de trabalho de IA entre o dispositivo local e a nuvem, otimizando o desempenho, o custo e a disponibilidade.
A inferência híbrida oferece duas vantagens principais para seu app Android:
- Maximizar o alcance: os modelos de nuvem servem como um fallback essencial quando os modelos no dispositivo, como o Gemini Nano, não estão disponíveis devido a restrições de hardware ou SO do dispositivo. Isso ajuda a garantir que os recursos de IA continuem funcionando na maior variedade possível de dispositivos dos usuários.
- Custo e recursos off-line: os modelos no dispositivo ajudam a garantir que os recursos de IA funcionem perfeitamente quando o usuário está off-line. Além disso, ao descarregar tarefas rotineiras para o dispositivo local, é possível reduzir os custos de inferência na nuvem.
Confira os benefícios da inferência no dispositivo e na nuvem, respectivamente:
| Inferência no dispositivo | Inferência na nuvem |
|---|---|
| Disponível off-line | Compatível com qualquer dispositivo |
| Sem custo de inferência | Recursos avançados do modelo |
Opções de implementação
É possível implementar a inferência híbrida usando as seguintes abordagens:
API híbrida do Firebase AI Logic
A API híbrida do Firebase AI Logic oferece uma interface única e unificada para rotear a inferência entre modelos na nuvem e no dispositivo.
- Troca automática: você pode configurar o app para executar tarefas da IA no dispositivo sempre que possível. Isso significa que o recurso do app funciona off-line, tem privacidade aprimorada e não gera custos de inferência na nuvem. Se o modelo no dispositivo não estiver disponível, o SDK poderá encaminhar automaticamente a solicitação para o modelo do Gemini hospedado na nuvem.
- Proteção contra abuso: chamar diretamente APIs do Cloud de um app para dispositivos móveis pode expor credenciais e gerar cobranças indesejadas. No entanto, ao usar o Firebase AI Logic, você também aplica o Firebase App Check, que ajuda a evitar abusos verificando se apenas seu app original e não adulterado pode acessar a API Gemini na nuvem.
- Limites de gastos: ao encaminhar solicitações para modelos hospedados na nuvem, você pode configurar gastos máximos para proteger seu orçamento na nuvem e evitar cobranças inesperadas.
No seu app, defina o parâmetro onDeviceConfig para controlar o
modo de inferência e gerenciar o roteamento:
PREFER_ON_DEVICE: tenta usar o modelo no dispositivo. Se ele não estiver disponível ou não for compatível com a solicitação, o sistema vai usar automaticamente o modelo hospedado na nuvem.PREFER_IN_CLOUD: tenta usar o modelo hospedado na nuvem quando o dispositivo está on-line e o modelo está disponível. Ele volta para o modelo no dispositivo apenas se o dispositivo estiver off-line.ONLY_ON_DEVICE: tenta usar o modelo no dispositivo e gera uma exceção se o modelo no dispositivo não estiver disponível ou não for compatível com a solicitação.ONLY_IN_CLOUD: tenta usar o modelo hospedado na nuvem quando o dispositivo está on-line e o modelo está disponível. Em todos os outros casos, gera uma exceção.
val model = Firebase.ai(backend = GenerativeBackend.Companion.googleAI()) .generativeModel( modelName = "gemini-3.5-flash", onDeviceConfig = OnDeviceConfig(mode = InferenceMode.Companion.PREFER_ON_DEVICE) ) val response = model.generateContent("Write a story about a green robot.") print(response.text)
Para detalhes da implementação, consulte a documentação do Firebase e confira o exemplo de IA híbrida no catálogo de IA.
A transição de cargas de trabalho para a nuvem pode expor endpoints de APIs do Cloud. Ao usar o Firebase AI Logic, você pode acessar com segurança os modelos do Gemini baseados na nuvem diretamente dos seus apps do lado do cliente aplicando o Firebase App Check, que ajuda a proteger a inferência baseada na nuvem contra acesso não autorizado e abuso de faturamento. Isso ajuda a manter seu mecanismo de substituição híbrida disponível e seguro.
Roteamento personalizado
Se o app tiver requisitos específicos de negócios ou UX, também será possível implementar uma lógica de roteamento personalizada. Isso permite determinar dinamicamente o caminho de inferência com base em fatores em tempo real, como:
- Latência de rede
- Integridade do sistema do dispositivo (por exemplo, níveis de bateria e carga do processador)
- Complexidade da consulta do usuário
Essa abordagem de inferência híbrida personalizada é usada pelos principais apps que implementaram o próprio roteamento personalizado para oferecer experiências de IA confiáveis, incluindo:
GBoard: o Gboard usa inferência híbrida personalizada para ativar as ferramentas de escrita, como revisão e reescrita.
Kakao Mobility: a Kakao Mobility criou uma ferramenta de extração de entidades usando inferência híbrida personalizada para o serviço de entrega de encomendas. Ela extrai automaticamente nomes de destinatários, endereços e números de telefone de mensagens em linguagem natural para simplificar formulários de pedidos.