---
title: "Google lança Gemini 3.8 Live com voz, contexto visual e tarefas em segundo plano"
author: "Ignácio Afonso"
date: "2026-09-16 09:15:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/09/16/google-lanca-gemini-38-live-com-voz-contexto-visual-e-tarefas-em-segundo-plano/md"
---

## Resumo
- O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking em 15 de setembro de 2026.
- As duas versões trabalham com voz em tempo real, suportam 97 idiomas e detectam automaticamente o idioma utilizado.
- A arquitetura processa voz, vídeo e texto sem exigir transcrição intermediária e aceita chamadas de API durante a conversa.
- O Extended Thinking usa raciocínio assíncrono para trabalhar em tarefas complexas enquanto narra o progresso em segundo plano.
- O modelo alcançou 82,6 pontos em um índice de qualidade de fala para fala e teve eficácia de 35,1% em um benchmark de voz para bancos.
- Os custos estimados são de US$ 0,84 por hora para o Gemini 3.8 Live e US$ 3,50 por hora para o Extended Thinking.
- O acesso varia entre Search, aplicativo Gemini, Gemini API, Google AI Studio e uma prévia privada no Gemini Enterprise.

---

Em 15 de setembro de 2026, o **Google** anunciou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos voltados para interações de voz em tempo real. A novidade tenta resolver um problema recorrente dos assistentes digitais: a conversa costuma parar quando a tarefa exige análise, consulta ou execução de comandos. Agora, a proposta combina diálogo natural, compreensão visual e chamadas de ferramentas enquanto a interação continua. A versão padrão busca custo-benefício e escala, enquanto a edição Extended Thinking foi desenhada para raciocínios complexos e tarefas realizadas em várias etapas. O resultado é uma mudança de foco: a voz deixa de ser apenas uma porta de entrada e passa a acompanhar o trabalho da inteligência artificial.

## Duas vozes para necessidades diferentes

A primeira chave para entender o anúncio está na divisão entre os dois modelos. O **Gemini 3.8 Live** prioriza custo-benefício e escala, uma combinação voltada a conversas fluídas que precisam atender mais usuários sem exigir o processamento reservado às tarefas mais demoradas. Já o Gemini 3.8 Live Extended Thinking assume uma função mais analítica, com capacidade direcionada a problemas complexos e processos multietapas. Essa diferença evita tratar toda interação de voz como se tivesse o mesmo peso computacional, separando uma conversa cotidiana de uma solicitação que exige planejamento e execução prolongada.

Essa divisão também aparece na forma como o Google descreve o uso dos modelos. Os dois foram apresentados como sistemas capazes de sustentar interações de voz, mas o Extended Thinking recebe a tarefa de lidar com situações em que a resposta não termina na primeira frase. Em vez de entregar somente uma reação imediata, ele pode trabalhar sobre um problema enquanto mantém o diálogo ativo. A ideia lembra um funcionário que continua consultando documentos depois de avisar que começou a pesquisa, só que, neste caso, o funcionário é uma IA e a piada sobre reuniões que poderiam ser e-mails continua tão ruim quanto sempre foi.

## Quando a conversa continua enquanto a máquina trabalha

Essa capacidade depende de uma arquitetura descrita como **áudio para áudio**, na qual os sistemas processam voz, vídeo e texto sem exigir uma transcrição intermediária. Transcrição intermediária é o passo em que uma fala é convertida primeiro em texto antes de ser analisada; ao remover essa etapa, o modelo passa a operar diretamente sobre os formatos recebidos. Os dois modelos suportam 97 idiomas, detectam automaticamente o idioma usado e permitem chamadas de API enquanto a conversa continua. API, neste contexto, é a interface que permite conectar o modelo a uma função ou serviço externo sem encerrar o diálogo.

O processamento visual amplia essa conversa para além do som. O material de lançamento informa suporte a imagens JPEG a 1 quadro por segundo, o que permite enviar uma sequência visual enquanto a interação ocorre. Um quadro por segundo significa que o sistema recebe uma imagem a cada segundo, em vez de analisar somente uma fotografia isolada. Essa leitura visual pode acompanhar uma orientação falada ou uma tarefa que dependa do que aparece diante da câmera. A combinação entre percepção visual e voz coloca o modelo em uma posição diferente de um chatbot que apenas recebe texto digitado.

## O raciocínio em segundo plano tem um preço

O salto mais específico está no protocolo de **raciocínio assíncrono** usado pelo Extended Thinking. Em termos simples, assíncrono significa que o modelo pode continuar uma atividade sem bloquear a conversa até encontrar a resposta final. A IA pode narrar verbalmente o progresso enquanto trabalha em um problema complexo em segundo plano, permitindo que a pessoa acompanhe a tarefa sem receber apenas silêncio. O recurso foi associado a situações como onboarding de funcionários, processo de integração de novos profissionais, e execução de funções de negócios que exigem várias decisões encadeadas.

Na prática, o recurso aproxima a conversa de uma interface de trabalho. O usuário pode iniciar uma solicitação, continuar falando e deixar que o modelo execute uma etapa mais longa enquanto a interação permanece aberta. O Google também informou integrações com **Search Live** e Docs, conectando a conversa a serviços usados para buscar informações e trabalhar com documentos. Essa ligação é relevante porque a IA deixa de responder somente com base no que já foi dito e passa a participar de um fluxo que envolve consulta e produção de conteúdo.

## O que os números dizem sobre custo e desempenho

A conta ajuda a separar a promessa técnica do uso cotidiano. Em um índice de qualidade de conversação de fala para fala da Artificial Analysis, o **Gemini 3.8 Live Extended Thinking** alcançou 82,6 pontos. O índice procura medir a qualidade de uma interação em que a entrada e a saída acontecem por voz, portanto o número se relaciona à experiência de conversar com o sistema, e não somente à capacidade de produzir texto. O resultado oferece uma referência comparativa para o modelo, mas a utilidade concreta ainda depende do tipo de tarefa, do tempo de processamento e do custo aceito por cada aplicação.

Esse custo aparece nas estimativas divulgadas para as duas versões. A entrada é estimada em **US$ 3,50 por hora** para o Extended Thinking e em US$ 0,84 por hora para o Gemini 3.8 Live padrão. A diferença coloca a edição voltada ao raciocínio complexo em uma faixa de preço superior, enquanto a versão Live atende ao uso que prioriza conversas fluidas e escala. Para uma empresa, essa separação permite reservar o modelo mais caro para tarefas que realmente exigem várias etapas, em vez de usá-lo indiscriminadamente em toda interação de voz.

Os números de teste também mostram por que tarefas especializadas exigem cautela. No benchmark de voz para bancos chamado **τ-Voice-banking**, a versão Extended Thinking registrou 35,1% de eficácia na conclusão de tarefas. Um benchmark é um teste padronizado para comparar o desempenho de sistemas em uma atividade definida, não uma garantia de que todos os atendimentos terão o mesmo resultado. O dado indica que o modelo foi avaliado em funções bancárias por voz, mas não autoriza concluir que ele resolverá qualquer operação financeira sem supervisão ou integração adicional.

## Autenticidade e acesso ainda têm camadas

Como a voz gerada pode soar natural, o Google associou os dois modelos à **marca d'água SynthID**. A função informada é ajudar na autenticidade do áudio gerado, oferecendo uma identificação associada ao material produzido pelo sistema. Esse detalhe acompanha a própria expansão da voz como interface: quanto mais convincente for a fala sintética, maior será a necessidade de distinguir uma saída criada por IA de uma gravação humana. O anúncio não apresenta a marca d'água como uma solução para todos os riscos, mas confirma que a identificação faz parte do lançamento desde o início.

Quanto ao acesso, os modelos chegam por caminhos diferentes. O público geral pode encontrá-los por meio do Search e do aplicativo Gemini, enquanto assinantes de planos premium têm acesso relacionado ao Google Workspace. A distribuição não é uniforme porque cada grupo recebe a tecnologia dentro de uma experiência diferente: uma pessoa conversa com o serviço pronto, um assinante utiliza recursos ligados ao trabalho e uma equipe técnica pode construir uma aplicação própria. O ponto prático é verificar qual porta de entrada está disponível antes de planejar um uso específico.

Para desenvolvedores, o acesso ocorre pela **Gemini API** e pelo Google AI Studio, ferramentas voltadas à experimentação e à conexão dos modelos com aplicações. Para empresas, os modelos aparecem em private preview no Gemini Enterprise, expressão que indica uma prévia privada e limitada. Essa diferença informa o grau de maturidade de cada caminho: o uso público já tem portas definidas, enquanto a adoção corporativa permanece vinculada a uma fase restrita. Quem pretende colocar voz em um processo crítico precisa, portanto, distinguir disponibilidade comercial de acesso para testes.

## Da automação de código à interface de voz

Essa chegada acontece pouco depois de outra movimentação da empresa na linha Gemini. Em 13 de agosto de 2026, o Google lançou o Gemini 3.7 Flash com foco em codificação e automação de agentes, sistemas capazes de executar ações orientadas por objetivos. A sequência mostra uma divisão de funções dentro da família de modelos: de um lado, ferramentas voltadas ao trabalho de desenvolvimento; de outro, modelos que levam a interação para a voz, a imagem e a execução contínua. A [cobertura anterior sobre o Gemini 3.7 Flash](https://desbugados.com.br/post/2026/08/15/gemini-37-flash-chega-para-ser-o-cerebro-e-o-agente-dos-programadores) ajuda a acompanhar essa transição sem tratar cada lançamento como uma ilha.

O aspecto mais significativo do Gemini 3.8 Live está nessa passagem da resposta para o acompanhamento da tarefa. O modelo padrão foi apresentado para conversas em escala, enquanto o Extended Thinking combina voz, raciocínio assíncrono e ações em segundo plano. A proposta também mantém a conversa ligada a serviços Google, ao mesmo tempo que abre acesso técnico pela API e pelo AI Studio. Para leitores e equipes, a pergunta deixa de ser apenas qual modelo responde melhor e passa a ser qual tarefa precisa continuar depois que a primeira frase termina.

O próximo passo é escolher a porta de entrada de acordo com o uso. Usuários devem verificar a disponibilidade no Search ou no aplicativo Gemini; desenvolvedores podem testar a conexão pela Gemini API e pelo Google AI Studio; empresas precisam considerar que o Gemini Enterprise permanece em private preview. A escolha entre o Live e o Extended Thinking deve acompanhar a exigência do trabalho e a estimativa de custo, que vai de US$ 0,84 a US$ 3,50 por hora nas referências divulgadas. Assim, o anúncio entrega uma caixa de ferramentas clara: conversa em tempo real para escala, raciocínio em segundo plano para tarefas multietapas e SynthID para identificar o áudio gerado.