Google lança Gemini 3.8 Live e Extended Thinking com raciocínio em tempo real por voz
O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, capazes de raciocinar enquanto conversam com o usuário por voz e de executar tarefas em segundo plano sem interromper o diálogo.
O Gemini 3.8 Live já está disponível no Search Live, enquanto os recursos de Extended Thinking chegam ao aplicativo Gemini e ao Google Workspace, com acesso condicionado ao serviço e ao plano contratado.
Ambos os modelos também foram disponibilizados para desenvolvedores por meio da Gemini API e do Google AI Studio, e ingressam em pré‑via privada para empresas no Gemini Enterprise.
No Google Workspace, o Docs Live está habilitado para assinantes dos planos Google AI Pro e Ultra. Já os recursos Gmail Live e Keep Live são oferecidos aos assinantes dos planos AI Plus, Pro e Ultra.
As integrações permitem usar comandos de voz para interagir com documentos, e‑mails e notas enquanto a inteligência artificial trabalha nas solicitações feitas pelo usuário.
A principal diferença entre os dois modelos está no tipo de tarefa para o qual cada um foi desenvolvido: o Gemini 3.8 Live prioriza interações rápidas, escala e custo‑benefício, enquanto o Gemini 3.8 Live Extended Thinking foi criado para solicitações que exigem várias etapas de processamento.
Ambos contam com suporte visual em tempo real, detecção automática de idiomas e a capacidade de alternar entre 97 idiomas durante uma mesma conversa.
Os novos modelos foram desenvolvidos para processar informações e executar ações enquanto continuam conversando com o usuário. Em vez de interromper a interação até terminar a tarefa, o Gemini pode reconhecer a solicitação, iniciar a ação em segundo plano e prosseguir o diálogo enquanto o processo é concluído. Exemplos de uso incluem consulta de informações, criação de códigos ou realização de reservas.
No Gemini 3.8 Live Extended Thinking, o sistema utiliza frases curtas para sinalizar que está trabalhando, como “deixe‑me verificar isso para você”, evitando longos períodos de silêncio e aproximando a experiência de uma conversa natural. Em tarefas com várias etapas, a IA informa o andamento do processo enquanto executa as ações necessárias.
A interação pode combinar voz e imagem; com o uso da câmera, o Gemini interpreta o ambiente em tempo real e usa essas informações para responder ao usuário. O Google citou como exemplos o auxílio durante uma partida de xadrez e a orientação de novos funcionários em processos de integração.
Em benchmarks de voz, o Gemini 3.8 Live Extended Thinking alcançou 82,6 pontos no Speech to Speech Quality Index, conquistando o primeiro lugar geral, e 97,7% no Big Bench Audio. O modelo registrou ainda 68,6% no τ‑Voice (conclusão de tarefas por agentes de voz) e 35,1% no τ‑Voice‑banking (tarefas do setor financeiro). O Gemini 3.8 Live ficou em segundo lugar no Speech Agent Arena, que avalia a preferência dos usuários em interações com agentes de voz.
Para identificar conteúdos produzidos pelos modelos, os áudios gerados pelo Gemini Live recebem uma marca d'água imperceptível por meio do SynthID, tecnologia desenvolvida pelo Google para facilitar a detecção de conteúdo criado por IA e aumentar a transparência sobre a origem das gravações.
Como já relatamos em 09/09, quando o Google liberou o Daily Brief do Gemini sem custo nos EUA, a empresa continua ampliando as funcionalidades da sua IA, agora permitindo conversas mais fluidas e multitarefas.
Com informacoes de Canaltech.

