← Artigos

Português

Google lança Gemini 3.5 Transcribe para transformar voz em texto

O novo modelo limpa hesitações, reconhece mais de 85 idiomas e já pode entrar em aplicativos criados com a API do Gemini.

Nome e logotipo do Gemini 3.5 Transcribe sobre fundo azul
Google

Notícia

O Google apresentou nesta quarta-feira, 26 de agosto, o Gemini 3.5 Transcribe, modelo de inteligência artificial feito para converter fala em texto enquanto a pessoa conversa ou a partir de uma gravação. A novidade chega em prévia pública para desenvolvedores e também sustenta recursos de ditado que já aparecem no Android e no aplicativo do Gemini para macOS.

A proposta não é apenas anotar cada palavra na ordem em que ela foi dita. Segundo o Google, o modelo interpreta autocorreções durante a fala, retira expressões de hesitação, organiza a pontuação e entrega um texto formatado, sem exigir que a pessoa repita toda a frase porque mudou uma data ou um nome no meio do caminho.

O anúncio oficial do Google detalha as duas interfaces, os usos no Android e no macOS e os resultados atribuídos à empresa. The Verge, Engadget e 9to5Google confirmaram o lançamento e a disponibilidade anunciada.

O lançamento se encaixa tanto no uso cotidiano quanto na criação de programas. Quem desenvolve um aplicativo pode usar o Gemini 3.5 Transcribe para legendar uma conversa ao vivo, registrar uma reunião, separar falas de participantes ou montar uma interface controlada por voz, enquanto usuários encontram partes dessa tecnologia no teclado Gboard e no computador.

A frase pode mudar no meio

Uma demonstração divulgada pela empresa parte de uma situação comum: alguém diz que a reunião será na terça-feira e corrige para quarta-feira antes de terminar a frase. Em vez de conservar as duas datas e obrigar uma revisão manual, o sistema tenta entender a correção e registrar apenas a intenção final.

O mesmo tratamento vale para palavras de preenchimento, como os equivalentes em inglês a "hum" e "ah". O Google chama esse processo de transcrição inteligente, porque o resultado pode retirar hesitações e ganhar formatação automaticamente, mas essa limpeza também significa que o arquivo final não é necessariamente uma reprodução literal de cada som captado.

Essa diferença importa em entrevistas, pesquisas, depoimentos e outros trabalhos nos quais a forma exata da fala pode ter valor. Para uma mensagem, um rascunho ou uma nota de reunião, o texto limpo tende a poupar tempo; para documentação que exige fidelidade palavra por palavra, o responsável ainda precisa definir o formato esperado e conferir o resultado.

O modelo também aceita vocabulário personalizado. A fabricante afirma que nomes próprios, grafias incomuns, termos técnicos e sequências formadas por letras e números, como códigos postais e números de pedidos, podem ser fornecidos como contexto para reduzir trocas que são frequentes em sistemas convencionais de reconhecimento de voz.

Duas portas para quem cria aplicativos

O Google separou o acesso em duas interfaces de programação, o conjunto de regras usado por um aplicativo para conversar com outro serviço. A Live API recebe áudio continuamente por meio do identificador `gemini-3.5-transcribe-live` e foi desenhada para responder em menos de um segundo, condição necessária para legendas e assistentes que acompanham uma conversa.

Já a Interactions API usa o identificador `gemini-3.5-transcribe` para processar material gravado. Nessa modalidade, o serviço pode indicar quem falou e marcar o instante de cada palavra para até três participantes; a separação de mais de três vozes existe em caráter experimental, de acordo com o anúncio.

As duas opções estão em prévia pública, portanto ainda podem receber mudanças antes de uma versão considerada estável. Desenvolvedores encontram o modelo na API do Gemini pelo Google AI Studio e no Google Antigravity, ambiente da empresa voltado à criação de programas com agentes de IA.

No Antigravity, o microfone pode levar em conta o arquivo aberto e o histórico da conversa, desde que o usuário permita esse acesso. A ideia é reconhecer melhor nomes de arquivos, trechos de código e instruções dirigidas ao agente, uma diferença prática para quem tenta programar por voz e costuma ver identificadores técnicos saírem errados no ditado comum.

O modo Build do AI Studio também recebe o modelo para a chamada vibe coding, forma de criar um programa descrevendo em linguagem natural o que ele deve fazer. Nesse cenário, a voz vira outra entrada para escrever o pedido, revisar uma instrução e continuar a construção sem transformar todo o áudio em uma ordem rígida palavra por palavra.

Números são da fabricante

O Google diz que o Gemini 3.5 Transcribe detecta automaticamente mais de 85 idiomas e lida com sotaques regionais, ruído de fundo e mudanças de idioma durante uma transmissão. Esses pontos são alegações da empresa no lançamento, não medições independentes feitas em todos os idiomas, aparelhos e ambientes possíveis.

Na medição geral citada pelo Google e atribuída à empresa de avaliação Artificial Analysis, a taxa média de palavras erradas ficou em 4% na transmissão ao vivo e em 2,6% no processamento de gravações. Taxa de palavras erradas, ou WER na sigla em inglês, compara substituições, exclusões e inclusões com uma transcrição de referência, de modo que um resultado menor representa menos divergências.

O comunicado apresenta ainda um segundo conjunto de resultados no FLEURS, teste com diferentes idiomas e regiões. Nesse caso, o modelo teria registrado 5,50% de palavras erradas no modo contínuo e 5,04% em gravações; os números não contradizem necessariamente a média anterior, pois vêm de conjuntos e condições de avaliação diferentes.

A empresa afirma também que o tempo até a transcrição final caiu 70% em comparação com o Chirp 3, seu modelo anterior. Sem a planilha completa de testes e uma avaliação reproduzida fora do Google, o percentual serve como referência declarada pela fabricante, não como garantia de que qualquer celular, microfone ou conexão terá a mesma redução.

The Verge confirmou que o Transcribe é uma adição nova à família Gemini e observou que ele chega ao lado do Gemini 3.5 Live e do 3.5 Live Experimental. Esses dois modelos se concentram em interações por voz, interrupções e tarefas mais complexas em tempo real, enquanto o Transcribe tem como função central produzir o texto.

Do Gboard ao Chrome

Parte do modelo já estava chegando ao público antes de o nome técnico ser apresentado. No Android, ele alimenta o Rambler, recurso do Gboard que transforma fala em texto organizado e permite corrigir grafia ou mudar o estilo usando a própria voz, em países e idiomas selecionados pela empresa.

No macOS, o aplicativo do Gemini oferece ditado inteligente em inglês. O sistema pode combinar a transcrição com o conteúdo mostrado na tela e chamar outros modelos para resumir arquivos locais, reaproveitar um texto entre programas ou gerar uma imagem no ponto em que está o cursor, sempre sujeito às permissões dadas pelo usuário.

O Chrome será a próxima vitrine de uso geral, embora o Google não tenha informado uma data para a chegada. A promessa é permitir o ditado em qualquer campo de texto de uma página, o que inclui respostas, publicações e pedidos enviados ao próprio Gemini; por enquanto, essa integração deve ser tratada como recurso futuro.

O acesso empresarial também começa em prévia pela Gemini Enterprise Agent Platform. A integração com o Gemini Enterprise for Customer Experience virá depois, sem cronograma divulgado, e pode interessar a centrais de atendimento que precisam transformar chamadas em registros pesquisáveis.

Engadget destacou a capacidade anunciada de aprender vocabulário e separar até três pessoas em áudio gravado, além da futura entrada no Chrome. Já o 9to5Google detalhou os dois grupos de resultados de erro e a presença do modelo no Rambler, reforçando que os índices apresentados continuam ligados aos testes citados pelo Google.

Texto limpo exige escolha

A transcrição que corrige a própria fala pode reduzir o trabalho de quem dita mensagens longas, registra uma aula ou transforma uma reunião em ata. Também pode esconder pausas e correções que seriam úteis para entender como uma resposta foi construída, por isso o uso ideal depende de o objetivo ser um texto pronto ou um registro literal.

Há outra distinção importante no anúncio: disponibilidade não significa lançamento uniforme para todo mundo. Desenvolvedores já podem experimentar as duas interfaces, o aplicativo do Gemini no macOS recebe o recurso em inglês e o Rambler aparece apenas em países e idiomas escolhidos, enquanto o Chrome continua na lista do que chegará em breve.

O Google não divulgou no comunicado um preço específico para o Gemini 3.5 Transcribe nem confirmou uma data de disponibilidade geral. Quem pretende colocar o modelo em produção precisa conferir as condições da prévia, os limites da API e o tratamento dado aos áudios antes de enviar reuniões, chamadas ou qualquer gravação com dados pessoais.

A fala pode chegar ao campo de texto já sem os tropeços do ditado, enquanto você decide se quer um rascunho limpo ou um registro fiel da conversa.