Google lança o Gemini 3.5 Transcribe, novo modelo de conversão de voz em texto

A Google lançou o Gemini 3.5 Transcribe, um modelo de conversão de voz em texto que transforma áudio bruto em texto revisto e formatado. Além de transcrever palavras, a ferramenta identifica o contexto da conversa, remove muletas de linguagem, como “hum” ou “ah”, e lida com autocorreções feitas pelo utilizador. 

- Advertisement -

Por exemplo, se alguém disser “marcamos para terça-feira… afinal, quarta-feira”, o modelo deverá registar apenas a data corrigida. Da mesma forma, aplica automaticamente formatação ao texto e permite adicionar vocabulário personalizado, uma funcionalidade relevante para termos técnicos, nomes próprios ou expressões específicas de cada setor.

Gemini 3.5 Transcribe da Google promete utilidade no dia a dia

Segundo a Google, o Gemini 3.5 Transcribe é o seu modelo de transcrição mais preciso até à data e substitui o motor Chirp 3. Dados da Artificial Analysis indicam uma taxa de erro por palavra de 4,0% em transcrição em streaming e de 2,6% em processamento não contínuo. Além disso, o tempo até à transcrição final é, alegadamente, 70% inferior ao do Chirp 3. 

Para programadores, a tecnologia está disponível através de duas APIs. Por um lado, a Live API permite transcrição em tempo real com latência inferior a um segundo. Por outro, a Interactions API foi pensada para ficheiros de áudio pré-gravados e inclui identificação de intervenientes e marcas temporais ao nível de cada palavra. 

Disponibilidade e integração nos produtos Google 

O Gemini 3.5 Transcribe já é utilizado na funcionalidade de ditado Rambler do Gboard nos dispositivos Pixel 11. Está também integrado na aplicação Gemini para macOS, onde pode encaminhar tarefas, como a geração de imagens, para outros modelos Gemini através de function calling. 

Entretanto, a Google prepara suporte para o Chrome, o que permitirá ditar texto diretamente em qualquer campo de escrita no navegador. A empresa lançou ainda o Gemini 3.5 Live e o Gemini 3.5 Live Experimental, que, em conjunto, integram a oferta “Gemini Audio”. 

- Advertisement -

Esta família de modelos deverá reforçar as capacidades de conversação e reconhecimento de voz em produtos como o Search Live, Gemini Live, Google Docs, Keep e Gmail. O Gemini 3.5 Transcribe suporta a deteção automática de mais de 85 idiomas e pode identificar até três interlocutores em áudio pré-gravado. 

No entanto, há uma contrapartida: ao priorizar o sentido da mensagem em vez de uma transcrição literal, o modelo pode alterar a formulação original. Por isso, esta abordagem pode ser menos indicada para contextos em que seja essencial manter um registo palavra por palavra, como entrevistas, declarações formais ou documentação jurídica.

Fica ainda mais conectado:

Fonte

- Pub -
João Paulo
João Paulo
Aprendiz de código, com gosto por artes marciais e tecnologia. Encontro na tecnologia o espaço onde posso encontrar ferramentas que me ajudam no dia a dia e a ligar-me a quem preciso.