ByteDance lança o SeedRealtime: o modelo de IA áudio-vídeo em tempo real

Ao contrário dos assistentes de voz tradicionais, que funcionam de forma sequencial, o SeedRealtime foi concebido para ver, ouvir e falar ao mesmo tempo, quase como um interlocutor humano. Além disso, o modelo consegue interpretar em conjunto áudio, vídeo e texto, identificando com maior precisão tanto o alvo da interação como a intenção do utilizador.

- Advertisement -

De acordo com o blog oficial da ByteDance Seed, um dos principais desafios da equipa foi a cadência da conversa, garantindo que a resposta vocal do modelo soe mais natural e menos robótica. Portanto, o foco não está apenas na compreensão multimodal, mas também numa experiência conversacional mais fluida.

Uma expansão da estratégia de IA da ByteDance

Por outro lado, este lançamento reforça o trabalho anterior da ByteDance na tecnologia de fala full-duplex. Em abril, a empresa lançou o Seeduplex, descrito como o primeiro LLM de fala full-duplex nativo, que substituiu o sistema half-duplex na app Doubao e passou a processar interações de voz contínuas e em tempo real.

Desta vez, o SeedRealtime amplia essa base ao adicionar compreensão nativa de vídeo ao framework full-duplex. Assim, a ByteDance dá mais um passo na integração de capacidades multimodais em produtos de consumo, aproximando a investigação da utilização prática em larga escala.

Fica ainda mais conectado:

Fonte

- Pub -
João Paulo
João Paulo
Aprendiz de código, com gosto por artes marciais e tecnologia. Encontro na tecnologia o espaço onde posso encontrar ferramentas que me ajudam no dia a dia e a ligar-me a quem preciso.