Ao contrário dos assistentes de voz tradicionais, que funcionam de forma sequencial, o SeedRealtime foi concebido para ver, ouvir e falar ao mesmo tempo, quase como um interlocutor humano. Além disso, o modelo consegue interpretar em conjunto áudio, vídeo e texto, identificando com maior precisão tanto o alvo da interação como a intenção do utilizador.
De acordo com o blog oficial da ByteDance Seed, um dos principais desafios da equipa foi a cadência da conversa, garantindo que a resposta vocal do modelo soe mais natural e menos robótica. Portanto, o foco não está apenas na compreensão multimodal, mas também numa experiência conversacional mais fluida.
Uma expansão da estratégia de IA da ByteDance
Por outro lado, este lançamento reforça o trabalho anterior da ByteDance na tecnologia de fala full-duplex. Em abril, a empresa lançou o Seeduplex, descrito como o primeiro LLM de fala full-duplex nativo, que substituiu o sistema half-duplex na app Doubao e passou a processar interações de voz contínuas e em tempo real.
Desta vez, o SeedRealtime amplia essa base ao adicionar compreensão nativa de vídeo ao framework full-duplex. Assim, a ByteDance dá mais um passo na integração de capacidades multimodais em produtos de consumo, aproximando a investigação da utilização prática em larga escala.
Fica ainda mais conectado:
- Cibersegurança – Claude Opus 5 apaga acidentalmente uma base de dados
- Google Chrome – IA está a acelerar a encontro de bugs e torna as correções mais rápidas
- Microsoft – Satya Nadella confirma lançamento da super app Copilot este ano

