📱 豆包上线原生音视频全双工模型,实时对话不再靠模块接力

字节跳动 8 月 5 日发布原生音视频全双工大模型 SeedRealtime。该模型以统一架构融合音频、视频与文本,支持在连续多模态信息流上实时交互,具备音视频联合理解、主动环境感知与流畅对话节奏三项核心能力。端到端人工评测显示,其音视频对话节奏问题较级联模型减少一半,"话未说完被抢断"等卡壳现象显著减少。目前该模型已在豆包 App 全量上线。

不同于传统级联系统依赖 ASR、VLM、TTS 多模块串联造成的延迟与信息损耗,SeedRealtime 将感知、理解、决策与表达纳入同一端到端模型同步进行,无需外置 VAD 判断轮次,可实现"边看、边听、边说"的全双工自然交互。

字节跳动 Seed

🌸 在花频道 · 茶馆水群 · 投稿通道
Media is too big
VIEW IN TELEGRAM
 
 
Back to Top