作者:互联网 时间: 2026-08-06 09:06:55
【快讯】8月5日,据字节跳动Seed官方消息,原生音视频全双工大模型SeedRealtime今日正式发布。该模型核心亮点是将声音、画面、时序与表达统一到同一个端到端模型中,摒弃传统模型先完整接收音视频信息再生成回复的运行逻辑,实现感知、理解、决策与表达同步并行。
据介绍,SeedRealtime是走向全模态交互的关键一步,在业界率先实现了音视频全双工技术的规模化落地,依托统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。目前, SeedRealtime已在豆包App全量上线。
SeedRealtime实现了三大突破:音视频联合理解、主动的交互能力、流畅的交互节奏。
端到端人工评测数据显示,对比级联式多模态模型,SeedRealtime的对话节奏违和问题降低五成,大幅改善中途抢话、回复延迟、噪音误触发等常见卡顿问题,完整顺畅完成一轮对话的概率明显提升。