作者:互联网 时间: 2026-07-23 07:24:54
7月22日,字节跳动Seed团队正式推出全新音频生成模型——Seed Audio 1.0。该模型基于统一架构,可端到端合成涵盖人声、音效及环境声的完整三维音频场景,致力于打造“听即所见”的深度沉浸式听觉体验。
Seed Audio 1.0具备多项关键技术能力:支持毫秒级(100ms)时间精度控制,实现各类声音元素起始时刻的精细编排;支持零样本语音生成与长时音频连续延展,单次输出时长可达约2分钟,并确保角色音色全程一致;兼容中、英、日、韩等20余种语言,且同一音色可在多语种间实现自然、流畅的跨语言迁移。
实测数据显示,Seed Audio 1.0在文本到音色生成任务中性能突出,在影视配音、播客制作、短剧音频等主流应用场景中,音频可用率均突破90%。目前,该模型已正式上线火山方舟体验中心,面向开发者与创作者开放体验。