模型 / 官方
边说边听,告别机械问答
字节跳动 Seed 团队正式推出原生全双工语音大模型 Seeduplex,彻底告别此前豆包端到端语音模型所采用的半双工范式。全双工技术让 AI 能够同时「听」与「说」,不再是机械式的一问一答,而是具备自然节奏感的流畅对话。Seeduplex 基于自研大语言模型底座,通过语音数据预训练实现语音与语义的联合建模,在干扰抑制和对话节奏两大核心能力上实现突破:复杂场景下误响应率与误打断率较半双工方案降低一半,抢答率下降 40%,端点检测人类相似度测试较半双工方案提升 8%。目前 Seeduplex 已在豆包 App 全量上线,成为业内首个大规模落地的全双工语音交互方案,服务数亿用户。
字节跳动 Seed 团队于近日正式发布 Seeduplex,这是一款基于「边说边听」框架构建的原生全双工语音大模型。与上一代豆包端到端语音模型的半双工架构相比,Seeduplex 让 AI 具备同步收听与发言的能力,从根本上改变了人机语音交互的底层逻辑。全双工技术意味着对话不再是简单的轮流发言,而是更接近真实人际交流的动态节奏——AI 可以在说话的同时持续感知用户的声学环境,并在恰当时机做出响应。
传统半双工系统通常依赖级联模块设计,使用独立的语音活动检测(VAD)进行机械式音频切割,或借助传统算法进行前端降噪。由于决策仅依赖孤立的声学特征或局部文本语义特征,这类系统在复杂环境中极易「跑偏」,或在用户停顿时触发抢答。Seeduplex 则通过语音数据预训练,实现了语音与语义信息的整体理解,能够动态编排对话节奏,在干扰抑制和节奏把控上均大幅超越传统方案。
在干扰抑制方面,Seeduplex 持续接收并理解用户侧音频,精准判断哪些声音是真实的交互意图,哪些属于背景干扰。无论是车内频繁播报的导航语音、咖啡馆中偶遇朋友的寒暄,还是快递员敲门时的对话,系统均能从语义层面识别出真正面向模型的交互内容,避免误响应,保持主对话的连贯性。在复杂场景下,其误响应率和误打断率较半双工方案降低了一半。模型甚至能解析环境音并将其纳入推理上下文,主动将环境信息与对话内容关联,提供更贴心的回应。
在自适应端点检测方面,Seeduplex 联合利用语音特征与语义特征,整体判断用户意图,实现更自然的对话流转。当用户犹豫或停顿思考时,模型会耐心等待;一旦用户说完,则迅速响应。这一机制使抢答率较半双工方案下降 40%,在以端点检测准确率为核心的人类相似度测试中,较半双工方案提升了 8%,对话节奏更加均衡自然。
在工程层面,Seeduplex 克服了高并发场景下的延迟抖动与稳定性难题,在保持模型智能上限和超低延迟的同时实现了大规模部署。目前,Seeduplex 已在豆包 App 全量上线,成为业内首个完成大规模商业化落地的全双工语音交互方案,为数亿用户提供持续高质量的实时语音交互体验。多维度评测显示,Seeduplex 在对话流畅度和节奏感上均显著优于传统半双工方案及主流 App 的语音通话体验。
要点
- Seeduplex 是字节跳动首款原生全双工语音大模型,支持 AI 同步收听与发言,彻底改变半双工轮流问答模式
- 复杂场景下误响应率与误打断率较半双工方案降低一半,抢答率下降 40%,端点检测人类相似度提升 8%
- 模型能解析环境音并纳入推理上下文,在多人混音、背景噪声等复杂声学环境中精准识别用户真实意图
- Seeduplex 已在豆包 App 全量上线,成为业内首个大规模商业化落地的全双工语音交互方案
原始标题:Introducing Seed Full-Duplex Speech LLM: Attentive Listening, Robust Interference Suppression, Enabling More Natural Interaction
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。