研究 / 官方
苹果发布内存高效音频合成架构,支撑 Siri 实时语音生成
苹果机器学习研究团队发布论文,介绍了支撑 Siri Expressive Voices 功能的内存高效音频合成架构。该架构的核心是一个「去标记器」,负责将基础模型输出的语义音频 token 转换为高保真音频,整个过程在苹果矩阵协处理器(AMX)的严格算力与内存预算内完成。设计采用三组件结构——流式编码器、时序解码器与深度解码器——系统性地解耦时序与深度处理流程。单个可复用深度解码器结合扩散 Transformer 风格的阶段条件机制,自回归生成所有 RVQ 层级,取代了传统多解码器架构中每层独立解码器的设计。该系统每步生成耗时约 10 毫秒,约为实时速度的 16 倍,峰值运行内存仅约 21MB,可持续流式合成 20 至 320 秒的音频,整体平均意见分(MOS)较前代提升 0.28 分。
苹果在 2026 年 7 月发布的这篇研究论文,聚焦于 Siri Expressive Voices 背后的音频合成技术突破。该功能由苹果最强大的端侧基础模型 AFM 3 Core Advanced 驱动,能够在设备本地实时合成丰富、可配置的语音,无需依赖云端服务器。论文的核心贡献在于提出了一套专为端侧部署设计的内存高效架构,解决了传统方法在资源受限环境下难以落地的痛点。
该架构的关键创新在于将语义音频 token 转换为残差向量量化(RVQ)表示的三组件设计:流式编码器负责实时处理输入序列,时序解码器处理跨帧的时间维度信息,深度解码器则负责 RVQ 各层级的生成。三者协同工作,系统性地将时序处理与深度处理解耦,避免了传统架构中两者相互耦合带来的计算冗余与内存压力。
在内存效率方面,研究团队引入了因果滑动窗口注意力机制,配合固定窗口键值缓存,使内存复杂度与序列长度无关,保持恒定。这一设计彻底替代了传统 Transformer 架构的二次方内存增长模式,以及 GAN 类方法的线性内存扩展问题。部署在 AMX 上后,去标记器每步生成耗时约 10 毫秒,峰值运行内存仅约 21MB,设备端资产占用 329MB,可流式合成最长 320 秒的音频。
在模型质量评估方面,研究团队通过音素可辨别性分析、感知质量指标和神经质量估计等多维度方法对合成效果进行了验证。结果显示,与前代端侧文本转语音系统相比,整体 MOS 提升 0.28 分(4.15 对比 3.87),在对话语音场景下提升幅度更大,达到 0.42 分(4.24 对比 3.82)。消融实验进一步验证了 DiT 条件机制、时序前瞻处理和统一深度解码策略各自的有效性。
该架构目前已作为 Siri Expressive Voices 的一部分正式部署于生产环境,支持苹果设备上的语音全面升级,包括语速与表现力自定义滑块,以及自定义助手声音功能。整个系统在 AFM 3 Core Advanced 框架内以 10 亿参数激活规模运行,展示了苹果在端侧 AI 推理效率与语音合成质量之间取得平衡的最新进展,也为业界在资源受限设备上部署大规模语音模型提供了重要参考。
要点
- 苹果提出解耦时序与深度处理的三组件架构,单个可复用深度解码器替代传统多解码器设计,显著降低架构复杂度
- 因果滑动窗口注意力与固定窗口 KV 缓存使内存复杂度与序列长度无关,峰值运行内存仅约 21MB
- 系统在 AMX 上实现约 16 倍实时速度的语音合成,可持续流式生成最长 320 秒音频
- 整体 MOS 较前代提升 0.28 分,对话语音场景提升 0.42 分,已在 Siri Expressive Voices 中正式上线
- 该研究为在资源受限的端侧设备上部署高质量语音合成模型提供了可复用的架构范式
原始标题:Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。