产业 / 媒体
无需从头训练,也能构建文本扩散模型
Google DeepMind 近日发布了 DiffusionGemma 的技术报告,详细说明了这一文本扩散模型的工作原理与性能权衡。与逐词元生成文本的标准语言模型不同,DiffusionGemma 采用类似图像 AI 从噪声中还原图像的方式,并行处理256个词元的文本块。该模型并非从零训练,而是在现有 Gemma-4-26B-A4B 基础上改造而来,所用训练词元预算不足原始模型的10%。在 Nvidia H100 加速器上,DiffusionGemma 的生成速度可达每秒约1500个词元,显著超越原有自回归模型。训练分为两个阶段:首先学习从噪声文本中重建内容,随后通过强化学习与采样器蒸馏的联合训练(SD·RL)提升质量与速度。尽管在推理基准测试中仍落后于原始自回归模型,但该模型在结构化输出和数独求解等任务上表现出独特优势。Google 将其定位为实验性模型,旨在推动文本扩散领域的研究进展。
Google DeepMind 于6月中旬发布 DiffusionGemma 模型后,近期又跟进发布了完整技术报告。这一模型的核心创新在于:无需从零开始训练,而是将已有的 Gemma-4-26B-A4B 改造为扩散模型,所消耗的训练词元预算不足原始模型的10%。与传统自回归语言模型逐词元生成文本的方式不同,DiffusionGemma 以类似图像生成 AI 的方式,并行处理256个词元的文本块,在 Nvidia H100 加速器上可达每秒约1500个词元的生成速度。
DiffusionGemma 的训练分为两个阶段。第一阶段,模型从示例数据中学习如何从噪声文本块中重建内容;第二阶段,Google 将强化学习与采样器蒸馏合并为一个名为 SD·RL 的联合训练过程。强化学习通常能提升答案质量,而采样器蒸馏则让模型以更少的计算步骤完成推理。根据技术报告,这一联合方法使推理基准测试的平均得分提升约10分,同时将每计算步骤处理的词元数量提升近四倍,且输出长度缩短约50%,进一步加快了生成速度。
扩散模型的并行处理机制赋予了 DiffusionGemma 一项独特能力:双向推理与自我纠错。标准语言模型在完成推理之前就必须确定答案的第一个词元,容易出现先给出错误答案、再追加修正的情况。DiffusionGemma 则在并行去噪过程中同步发展答案与推理,可在输出最终确定前修正早期错误。这一特性在数独求解任务中尤为突出——经过少量微调后,DiffusionGemma 能正确解决近85%的数独题,而基础自回归模型则完全无法完成该任务。
在结构化输出场景中,DiffusionGemma 同样展现出效率优势。JSON 生成或代码修复等任务通常只需两到三个精炼步骤即可完成,因为输入内容已经决定了大多数词元的内容。此外,该模型保留了逐词生成文本的原始能力,用户可根据任务需求在两种模式之间灵活切换,兼顾速度与兼容性。
尽管速度表现亮眼,DiffusionGemma 在质量基准测试上仍落后于原始自回归模型。Google 将此归因于多个因素:模型并非从一开始就作为扩散模型训练,后续训练阶段相对较短,且 SD·RL 阶段优先考虑速度而非峰值质量。此外,模型偶尔会陷入重复循环,在多模态任务中有时会忘记正确关闭推理段落,人为拉低了基准测试得分。速度优势也主要体现在单用户场景下,当并发请求达到约32个时,标准语言模型的吞吐量便可追平。
Google 明确将 DiffusionGemma 定位为实验性模型,此次发布旨在加速文本扩散领域的研究,并为社区提供专业化、资源高效适配的基础。该模型已以 Apache 2.0 许可证在 Hugging Face 上开放,目前已被初创公司 Interfaze 用于多语言语音识别,以及一项交互式放射学报告生成的研究项目。其前身为 Google 于2025年5月演示的 Gemini Diffusion。
要点
- DiffusionGemma 无需从零训练,仅用不足原始预算10%的训练量,将 Gemma 4 改造为扩散模型,在 H100 上实现每秒约1500词元的生成速度
- SD·RL 联合训练阶段将推理基准得分平均提升约10分,并将每计算步骤处理词元数提升近四倍,同时使输出长度缩短约50%
- 双向并行推理机制使模型能在输出最终确定前自我纠错,在数独求解等需要全局一致性的任务上表现尤为突出
- 速度优势主要体现在单用户场景,并发请求达约32个时标准语言模型吞吐量可追平;整体质量仍落后于原始自回归模型
- Google 以 Apache 2.0 许可证开放该模型,定位为推动文本扩散研究的实验性基础模型,已有企业将其应用于语音识别和医疗报告生成
原始标题:Google's DiffusionGemma proves you don't need to train from scratch to build a text diffusion model
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。