ARTICLE SIGNAL
颠覆传统训练:谷歌推出 DiffusionGemma,揭示文本扩散模型的低成本改造之路
谷歌 DeepMind 推出实验性模型 DiffusionGemma,证明无需从头训练,仅用不到10%的预算即可将 Gemma 4 逆向改造为高速文本扩散模型。本文深入解析其双阶段训练、双向推理机制及局限性。
type
status
date
slug
summary
tags
category
icon
password
网址
大语言模型(LLM)的生成速度与推理质量一直是行业竞逐的焦点。传统的自回归大模型普遍采用“逐字”生成的机制,这不仅在长文本输出时显得效率低下,也导致模型一旦在生成初期犯错,便难以在后续步骤中自我修正。近日,谷歌 DeepMind 团队推出了一项突破性的实验模型 DiffusionGemma,向业界证明:我们无需从头训练,就能将现有的自回归模型成功改造成高效的文本扩散模型(Text Diffusion Model)。
这一技术探索为低成本开发高效 AI 模型开辟了全新路径,以下是针对该技术的事实梳理、核心机制及行业影响的深度解析。
核心创新:仅用 10% 预算的“旧物改造”
以往业内普遍认为,要构建一个实用的文本扩散模型,必须从零开始进行庞大的数据集训练。然而,DeepMind 团队打破了这一常规。他们直接以已有的自回归模型 Gemma-4-26B-A4B 为底座,通过后续的微调与重构,将其转化为扩散模型。
根据谷歌发布的官方技术报告,整个改造过程所消耗的 Token 预算,不到原始模型训练总预算的 10%。在实际运行中,DiffusionGemma 不再像传统模型那样一次只输出一个 Token,而是类似于图像生成 AI(如 Stable Diffusion)从噪声中还原图像的逻辑,能够并行细化并输出包含 256 个 Token 的文本块。在 NVIDIA H100 加速器的支持下,该模型展现了极高的速度优势,数据输出速度可达每秒约 1,500 个 Token。
双阶段训练与双向推理机制
为了在速度与回答质量之间取得平衡,谷歌在 DiffusionGemma 的改造中采用了两阶段的训练方法:
- 噪声重构阶段:使模型学习如何从带有噪声的示例数据中重新还原出清晰的文本块。
- SD·RL 融合阶段:谷歌将强化学习(RL)与采样器蒸馏(Sampler Distillation)结合为单一流程。强化学习用于提升推理质量,而采样器蒸馏则让模型在更少的计算步骤下运行。这两者的结合使用,使得 DiffusionGemma 在逻辑推理基准测试中的得分平均提升了 10 分,并且让每个计算步骤生成的 Token 数量翻了近两番。
更具革命性的是,扩散模型天然带来的“双向推理(Bidirectional Reasoning)”能力。传统的自回归模型在推导数学题时,必须在得出最终结论前先定下前面的步骤,一旦中间出错,只能在后文尴尬地追加补丁。而 DiffusionGemma 允许模型在“去噪”的过程中,并行发展答案与推理逻辑,这意味着它可以在文本最终输出前自行修改早期的错误。例如,在数独(Sudoku)求解测试中,原版 Gemma 基础模型几乎完全无法应对,而 DiffusionGemma 在极少微调后便达到了接近 85% 的正确率。
应用场景与实际效能
在实际应用中,DiffusionGemma 在结构化数据输出(如 JSON 格式生成)和代码修复任务中表现尤为亮眼。因为输入本身已经锚定了大部分 Token 的走向,模型通常只需要 2 到 3 个细化步骤即可输出完美格式。
目前,该模型已采用 Apache 2.0 许可证在 Hugging Face 开源。初创公司 Interfaze 已率先将其用于多语言语音识别系统;此外,学术界也已开始利用其探索交互式放射学报告的自动生成。为了保证灵活性,DiffusionGemma 依然保留了逐字生成的自回归模式,用户可以根据具体任务在扩散模式与自回归模式之间灵活切换。
无法忽视的局限性与风险
虽然 DiffusionGemma 带来了令人瞩目的速度与推理纠错能力,但作为一款实验性模型,它仍存在明显的短板:
- 绝对性能不及基座:由于该模型并非原生扩散架构,且后续微调训练时间较短,其在通用质量基准测试上的绝对表现仍逊于原版的 Gemma 4 自回归模型。
- 容易陷入字符重复:由于团队为了极致速度压缩了计算步骤,模型在部分复杂任务下可能会陷入重复循环,连续输出相同的词汇。
- 并发性能受限:高速度优势主要体现在单用户或低并发场景。一旦并发请求超过 32 个,传统自回归模型凭借成熟的吞吐优化方案,在效率上会迅速追平甚至反超 DiffusionGemma。
结论
DiffusionGemma 的发布并非为了直接取代传统的自回归模型,而是为 AI 社区提供了一个极具启发性的实验底座。它证明了通过逆向改造旧模型来获取文本扩散能力的技术可行性。这不仅为研究人员提供了一个资源友好型的探索工具,也为未来低成本、高效率的定制化 AI 应用开发指明了新的方向。
Loading...