ARTICLE SIGNAL

Google DeepMind推出DiffusionGemma:打破常规,无需从零训练文本扩散模型

Google DeepMind发布的最新技术报告详细解析了DiffusionGemma。该研究证明,无需从头训练,通过少量算力改造现有的Gemma 4大语言模型,即可构建出高效的文本扩散模型。模型不仅支持双向自我纠错,在Nvidia H100上的生成速度更高达1500 tokens/秒。

type
status
date
slug
summary
tags
category
icon
password
网址
在人工智能生成内容领域,大语言模型(LLM)通常以逐字生成(自回归)的方式输出文本,而图像生成模型则多依赖于从噪声中提取画面的扩散(Diffusion)技术。一直以来,业界普遍认为构建一个高质量的文本扩散模型需要耗费巨量资源从零开始训练。然而,aigc.bar 观察到,Google DeepMind 近期发布的 DiffusionGemma 技术报告彻底打破了这一刻板印象:通过对现有语言模型进行改造,同样能实现卓越的文本扩散能力。

事实梳理:双阶段训练与模型重构

DiffusionGemma 的核心突破在于其极高的资源利用效率。Google DeepMind 并没有从头开始搭建新模型,而是选择了现有的 Gemma-4-26B-A4B 作为基础模型。据报告披露,整个改造过程所消耗的训练 token 预算甚至不到原始模型训练预算的 10%。
为了平衡生成质量与输出速度,研发团队设计了两个关键的训练阶段。第一阶段,模型需要学习如何从包含噪声的示例数据中重建出完整的文本块。第二阶段则是被称为 SD·RL 的联合优化过程,它将强化学习(Reinforcement Learning)与采样器蒸馏(Sampler Distillation)融为一体。强化学习负责提升模型回答的逻辑质量,而采样器蒸馏则显著减少了模型所需的计算步骤。这种融合方案使模型在推理基准测试中的平均得分提升了 10 分,并且在每个计算步骤中处理的 token 数量几乎翻了四倍。在硬件表现上,当配备 Nvidia H100 加速器时,DiffusionGemma 能够以并行方式一次性处理 256 个 token 的文本块,输出速度达到了惊人的 1,500 tokens/秒。

影响与用法:突破自回归限制的双向推理

传统的大语言模型在生成文本时具有不可逆性——一旦生成了句子的开头,即便在后续推导中发现逻辑错误,也无法修改前面的输出。DiffusionGemma 则展现出了独特的“双向推理”能力。因为它是并行生成答案和推理过程的,所以在最终输出定型之前,模型能够自行纠正早期步骤中的错误。
报告中提供了一个经典的数学解题案例:模型在推理初期得出了“-1”的结论,但在后续推导中意识到正确答案应该是“-25”。与传统模型只能在句尾补充更正不同,DiffusionGemma 在去噪阶段直接修复了这个早期错误。这种特性在解决数独等高度依赖全局逻辑的任务时表现得尤为突出。在经过少量微调后,DiffusionGemma 能够正确解决近 85% 的数独难题,而其基础的自回归模型在面对相同任务时则完全束手无策。
此外,对于生成 JSON 格式或进行代码修复等结构化输出任务,由于输入本身已经决定了大部分结构,DiffusionGemma 仅需两到三次细化步骤即可完成生成。值得一提的是,该模型依然保留了逐词生成文本的原始能力,用户可以根据具体任务场景在两种模式之间无缝切换。目前,已有初创公司 Interfaze 将其应用于多语言语音识别,并在交互式放射学报告生成的医学研究项目中发挥作用。

风险与限制:质量妥协与多用户并发瓶颈

尽管在速度和特定逻辑任务上表现亮眼,但 DiffusionGemma 目前仍存在一些不可忽视的局限性。首先,在绝对性能和整体质量基准测试上,它仍然落后于其自回归基础模型(Gemma 4)。Google 团队指出,这主要是由于模型是“半路出家”改造而来,架构和训练数据直接继承自原始语言模型,并不完全适配扩散机制,加之第二阶段训练更偏向于追求极致速度而非巅峰质量。
其次,由于计算步骤被大幅压缩,模型有时会陷入“重复循环”的伪影现象,导致连续多次输出同一个单词。在处理多模态任务时,它偶尔会忘记正确闭合推理过程的代码块,从而影响了基准测试的分数。最后,DiffusionGemma 的速度优势主要体现在单用户场景下;一旦并发请求数量达到 32 个左右,传统语言模型的高吞吐量优势就会重新赶超上来。

结论:文本扩散技术的实验性里程碑

总而言之,Google DeepMind 明确将 DiffusionGemma 定位为一个实验性质的模型。它的出现并非为了立即取代现有的主流大语言模型,而是为 AI 社区提供了一个极具潜力的研究基础,旨在加速文本扩散技术的探索,并为资源高效型的专用模型定制铺平道路。
目前,Google 已经通过 Hugging Face 平台,以 Apache 2.0 开源协议向社区开放了 DiffusionGemma。这一举措无疑将激励更多开发者在 aigc.bar 这样的平台上分享基于该架构的创新工具与应用,进一步推动自然语言处理技术的边界。
Loading...

没有找到文章