这项由谷歌DeepMind研究团队主导完成的工作,以技术报告的形式于2026年8月4日正式发布,论文编号为arXiv:2608.00146v1,挂载于计算机科学·计算与语言(cs.CL)分类下。有兴趣深入了解原始细节的读者,可以通过该编号在arXiv平台检索完整报告。

**当你在手机屏幕前等待AI回复时,究竟发生了什么?**

每一次你向AI助手提问,模型就像一台老式打字机,逐个字母、逐个词汇地往屏幕上敲。它必须先敲出第一个字,才能决定第二个字;敲完第二个字,才能考虑第三个字。这种"串行"工作方式在技术上被称为自回归生成,是当前几乎所有主流大语言模型的核心机制。这种机制在学术上十分严谨,但它有一个无法回避的物理瓶颈:无论你的手机有多好、服务器有多贵,每次生成一个词都需要把整个模型从内存里"唤醒"一遍,然后算出这一个词,然后再唤醒一遍,算出下一个词,如此循环往复。

这就像让一位厨师每炒一粒米就要打开冰箱门取一次调料——冰箱开关的时间,远比炒那粒米的时间长。AI芯片大部分时间都在等待内存把数据传过来,而不是在真正"思考"。谷歌DeepMind的工程师们看着这台不停开冰箱的厨师,决定彻底改变烹饪方式。

DiffusionGemma就是他们的答案。这个模型不再一个词一个词地往外吐,而是一次性规划256个词的完整"草稿",然后像雕刻师打磨石块一样,反复修改这块草稿,直到它变成流畅、准确的回答。这种工作方式借鉴了另一个领域的成熟技术——扩散模型(diffusion model),这种技术此前主要用于生成图片,比如让AI从一团噪点中逐渐"显影"出一张人脸。现在,谷歌DeepMind把同样的思路搬到了文字生成上。

测试结果显示,在单张NVIDIA H100 GPU上,DiffusionGemma每秒可以生成约1500个词——是同等规模传统自回归模型的7倍有余,即便与配备了专业加速技术的竞争模型相比,仍有近5倍的领先优势。更关键的是,这一速度并非以牺牲智能为代价换来的:在涵盖数学推理、编程、常识问答、多模态理解等多个维度的综合评测中,DiffusionGemma的得分依然处于同类文字扩散模型的最前列,与部分顶级闭源商业模型形成了真实意义上的竞争关系。

**一、从"打字机"到"雕刻师":扩散模型如何处理文字**

要理解DiffusionGemma的工作原理,先要理解它所依赖的数学基础,而这个基础其实可以用一个非常直觉化的比喻来描述——从噪点中"显影"出答案。

传统语言模型在生成文字时,遵循一条严格的因果链:已知前面所有的词,预测下一个词。这条链从左到右,不可逆转。如果第三个词说错了,后面的词只能将错就错,或者靠额外的逻辑绕回来修补,就像那位先提交了错误答案、事后发现"等等,我算错了"的学生。

扩散模型则完全不同。它的训练过程是这样的:给模型看一句完整的好句子,然后随机地把其中一些词替换成乱码,让模型猜原来是什么词。替换的比例从0%到100%不等,模型要学会在不同程度的"损坏"下,重建原始信息。用雕刻的比喻来说,扩散模型在训练时看的不是"从零开始雕刻",而是"一块已经七八成成形、但某些地方被人随机凿掉的雕塑,请你把缺口补全"。

在推理(即实际使用)时,模型从一块完全随机的"石头"——256个毫无意义的随机词——出发,一轮又一轮地修改这块石头:哪些词已经很确定了,就把它们"锁定"下来;哪些词还不确定,就让它们继续接受修改。经过平均12轮左右的打磨,这256个词就变成了一段连贯、有意义的文字。

这里有一个非常关键的技术细节:在每一轮修改中,模型对256个词的判断是同时进行的,而不是一个接一个。这就是为什么它可以这么快——相当于打字机换成了喷墨打印机,一次性把整行字喷出来,再校对,再喷一遍。

谷歌DeepMind团队在这个框架下选择了"多项式扩散"而非"掩码扩散"。两者的区别在于:掩码扩散会把不确定的词位置变成一个特殊的"占位符",而多项式扩散则是把那个位置换成词汇表里的任意一个词。后者的好处在于,即便是已经被"锁定"的词,在后续轮次里依然可以被修改——这让模型拥有了真正意义上的自我纠错能力,而不只是从空白处慢慢填满。

**二、站在巨人肩膀上:为什么不从零开始训练?**

创造一个强大的AI模型,通常需要用海量文本数据预训练——这个过程代价极其高昂,往往需要消耗数百万乃至数千万美元的算力。谷歌DeepMind的工程师们选择了一条更聪明的路:从一个已经训练好的优秀模型出发,再做针对性改造。

他们的起点是Gemma 4,一个混合专家架构(Mixture-of-Experts,简称MoE)的语言模型。这个模型总参数量为252亿,但每次实际工作时只激活约38.5亿个参数。混合专家架构可以理解为:模型内部有128组不同的"专家团队",每次处理一个词时,只有最适合的8组专家会被调用,其余的继续休息。这让模型在保持高能力的同时,控制了实际计算量。

从这样一个已经具备强大语言理解和生成能力的模型出发,改造成扩散模型只需要解决一个核心问题:原来的模型用的是"因果注意力",也就是每个词只能看到它前面的词;而扩散模型需要"双向注意力",即一个词可以同时参考它左边和右边的词。这就像把一个只能向前看路的司机,改造成可以同时看前方和后视镜的司机。

这种改造意味着不能把预训练完全抛掉,但也不能完全不动。谷歌DeepMind的解决方案是:保留所有原始权重,通过后续的微调让模型同时掌握两种注意力模式。编码上下文(用户输入的问题)时用因果注意力;生成回答(256个词的"画布")时用双向注意力。整个训练过程消耗的数据量不到原始预训练的10%,大幅节省了计算资源。

除此之外,DiffusionGemma还继承了Gemma 4的一个特殊组件:自我条件化(self-conditioning)。这个机制让模型在每一轮修改时,除了参考当前的"噪点草稿",还能参考上一轮自己的预测结果。这就像雕刻师除了看眼前的石头,还能参考上一刀下去之前自己的设计草图,从而做出更连贯的决策。为此,模型额外增加了780万个参数,专门用于处理这个自我条件化信号。

**三、两阶段训练:先学会雕刻,再学会快速雕刻**

改造完架构之后,谷歌DeepMind设计了一套两阶段训练流程,每个阶段针对不同的目标。

第一阶段叫做"监督微调"(SFT)。这一阶段的目标很简单:让模型学会扩散的基本功——接收一块部分损坏的"石头",把它修复成有意义的文字。训练数据从各类文字语料中抽取,对每一段文字随机做不同程度的词汇替换,然后让模型预测原始词汇。模型输出的预测与真实答案之间的差距,被用来调整模型的权重。

从实验曲线来看,非思考模式的性能提升非常迅速,只需完成整个SFT阶段前四分之一的训练量,就能达到相当不错的水平;而思考模式的学习曲线则要慢得多,起步时模型会频繁陷入循环、重复生成同样的词,就像一个新手演讲者上台第一次,说着说着就卡壳了,然后不停重复最后一个词。只有坚持完成完整的SFT训练,模型才能稳定地生成连贯的推理链。此后随着训练时间的拉长,两种模式的性能均呈现出近似对数线性的稳步提升——投入越多训练,效果越好,但增速逐渐放缓。

第二阶段叫做"采样器蒸馏与强化学习"(SD·RL),这才是真正让DiffusionGemma脱颖而出的关键步骤。仅完成SFT的模型,在用大量修改轮次(比如192轮)的情况下效果尚可,但如果把轮次压缩到实用的48轮以内,生成质量会急剧下降,甚至出现严重的重复循环。更糟糕的是,一旦模型陷入重复循环,它的预测熵(衡量不确定性的指标)会急剧下降,触发"自适应停止"机制提前结束生成,导致模型给出一个空白的答案。这就是在质量和速度之间无法兼顾的困境。

SD·RL阶段的设计目标,正是同时解决这两个问题。这个阶段让模型用较高的修改轮次生成"高质量草稿",作为"在线教师";同时,引入强化学习,用外部奖励信号(比如数学题答对得分、代码通过测试得分)来引导模型生成更正确的内容。最关键的是,这两个目标被整合进同一个训练目标,一次梯度更新同时优化两个方向。

训练过程中出现了一个非常有趣的自动加速效应:随着强化学习的推进,模型的预测越来越有把握,每个词位置的预测熵越来越低;熵越低,"自适应停止"机制就越早触发;停止越早,意味着需要的修改轮次越少;需要的轮次越少,训练数据中就会出现越来越多的"短轨迹"样本;短轨迹样本反过来进一步训练模型快速完成任务。这形成了一个正向飞轮——模型越聪明,就越省力;越省力,就能接受更多训练反馈,就变得更聪明。谷歌DeepMind的工程师们发现,即使在平均奖励分数不再提升之后,继续进行SD·RL训练仍然有价值,因为它还在持续压缩每次生成所需的修改轮次。

SD·RL完成后,模型在GPQA-Diamond(研究生级科学题)和LiveCodeBench-v6(编程题)两项测试上的综合得分比SFT完成时提升了10个百分点;每次前向传播产出的词数(TPF指标)从5个提升到近20个,速度翻了四倍。

此外,SD·RL还带来了一个意外的副作用:模型变得更加简洁。与SFT模型相比,最终版本的输出长度缩短了约一半。这与传统强化学习训练的语言模型相反——传统方法往往鼓励模型写更长的推理链条,因为更长的思考链通常意味着更高的得分。谷歌DeepMind认为,这种简洁性来源于扩散模型的特殊机制:减少总词数,直接等于减少修改轮次的工作量,而减少工作量是熵降低的自然结果。简洁即速度。

**四、智能采样器:如何决定"这个词,锁定"**

256个词同时推进修改,并不意味着每次修改都对所有词进行同等力度的处理。DiffusionGemma使用了一套精心设计的采样器,决定每一轮修改中哪些词可以"毕业"、哪些词还要继续接受修改。

这套采样器的核心思路是按熵排序。熵在这里衡量的是模型对某个词位置的不确定程度——如果模型对位置7的词极其有把握,这个位置的熵就很低;如果模型对位置23的词拿不定主意,这个位置的熵就很高。采样器会把所有词按熵从低到高排序,然后从最有把握的词开始,逐个"锁定",直到这一批词的累计熵超过预设阈值(0.1)为止。超出阈值的那些词,会被重新随机化,在下一轮重新接受修改。

这种机制类似于考试时的答题策略:先把最确定的题答上,把不确定的题留到后面反复斟酌,而不是花一样多时间在每道题上。被重新随机化的词位置,相当于被重置为"最大不确定性",强迫模型在下一轮从更开阔的角度重新考量这些位置,避免陷入局部最优解。

与此同时,采样器还引入了温度退火机制。温度是一个控制生成多样性的参数——温度高,模型就更"大胆",会给低概率词更多机会;温度低,模型就更"保守",倾向于选最确定的词。在扩散的早期阶段(石头还很粗糙),温度设为0.8,鼓励模型探索更多可能性;随着修改轮次推进,温度线性降低到0.4,让模型逐渐收敛到最确定的答案。

最后,采样器还设有"自适应停止"机制。当连续两轮修改中,模型对所有词位置的预测都几乎没有变化(平均熵低于0.005,且最可能的词序列完全相同),就认为这块"石头"已经雕刻完成,不必再等待凑够48轮的上限。这一机制让实际平均修改轮次降至12轮左右,等于最大预算的四分之一。

不同任务类型在这个维度上表现出了明显差异。简单的数学算术题(比如GSM8K)平均只需要8到9轮就能停止;中等难度的编程题(HumanEval)需要9到10轮;涉及深度推理的研究级科学题(GPQA-Diamond)需要14到15轮;而复杂的竞赛级编程题(Codeforces)则需要17到18轮。模型自动根据任务难度分配计算量,难题多用几轮,简单题少用几轮,从不"偷懒",也不"浪费"。

**五、硬件层面的速度解析:每次修改为何只慢3.2倍?**

DiffusionGemma每次修改要同时处理256个词,而传统语言模型每次只处理1个词。按直觉,前者应该慢256倍才对。但实际测量显示,每次修改只慢了3.2倍。这个数字背后,藏着精细的工程优化逻辑。

慢下来的主要原因集中在三个环节。第一是混合专家层(MoE)。传统语言模型每次只激活8个专家;而DiffusionGemma处理256个词时,平均会激活约84个不同的专家,导致这一层的运算时间增加了4.3倍。这并非设计失误,而是混合专家架构在高并行度场景下的固有特性——处理的词越多,需要"请教"的专家就越多,加载这些专家权重的时间也就越长。如果换成密集架构(非混合专家),这部分额外开销会减少到不足2倍。

第二是采样计算本身。扩散采样需要做256个词的完整概率分布计算、自我条件化向量的矩阵乘法,以及在262000个词的词汇表上做softmax操作。这些步骤加起来耗时3.06毫秒,而传统语言模型只需0.56毫秒,差距约5.5倍。

第三是注意力机制。传统语言模型因为一次只处理一个词,可以用高度优化的单词注意力核心;DiffusionGemma需要在256个词上做完整的双向注意力,只能使用普通的FlashAttention-4核心,速度慢了约4倍。

但另一方面,DiffusionGemma每次修改处理256个词,同样大幅节省了某些环节的时间。其中最显著的是KV缓存(Key-Value Cache)的传输——这是AI推理中一个重要的内存带宽消耗来源,传统模型每生成一个词都要从内存里读一遍所有历史上下文,而DiffusionGemma每生成256个词才需要读一遍,节省了大量内存带宽开销。

综合计算,每次修改比传统语言模型慢3.2倍,但每次修改生成约20个词,净效率提升约6倍。加上GPU内核的精细调优和CPU-GPU通信的异步化处理,最终在单张H100上实现了1456词/秒的实测吞吐量。

在多用户并发场景下,DiffusionGemma在低并发(1到16个并发用户)时对每位用户的生成速度以及总体吞吐量,均优于配备了多词预测加速技术的Gemma 4。只有在并发用户数超过约32个时,传统语言模型才开始在总吞吐量上追赶上来——这是因为高并发时批次越大,传统模型的计算效率越高,而DiffusionGemma在高批次场景的优化工作尚未完成。

**六、双向注意力的实际价值:能"反悔"的语言模型**

除了速度,扩散机制还带来了一个传统语言模型天然缺失的能力:在生成一段文字时,可以根据后面的内容修改前面的词。

传统语言模型必须在说出答案的第一个词时,就已经"押注"了答案的大致方向。以一道数学题为例:题目要求先给出答案,再写推导过程。传统语言模型必须先输出一个答案词,然后才开始推导。如果这个答案词猜错了,后面的推导过程就会努力自圆其说,或者在末尾尴尬地补一句"等等,我重新算一下"。

在报告提供的例子中,面对题目"7×(√(111+10)-3)-9?,先给答案再推导",Gemma 4的传统版本第一个词就输出了"-1"(错误答案),整个推导过程在正确计算到-25之后,不得不在末尾写道:"等等,重新计算:56-81=-25。正确答案是-25。"整个回答内部自相矛盾。

DiffusionGemma面对同样的问题,则在第一轮修改时对"-1"赋予了较高概率,但在随后几轮中,随着推导过程的词汇逐渐确定,位置靠前的答案词也被同步修正为"-25"。最终输出从第一个词开始就是正确答案,推导过程与答案完全吻合,没有任何自相矛盾。

同样的自我修正能力也体现在逻辑陷阱题目上。面对一个关于青蛙过河的谜题(青蛙每次跳5英尺,但第20英尺处的荷叶会把它传送回5英尺处,问是否能到达25英尺),传统语言模型第一个词就输出了"是",然后在推导中意识到会陷入无限循环,最终给出了前后矛盾的回答。DiffusionGemma则在早期修改轮次中赋予"是"较高概率,但随着推导逻辑("无限循环")在后续词汇中逐渐成形,最终修正为"不",干净利落地给出了正确答案。

这种能力在结构化输出任务(比如生成符合特定格式的JSON数据)上尤为突出。当输出格式被明确规定时,大部分词的内容几乎是确定的,模型在第一轮修改时就能以83%以上的平均置信度完成大部分词的填写,第二轮就能以100%的置信度全部锁定——整个任务只需两轮修改,相当于在一秒内完成了传统语言模型需要数十次串行预测才能完成的工作量。

**七、不仅仅快:评测成绩究竟如何?**

速度只是故事的一半。真正有价值的问题是:快了之后,还够聪明吗?

谷歌DeepMind在一套覆盖二十个标准评测集的测试体系上对DiffusionGemma进行了全面评估,涵盖数学推理(AIME 2026竞赛数学题、GSM8K小学数学题、MGSM多语言数学题、Putnam大学数学竞赛题)、代码生成(LiveCodeBench-v6实时编程题、HumanEval基础编程题、BigCodeBench复杂编程题)、科学知识(GPQA-Diamond研究生级科学题)、多语言理解(MMMLU、MMLU-Pro)、多模态推理(MMMU-Pro,涉及图片+文字的综合理解)以及指令遵循和智能体任务(IFEval格式遵循题、Tau-bench模拟真实场景的工具使用题)。

在开启思考模式(即允许模型先做内部推理再输出答案)的前提下,DiffusionGemma在AIME 2026数学竞赛题上得分69.1分,GPQA-Diamond科学题上73.2分,LiveCodeBench-v6编程题上69.1分,GSM8K基础数学题上96.3分,HumanEval基础编程题上94.5分,IFEval格式遵循题上97.4分。

与其起点——Gemma 4 26B A4B的传统自回归版本——相比,DiffusionGemma在大多数项目上有一定的性能损耗。例如,Gemma 4传统版本在AIME 2026上得分84.2,在GPQA-Diamond上得分79.8,在LiveCodeBench-v6上得分71.4。DiffusionGemma付出了约5到15个百分点的性能代价,换取了速度上的巨大提升。

与同类开源文字扩散模型相比,DiffusionGemma的优势则非常明显。LLaDA 2.1 Flash 100B——一个参数量是DiffusionGemma四倍的开源扩散模型——在AIME 2026上得分80分,在GPQA-Diamond上得分68.7分,在LiveCodeBench-v6上仅得39.4分,且需要8张NVIDIA B200 GPU同时工作,每秒只能生成375个词。Nemotron Diffusion 14B在GPQA-Diamond上得47分,每秒仅能生成49个词,差距相当悬殊。

与闭源商业扩散模型Mercury 2相比,DiffusionGemma的综合评测成绩相当,Mercury 2在推理知识类测试上的综合均分约为80分,DiffusionGemma约为75.3分;在编程类测试上,Mercury 2约82.4分,DiffusionGemma约76.9分。但在速度上,DiffusionGemma达到约1479词/秒,而Mercury 2通过公开API估测约为489至600词/秒,DiffusionGemma大约快了2.5倍。

一个值得特别关注的指标是DiffusionGemma的"保留自回归能力"。因为它的架构与Gemma 4完全相同,训练后的权重可以直接以传统自回归模式加载使用,不需要做任何额外改动。以自回归模式运行时,DiffusionGemma的性能介于其扩散模式和原始Gemma 4之间——比如AIME 2026得84.2(Gemma 4)、自回归模式的DiffusionGemma得84.2,和扩散模式的69.1之间,它的自回归模式得分为84.2,几乎与原始Gemma 4相当。这意味着同一套权重文件可以根据任务需求动态切换:速度优先用扩散模式,质量优先用自回归模式。

**八、开放给所有人:开源、微调与下游应用**

谷歌DeepMind选择以Apache 2.0许可证开放DiffusionGemma的全部权重,这意味着任何人都可以下载、修改、商用,没有任何限制。与此同时,团队还发布了一套完整的微调工具包,允许开发者在自己的数据集上进一步训练模型。

微调工具包基于一个叫做"Hackable Diffusion"的开源研究工具箱,支持LoRA(低秩自适应)技术——这项技术的原理是,不修改模型的主体权重,只在主体旁边附加一组小型的"补丁"权重,通过调整这些补丁来让模型适应新任务。用装修的比喻来说,LoRA就是"不拆墙,只贴壁纸",以极低的成本(2块A100 80GB显卡即可完成)实现任务适配。

作为演示,研究团队选择了数独谜题求解作为测试案例。数独是一类典型的非自回归任务——谜题的81个格子之间存在复杂的相互约束关系,任何一格的值都可能影响其他格子,传统的逐词生成方式在这类任务上有天然的局限。经过LoRA微调(rank=8,仅800万可训练参数),DiffusionGemma在4096道测试题上达到了84.4%的准确率,同时平均修改轮次从基础模型的40.65轮压缩至10.72轮——因为特定任务的熵天然更低,模型更快收敛。未经微调的基础模型在这道题上准确率为0。

在医学问答领域(PubMedQA),微调同样带来了明显提升:答案准确率从75.6%提升到76.6%,但更关键的是,生成的解释性文段质量(用BLEU分数衡量)从10.76分提升到20.67分,提升幅度接近一倍。

报告发布后短短数周内,已有外部团队将DiffusionGemma部署到具体应用场景中:一家公司用它构建了多语言自动语音识别系统,另一家医疗科技公司用它开发了放射科报告交互式辅助草拟系统。前者利用了扩散模型并行处理的高效性,后者则发挥了模型对高度结构化文本快速收敛的特性。

**九、已知的局限与未来的方向**

谷歌DeepMind在报告中坦率地列出了当前版本的已知问题,这种透明度对理解模型的实际能力边界非常重要。

性能与起点的差距是最显著的局限。DiffusionGemma的整体能力确实低于Gemma 4的自回归版本,这源于多重因素的叠加:跳过了从零开始的扩散预训练;SFT阶段受计算预算限制而偏短;SD·RL阶段为追求超低延迟而主动牺牲了部分峰值性能潜力;以及模型架构和数据配比本是为自回归优化的,不一定最适合扩散范式。

"过于简洁"是SD·RL带来的另一个副作用。模型产出的文字比SFT版本短约一半,这让它在某些需要深度思考、长篇论述的任务上表现不如预期。强化学习目标与扩散机制的特性共同驱动了这种简洁性,但目前尚未找到在不影响速度的前提下恢复更长输出的方法。

偶尔的词汇循环问题在SD·RL之后虽然大幅减少,但仍未完全消除。极少数情况下,模型会陷入重复生成同一个常见词(如"the the the")的循环,这主要发生在修改轮次被压缩到极限的情境下。

多模态任务中,思考模式有时会丢失闭合标签(即思考过程的结束符号),导致回答被错误截断。在MMMU-Pro(图文综合理解题)上,这一问题导致开启思考模式的得分(54.3分)反而低于关闭思考模式的得分(66.0分)。谷歌DeepMind承认这是在最终发布前发现但来不及修复的问题。

高并发吞吐量在32个以上并发用户时逊于传统语言模型(配备多词预测),这是由于DiffusionGemma的高并发批次优化工作尚未完成,例如在高批次下使用top-k截断可以显著提升吞吐,但这项优化目前尚未实装。

参考实现已同时发布在HuggingFace Transformers和vLLM两个主流推理框架中,前者以学术可扩展性为优先,后者针对高性能部署优化,方便不同需求的用户选用。

归根结底,DiffusionGemma做的事情可以用一句话概括:它证明了一个已有强大能力的语言模型,不需要从零开始重新训练,只需一套精心设计的改造方案,就可以从"打字机"变成"雕刻师",在保持相当智能水平的同时,把生成速度提升一个数量级。

这种改造的代价确实存在——比起起点模型有一定的性能损耗——但得到的回报同样真实:单张消费级服务器GPU上的每秒1500词,意味着原本需要一秒才能完成的回答,现在只需七分之一秒;原本需要一组GPU集群才能服务的并发用户量,现在一张卡就能应付。这对于实时语音交互、在线客服、即时代码补全等对延迟极度敏感的应用场景,意味着用户体验的质变而非量变。

更长远地看,DiffusionGemma暗示了一个可能的未来:同一套模型权重,在空闲时用扩散模式高速生成草稿,在关键任务时切换回自回归模式精细推理,两种范式协同工作。这条路还很长,但门已经打开。有兴趣深入研究的读者,可以通过arXiv:2608.00146v1获取完整的技术报告,模型权重及微调代码均已在Hugging Face平台公开发布,搜索"diffusiongemma-26B-A4B-it"即可找到。

Q&A

Q1:DiffusionGemma是怎么做到比传统语言模型快那么多的?

A:DiffusionGemma一次性处理256个词的"草稿",通过反复修改来完善内容,而不是像传统语言模型那样逐个词输出。平均下来每次修改只需要约12轮,每轮虽然比传统模型单步慢3.2倍,但同时产出约20个词,综合速度提升约7倍。

Q2:DiffusionGemma的能力比Gemma 4原版弱多少?

A:在大多数测试项目上,DiffusionGemma的得分比原版Gemma 4低大约5到15个百分点。例如AIME数学竞赛题,原版得88.3分,DiffusionGemma得69.1分。不过DiffusionGemma保留了原版的自回归运行能力,切换到自回归模式后性能接近原版水平。

Q3:普通人如何使用DiffusionGemma或基于它开发应用?

A:DiffusionGemma以Apache 2.0开源许可发布,任何人可以免费下载和商用。模型权重已上传至Hugging Face平台(搜索"diffusiongemma-26B-A4B-it"),谷歌DeepMind同步发布了HuggingFace Transformers和vLLM两套参考实现,以及支持在消费级GPU上微调的LoRA工具包。