欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

极简方案刷新扩散模型推理纪录,阿里清华论文入选ICML杰出论文

2026/7/6人工智能

先说个背景,最近阿里和清华合作的一篇论文拿了ICML 2026的杰出论文奖。ICML的杰出论文是什么分量?每年就2-3篇,获奖率大概千分之一,可以说是当年最具影响力的工作之一了。论文标题是《The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models》,翻译过来就是“灵活性陷阱:重新审视扩散语言模型中任意顺序生成的价值”。

这论文讲的是扩散语言模型(dLLM)——就是Google的Gemini Diffusion、人大的LLaDA这些——它们最大的卖点是生成文本时可以不按从左到右的顺序,而是任意选位置生成token。听起来很自由对吧?但作者发现,在数学、编程这类推理任务上,这种自由反而是个坑。而且他们提出的解决方案极简到离谱:直接放弃任意顺序,强制模型从左到右生成,用普通的GRPO算法就行。结果效果吊打所有为dLLM专门设计的复杂强化学习算法。

下面我把这篇论文的核心内容掰开揉碎了讲清楚,保证你读完能跟人聊明白这件事。


1. dLLM是什么?为什么大家觉得它牛逼?

先简单科普一下扩散语言模型。主流的大语言模型(LLM),比如GPT、Qwen、Llama这些,生成文本的方式是自回归——就像你打字一样,从左到右一个词一个词地蹦。每一步生成下一个token时,只能参考已经生成的前文。

而dLLM不一样。它受图像扩散模型(比如Stable Diffusion)启发,一开始先生成一段噪声或者随机token,然后逐步去噪,每一步可以任意选择去噪的位置。也就是说,它可以先确定句子后半部分,再回头补前半部分;或者先填实词,再补虚词。理论上,这种自由度让模型有更大的解空间,能更好地利用全局信息。

所以过去一两年,dLLM被很多人当作下一代语言模型架构的候选方向。毕竟,人写文章也不是严格从左到右的——我们经常会先想好结尾再写开头,或者先写主体再润色细节。让模型拥有这种“非顺序”能力,听起来很合理。


2. 灵活性陷阱:为什么任意顺序反而不好?

这篇论文的核心洞察是:在推理任务中,任意顺序生成非但不是优势,反而是陷阱。

作者把这个问题叫做“灵活性陷阱”。具体怎么回事呢?

2.1 关键逻辑节点是“分叉口”

想象一下你在解一道数学题。题目的推理链里有一些关键节点,比如“因此”“所以”“由此可得”。这些节点就像分叉口——模型必须在这里做出一个决定:下一步推导什么?用什么公式?代入哪个数值?

如果模型是从左到右生成的,那走到这个分叉口时,它必须当场做出选择,生成下一个token。没有退路,不能跳过。这就迫使模型去真正理解这个节点,做出正确的推理。

但如果模型可以任意顺序生成呢?它就会“偷懒”——先绕开这些难啃的骨头,去生成那些容易的部分,比如填充一些显而易见的描述、已知条件、简单计算。等回头再处理这些关键节点时,上下文已经基本确定了。原本需要“做选择”的分叉口,变成了“填空”——因为前后文已经把答案锁死了。

2.2 熵退化:选择权被悄悄消解

作者把这种现象叫做熵退化(Entropy Degradation)。用大白话说就是:模型看似有自由选择权,但实际上在训练过程中,它学会了利用这种自由去逃避困难,导致关键节点的决策空间被压缩,最终推理能力下降。

这不是拍脑袋想的,作者用实验数据证明了这一点。

2.3 数据说话:21.3% vs 0.6%

在HumanEval代码生成任务上,作者做了一个对比实验:

  • 从左到右顺序能解出、但任意顺序解不出的题目占比:21.3%
  • 反过来,任意顺序能解出、但从左到右解不出的题目占比:0.6%

这差距太悬殊了。而且作者还发现,顺序的自由度越大(比如允许更多种生成顺序),推理性能就越差。也就是说,自由度本身就在伤害推理能力。

这个发现其实挺反直觉的——我们通常认为“更多选择”总比“更少选择”好,但在推理任务上,约束反而成了优势。


3. 解决方案:JustGRPO——大道至简

既然发现了问题,那怎么解决?作者给的方案简单到让人怀疑是不是在开玩笑。

3.1 现有dLLM强化学习的痛点

在dLLM上做强化学习(RL)其实一直很头疼。因为生成顺序不固定,你没法准确归因每个token的贡献——不知道这个token是在哪个时间步、哪个上下文里生成的,也就没法对它进行有效的奖励分配。为了解决这个问题,各路团队搞出了各种复杂算法:d1、ESPO、SPG、GDPO……每一个都引入了额外的机制、额外的训练步骤、额外的超参数调优。

3.2 JustGRPO:为什么不直接用右手?

作者的思路非常朴素:既然任意顺序不好,那就别用任意顺序了。

他们在强化学习训练阶段,强制模型只能从左到右生成。然后直接用GRPO(Group Relative Policy Optimization)——一种主流的强化学习算法,让模型对同一道题生成多组答案,通过组内优劣对比来优化策略。就这么简单。

作者自己调侃说:这就像所有人都在给左手练力量,然后有个人说:“为什么不直接用右手?”

3.3 训练后效果

训练完成后,模型的推理速度不受影响(因为推理时还是从左到右生成,跟普通LLM一样),但推理效果大幅提升。

在GSM8K上——这是业界衡量大模型推理能力的标准测试集,包含大约8500道多步推理小学数学应用题——JustGRPO达到了89.1%的准确率。

这个数字意味着什么?它全面超越了d1、ESPO、SPG、GDPO等所有为扩散模型专门设计的复杂强化学习算法。注意,是所有。而且是用最简单的方法做到的。


4. 我的理解:这件事为什么重要?

我觉得这篇论文的意义不在于“dLLM不行”,而在于提醒我们:不要被“自由度”迷惑。

在AI领域,我们经常有一种直觉:更灵活的架构、更大的解空间、更少的约束,应该能带来更强的能力。但这篇论文用扎实的实验证明,在推理这类需要精确决策的任务上,约束本身就是一种信息。从左到右的顺序,本质上是在告诉模型“你必须在这个时间点做出决定”,这种强制性的压力反而训练出了更强的推理能力。

另外,JustGRPO这种“用右手”的思路也值得深思。很多时候,我们为了解决一个复杂问题,会引入更复杂的系统,结果系统越来越臃肿,越来越难调。但有时候,最简单的解决方案就是放弃那个带来复杂性的前提。既然任意顺序是问题根源,那就砍掉它,而不是在它上面打补丁。


5. 论文地址

如果你对细节感兴趣,可以直接下载论文原文:
https://arxiv.org/abs/2601.15165


总结一句话: 这篇ICML杰出论文告诉我们,扩散语言模型的“任意顺序生成”在推理任务上是个陷阱,而解决它的方法就是——别用任意顺序了,老老实实从左到右,用普通GRPO就够了。大道至简,有时候最简单的方案反而是最好的。

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消