“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
极简方案刷新扩散模型推理纪录,阿里清华论文入选ICML杰出论文
先说个背景,最近阿里和清华合作的一篇论文拿了ICML 2026的杰出论文奖。ICML的杰出论文是什么分量?每年就2-3篇,获奖率大概千分之一,可以说是当年最具影响力的工作之一了。论文标题是《The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models》,翻译过来就是“灵活性陷阱:重新审视扩散语言模型中任意顺序生成的价值”。
这论文讲的是扩散语言模型(dLLM)——就是Google的Gemini Diffusion、人大的LLaDA这些——它们最大的卖点是生成文本时可以不按从左到右的顺序,而是任意选位置生成token。听起来很自由对吧?但作者发现,在数学、编程这类推理任务上,这种自由反而是个坑。而且他们提出的解决方案极简到离谱:直接放弃任意顺序,强制模型从左到右生成,用普通的GRPO算法就行。结果效果吊打所有为dLLM专门设计的复杂强化学习算法。
下面我把这篇论文的核心内容掰开揉碎了讲清楚,保证你读完能跟人聊明白这件事。
1. dLLM是什么?为什么大家觉得它牛逼?
先简单科普一下扩散语言模型。主流的大语言模型(LLM),比如GPT、Qwen、Llama这些,生成文本的方式是自回归——就像你打字一样,从左到右一个词一个词地蹦。每一步生成下一个token时,只能参考已经生成的前文。
而dLLM不一样。它受图像扩散模型(比如Stable Diffusion)启发,一开始先生成一段噪声或者随机token,然后逐步去噪,每一步可以任意选择去噪的位置。也就是说,它可以先确定句子后半部分,再回头补前半部分;或者先填实词,再补虚词。理论上,这种自由度让模型有更大的解空间,能更好地利用全局信息。
所以过去一两年,dLLM被很多人当作下一代语言模型架构的候选方向。毕竟,人写文章也不是严格从左到右的——我们经常会先想好结尾再写开头,或者先写主体再润色细节。让模型拥有这种“非顺序”能力,听起来很合理。
2. 灵活性陷阱:为什么任意顺序反而不好?
这篇论文的核心洞察是:在推理任务中,任意顺序生成非但不是优势,反而是陷阱。
作者把这个问题叫做“灵活性陷阱”。具体怎么回事呢?
2.1 关键逻辑节点是“分叉口”
想象一下你在解一道数学题。题目的推理链里有一些关键节点,比如“因此”“所以”“由此可得”。这些节点就像分叉口——模型必须在这里做出一个决定:下一步推导什么?用什么公式?代入哪个数值?
如果模型是从左到右生成的,那走到这个分叉口时,它必须当场做出选择,生成下一个token。没有退路,不能跳过。这就迫使模型去真正理解这个节点,做出正确的推理。
但如果模型可以任意顺序生成呢?它就会“偷懒”——先绕开这些难啃的骨头,去生成那些容易的部分,比如填充一些显而易见的描述、已知条件、简单计算。等回头再处理这些关键节点时,上下文已经基本确定了。原本需要“做选择”的分叉口,变成了“填空”——因为前后文已经把答案锁死了。
2.2 熵退化:选择权被悄悄消解
作者把这种现象叫做熵退化(Entropy Degradation)。用大白话说就是:模型看似有自由选择权,但实际上在训练过程中,它学会了利用这种自由去逃避困难,导致关键节点的决策空间被压缩,最终推理能力下降。
这不是拍脑袋想的,作者用实验数据证明了这一点。
2.3 数据说话:21.3% vs 0.6%
在HumanEval代码生成任务上,作者做了一个对比实验:
- 从左到右顺序能解出、但任意顺序解不出的题目占比:21.3%
- 反过来,任意顺序能解出、但从左到右解不出的题目占比:0.6%
这差距太悬殊了。而且作者还发现,顺序的自由度越大(比如允许更多种生成顺序),推理性能就越差。也就是说,自由度本身就在伤害推理能力。
这个发现其实挺反直觉的——我们通常认为“更多选择”总比“更少选择”好,但在推理任务上,约束反而成了优势。
3. 解决方案:JustGRPO——大道至简
既然发现了问题,那怎么解决?作者给的方案简单到让人怀疑是不是在开玩笑。
3.1 现有dLLM强化学习的痛点
在dLLM上做强化学习(RL)其实一直很头疼。因为生成顺序不固定,你没法准确归因每个token的贡献——不知道这个token是在哪个时间步、哪个上下文里生成的,也就没法对它进行有效的奖励分配。为了解决这个问题,各路团队搞出了各种复杂算法:d1、ESPO、SPG、GDPO……每一个都引入了额外的机制、额外的训练步骤、额外的超参数调优。
3.2 JustGRPO:为什么不直接用右手?
作者的思路非常朴素:既然任意顺序不好,那就别用任意顺序了。
他们在强化学习训练阶段,强制模型只能从左到右生成。然后直接用GRPO(Group Relative Policy Optimization)——一种主流的强化学习算法,让模型对同一道题生成多组答案,通过组内优劣对比来优化策略。就这么简单。
作者自己调侃说:这就像所有人都在给左手练力量,然后有个人说:“为什么不直接用右手?”
3.3 训练后效果
训练完成后,模型的推理速度不受影响(因为推理时还是从左到右生成,跟普通LLM一样),但推理效果大幅提升。
在GSM8K上——这是业界衡量大模型推理能力的标准测试集,包含大约8500道多步推理小学数学应用题——JustGRPO达到了89.1%的准确率。
这个数字意味着什么?它全面超越了d1、ESPO、SPG、GDPO等所有为扩散模型专门设计的复杂强化学习算法。注意,是所有。而且是用最简单的方法做到的。
4. 我的理解:这件事为什么重要?
我觉得这篇论文的意义不在于“dLLM不行”,而在于提醒我们:不要被“自由度”迷惑。
在AI领域,我们经常有一种直觉:更灵活的架构、更大的解空间、更少的约束,应该能带来更强的能力。但这篇论文用扎实的实验证明,在推理这类需要精确决策的任务上,约束本身就是一种信息。从左到右的顺序,本质上是在告诉模型“你必须在这个时间点做出决定”,这种强制性的压力反而训练出了更强的推理能力。
另外,JustGRPO这种“用右手”的思路也值得深思。很多时候,我们为了解决一个复杂问题,会引入更复杂的系统,结果系统越来越臃肿,越来越难调。但有时候,最简单的解决方案就是放弃那个带来复杂性的前提。既然任意顺序是问题根源,那就砍掉它,而不是在它上面打补丁。
5. 论文地址
如果你对细节感兴趣,可以直接下载论文原文:
https://arxiv.org/abs/2601.15165
总结一句话: 这篇ICML杰出论文告诉我们,扩散语言模型的“任意顺序生成”在推理任务上是个陷阱,而解决它的方法就是——别用任意顺序了,老老实实从左到右,用普通GRPO就够了。大道至简,有时候最简单的方案反而是最好的。