“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
本文深入解析 DeepSeek-R1:首次验证纯强化学习(无需监督微调)即可激发大模型推理能力,并展示了通过蒸馏将强大推理能力迁移至小模型的新路径,性能全面对标 OpenAI o1。
DeepSeek-R1 是深度求索(DeepSeek)发布的第一代推理模型。它的诞生在 AI 社区引起了巨大的轰动,不仅在 Hugging Face 上狂揽 92k Star,更因其开源策略和技术路线的创新性,成为 Hacker News 上的热门讨论话题。本文基于其技术报告和开源代码,梳理其核心技术、实验结果与创新意义。
一、从 DeepSeek-R1-Zero 到 DeepSeek-R1:一次纯 RL 的冒险与救赎
1. DeepSeek-R1-Zero:放弃 SFT 的“野性”推理
传统大语言模型的训练范式是“预训练 -> 监督微调(SFT)-> 强化学习(RL)”。SFT 通常被认为是为模型注入特定能力(如指令遵循、安全回答)的基础。然而,DeepSeek 团队在其初代推理模型 DeepSeek-R1-Zero 中,直接跳过了 SFT 环节,在基础模型(DeepSeek-V3-Base)上直接应用大规模强化学习。
核心发现:只要奖励函数设计得当(这里主要是准确率奖励和格式奖励),即使不加 SFT,模型也能通过 RL 自发涌现出强大的推理能力。
- 性能跃升:在 AIME 2024 数学竞赛基准上,DeepSeek-R1-Zero 的 Pass@1 得分从基线的 15.6% 一路狂飙至 71.0%;通过多数投票(cons@64),得分更是达到了 86.7%。这一成绩甚至超越了 OpenAI 的 o1-0912 模型,展现了纯 RL 的惊人潜力。
- 行为涌现:研究者观察到,纯 RL 训练使得模型自发出现了多种类人的推理行为:
- 自我反思(Self-reflection):模型会检查自己之前的推理步骤,发现错误并回退修正。
- 自我验证(Self-verification):模型会自己检验最终答案的正确性。
- 长思维链(Long CoT):模型学会了生成冗长、多步骤的思考过程,而非快速作答。
但是,纯 RL 的“野性”也带来严重问题:
- 可读性极差(Poor Readability):生成的推理链充斥着复杂的混合语言和结构混乱的思考。
- 语言混用(Language Mixing):模型经常在中文、英文、甚至代码片段之间无理由地切换,影响理解。
- 无限重复(Endless Repetition):模型偶尔会陷入死循环,重复输出相同或相似的 token,导致无法收敛到最终的答案。
尽管存在这些瑕疵,DeepSeek-R1-Zero 的诞生是里程碑式的。它是首个公开验证“LLM 的推理能力可仅通过 RL 激发,而无需 SFT”的开源研究,为后续研究提供了一个极具价值的范式起点。
2. DeepSeek-R1:结合冷启动的“完美版”
为了解决 R1-Zero 的“野性”问题,并进一步提升推理性能和文本质量,DeepSeek 推出了正式版 DeepSeek-R1。其核心改进在于在 RL 之前引入了冷启动(Cold Start)——即少量高质量 SFT 数据作为“种子”。
其训练流程可以精炼为“两轮 RL + 两轮 SFT”的混合管道:
- 阶段一:冷启动 SFT:收集数千条高质量的推理链(包含标准中文/英文、反思性思考、结构化输出等)对基础模型进行微调。这个阶段类似于“送孩子上学”,教模型先学会基本的解题格式和语言规范,为后续 RL 提供稳锚点。
- 阶段二:面向推理的 RL:在冷启动后的模型上进行大规模 RL,目标依然是指向数学、代码、逻辑类的确定性任务。在此阶段,引入语言一致性奖励(Language Consistency Reward)——通过奖励机制强迫模型在推理链中保持单一语言,有效消除了语言混用问题。
- 阶段三:拒绝采样与混合 SFT:利用训练好的模型,对海量 prompt 进行采样,使用**拒绝采样(Rejection Sampling)**筛选出正确且优质的推理链,同时合并其他数据类型(如写作、问答、角色扮演等),构建一个覆盖面更广的混合 SFT 数据集,再次对模型进行监督微调。此举旨在让模型在保持强悍推理能力的同时,也能恢复作为通用助手的普适性。
- 阶段四:面向偏好的 RL:最终,引入强化学习的人类偏好对齐阶段(类似 RLHF),针对那些无法用单一答案衡量好坏的任务(如创意写作中“有用的回答”和“无害的回答”),以人类偏好进行优化,确保模型输出的最终响应符合用户偏好且安全。
最终,DeepSeek-R1 在数学、代码、推理等任务上达到了与 OpenAI-o1 相当的水平,同时解决了纯 RL 带来的可读性问题,并补齐了通用对话能力。
二、知识蒸馏:让 32B 的小模型击败 o1-mini
论文的另一重磅贡献是关于**蒸馏(Distillation)**的深刻洞见。
关键结论:“将大模型的推理模式蒸馏到小模型,比在小模型上直接做 RL 找到的推理模式性能更好。”
这暗示了单纯依赖 RL 训练小模型提升推理的路径可能不是最有效率的。小模型可能没有能力去从一张白纸探索出高质量的思维链,但通过模仿大模型已经产出的高质量“意图”,反而能学得更快、更好。
DeepSeek 团队使用 DeepSeek-R1 生成的高质量推理数据,对一系列广泛使用的开源稠密(Dense)模型(非 MoE)进行了微调,推出了 6 个蒸馏版本:
- 基于 Qwen2.5 系列:1.5B、7B、14B、32B,底层模型为 Qwen2.5-Math 系列和 Qwen2.5-14B。
- 基于 Llama3 系列:8B(基于 Llama-3.1-8B)、70B(基于 Llama-3.3-70B-Instruct)。
实验结果:小模型的颠覆性胜利
蒸馏模型的评估结果极具冲击力。以 DeepSeek-R1-Distill-Qwen-32B 为例:
- 在 AIME 2024 上 Pass@1 获得 72.6%,超越了 OpenAI o1-mini 的 63.6%。
- 在 MATH-500 上获得 94.3%(o1-mini 为 90.0%)。
- 在 Codeforces 竞赛评级达到 1691,远高于 o1-mini 的 1820 得分(这里指得分百分位,论文中用 Percentile 描述,此处按 Github 表格描述改写)。
更令人惊叹的是 DeepSeek-R1-Distill-Qwen-7B 这样的迷你模型,也能达到 AIME 55.5%、MATH-500 92.8% 的成绩,远超许多更大的模型。30B 参数级别的蒸馏模型全面超越了 o1-mini,这在过去是难以想象的。
实践中的便利性:蒸馏出的模型不依赖 MoE 架构,因此非常适合个人开发者本地部署。在 Hugging Face 的模型卡介绍中,用户可以借助 vLLM 或 SGLang 这样的推理引擎,像运行 Qwen 或 Llama 一样轻松启动服务:
bash
使用 vLLM 部署 DeepSeek-R1-Distill-Qwen-32B
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager
使用 SGLang 部署
python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2
三、评估数据:硬核对标 OpenAI o1
为了公平地评估模型能力,论文主要评估了典型的高难任务数据集。下表摘录了关键的英文与代码/数学基准对比结果:
| 类别 | Benchmark | DeepSeek-R1 | OpenAI o1-1217 | OpenAI o1-mini |
|---|---|---|---|---|
| 综合知识 | MMLU (Pass@1) | 90.8 | 91.8 | 85.2 |
| GPQA-Diamond (Pass@1) | 71.5 | 75.7 | 60.0 | |
| SimpleQA (Correct) | 30.1 | 47.0 | 7.0 | |
| 代码能力 | LiveCodeBench (Pass@1-COT) | 65.9 | 63.4 | 53.8 |
| Codeforces (Rating) | 2029 | 2061 | 1820 | |
| SWE Verified (Resolved) | 49.2 | 48.9 | 41.6 | |
| 数学能力 | AIME 2024 (Pass@1) | 79.8 | 79.2 | 63.6 |
| MATH-500 (Pass@1) | 97.3 | 96.4 | 90.0 | |
| CNMO 2024 (Pass@1) | 78.8 | - | 67.6 |
解读:
- 对标 o1 完全版:DeepSeek-R1 在 LiveCodeBench、AIME 2024、MATH-500 等数学与竞赛代码任务上,得分超越了 OpenAI o1-1217(正式版),展现出极强的推理上限。
- 知识类短板:在 MMLU、GPQA-Diamond、SimpleQA 等知识考察数据集上,与 o1-1217 相比仍有一定差距。这通常被认为与 DeepSeek-R1 的训练数据规模和通用知识储备(上下文长度)以及 API 访问有关,但差距并不悬殊,且远超其他开源模型。
- 中文优势:在 C-Eval 等中文基准上大幅领先其他同级别模型,这得益于其原生中文能力。
- 蒸馏模型的效用:在蒸馏模型评估表中,可以看到参数量仅 32B 的蒸馏模型在 AIME 2024 上达到了 72.6,甚至超越了 o1-mini,而 70B 的蒸馏模型在 GPQA Diamond 上表现也很突出。
四、模型架构与技术细节
- 架构:DeepSeek-R1 和 R1-Zero 在 DeepSeek-V3-Base 技术上构建,沿用其 MoE(混合专家)架构。参数量级高达 总参 671B,但每次推理仅激活 37B 参数,这种稀疏激活机制极大地降低了推理成本。上下文长度为 128K token。
- 推理长度:所有模型最大生成长度设置为 32,768 个 token,以容纳深度推理所需的长思维链。
- 采样参数:评估时建议使用温度 0.6、top-p 0.95,并生成 64 个回答来估算 pass@1,其目的在于平衡探索的随机性和准确性。
五、获取与部署
- 完整模型:DeepSeek-R1-Zero 和 DeepSeek-R1 的权重已开源在 Hugging Face,但由于 Transformers 库原生支持的滞后期,要运行这两款 MoE 模型,需按照 DeepSeek-V3 仓库说明,使用专用的基础设施(如 DeepSpeed、vLLM 等的特定实现)。
- 蒸馏模型:1.5B、7B、8B、14B、32B、70B 的模型权重也已完全开放,可使用标准的 vLLM、SGLang 等推理框架进行部署,极大降低了使用门槛。
- 线上体验:为了普惠大众,用户可以直接访问官网(chat.deepseek.com)打开 DeepThink 按钮体验,或是通过平台(platform.deepseek.com)的 OpenAI 兼容 API 进行集成调用。
六、总结与展望
DeepSeek-R1 的发布,是开源模型对抗闭源前沿模型的一次漂亮战役。它不仅证明了纯强化学习的可行性(R1-Zero),更为关键的是,通过“冷启动+多阶段RL”技术栈,将推理质量和通用能力进行优雅结合(R1);通过知识蒸馏技术,将强大的推理模型转化为更小但更实用的稠密模型(Distill系列)。
同时,这份工作将对社区产生深远影响:
- 研究范式的更新:启示其他研究者不必总是依赖昂贵的 SFT 数据,高质量 RL + 精准 Rewarding 有可能解锁更强的推理边界。
- 推理路线的降本增效:蒸馏实验数据强烈暗示,相对于在小模型上自研 RL 策略,采用大模型蒸馏语料的方法,训练效率更高、模型精度更优,这为业界提供了极具性价比的选型参考(例如,选择 70B 蒸馏模型而非尝试在 7B 上做 RL)。
- 开源力量的反击:完整的推理模型权重开源让整个行业站在了同一起跑线上,不再是 OpenAI 等少数巨头独享先进推理能力,极大加速了 AI 应用在各行各业、各层级的落地进程。
随着推理模型的普及化,如何更好地解析超长思维链、控制推理成本、平衡推理模型与智能体的交互,将会是接下来的新研究方向。而 DeepSeek 显然已经在这场竞赛中占据了领跑位置。