从 R1-Zero 到 R1:DeepSeek 如何用强化学习“炼“出会推理的模型

发布时间:2026/10/10 17:39:49

从 R1-Zero 到 R1:DeepSeek 如何用强化学习“炼“出会推理的模型 从 R1-Zero 到 R1DeepSeek 如何用强化学习炼出会推理的模型【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R12025 年 1 月 20 日DeepSeek 正式发布并开源了 R1 系列推理模型。这一事件之所以在业界引起震荡不是因为又一款大模型跑出了漂亮的分数而是因为它回答了一个此前悬而未决的问题推理能力到底能不能不靠人工标注的标准答案教出来而是靠强化学习RL自己长出来答案是能但代价是踩遍所有坑。从完全不设监督微调SFT的 DeepSeek-R1-Zero到用SFT RL 双轮混合管线修补过的 DeepSeek-R1中间横亘着可读性崩溃、语言混杂、奖励黑客reward hacking等一系列工程难题。这篇文章结合开源仓库README.md与论文arXiv:2501.12948的一手数据完整拆解这条炼出推理能力的路线以及它给此后所有推理模型留下的通用配方。一、R1-Zero跳过 SFT让模型在纯 RL 中自发学会思考反常识的起点去掉人类思维链样本传统的大模型后训练是先 SFT 再 RLHF先拿大量人工标注的输入-输出对把模型调教成会答题再用人类偏好奖励模型做对齐。但 DeepSeek 团队提出了一个反直觉的假设——人类标注的推理轨迹恰恰可能成为模型探索更好推理方式的枷锁。人写的解题过程未必最优而且高度依赖人工、难以规模化。于是 R1-Zero 直接把强化学习施加在 DeepSeek-V3-Base 上完全跳过 SFT 前置阶段奖励信号只来自最终答案是否正确对推理过程本身不加任何内容层面的约束。GRPO去掉价值模型用组内相对省出算力支撑大规模纯 RL 的算法是 Group Relative Policy OptimizationGRPO。它与 PPO 的最大区别在于PPO 需要一个与策略模型同等规模的价值模型critic来估计优势函数显存和算力开销巨大而 GRPO 对同一个问题采样一组输出直接用组内奖励的相对比较计算优势A_i (r_i - mean({r_1, ..., r_G})) / std({r_1, ..., r_G})每个问题采样 16 个输出作为一组训练中每 400 步用最新策略替换参考策略配合同样来自 DeepSeek 的组相对裁剪clip ratio技巧——这套设计让长思维链long CoT的大规模 RL 在成本上变得可行。奖励只分两种答对 格式对R1-Zero 的奖励系统刻意保持朴素准确率奖励数学题要求最终答案写在\boxed{}里规则匹配判分代码题用编译器跑隐藏测试用例自动判分格式奖励要求推理过程封装在think.../think标签内便于解析与后续分析。团队明确拒绝使用神经奖励模型无论基于结果还是过程理由很直接神经 RM 在大规模 RL 中极易被奖励黑客且重训成本高、管线复杂。规则奖励虽朴素却提供了纯 RL 最稀缺的东西——可靠的验证信号。涌现的结果反思、回溯与Aha Moment训练曲线说明了一切R1-Zero 在 AIME 2024 上的 pass1 从初始的15.6% 一路飙升至 77.9%用自一致性解码cons64进一步提升到86.7%超过人类参赛者的平均分。更耐人寻味的是模型平均回答长度在训练中持续增长——它自发学会了多想一会儿并涌现出自我验证、反思、回溯、尝试替代解法等高级推理行为。论文中最出圈的一幕是模型在解题过程中突然冒出一句Wait, wait. Thats an aha moment I can flag here.随后它主动重新评估自己的解题步骤。这不是人类写进数据的而是 RL 逼出来的——研究者把这一刻视为纯强化学习涌现力量的直观证据。翻车点能力有了但不像人话R1-Zero 的短板同样明显论文将其总结为三大问题可读性差与无休止重复长思维链经常陷入循环语言混杂由于 DeepSeek-V3-Base 的中英混合预训练语料模型经常在一条思维链里中英夹杂通用能力塌陷纯规则奖励把模型钉死在推理任务上写作、开放问答、指令跟随全面退步——IF-Eval 仅 46.6AlpacaEval 2.0 仅 24.7Arena-Hard 仅 53.6。一句话总结 R1-Zero它证明了纯 RL 能激发推理但也证明了只靠纯 RL 造不出好产品。二、R1用SFT RL 双轮混合把推理能力修成可用四段式管线冷启动 → RL → 拒绝采样SFT → 再 RLR1 的补救方案不是退回传统路线而是把 SFT 重新放回正确的位置——为 RL 服务而不是替代 RL。完整管线分四步第一步冷启动Cold Start。收集数千条对话式、人类对齐的长思维链数据做一次轻量 SFT。这些数据由人类标注者把 R1-Zero 的原始推理轨迹改写成第一人称、自然可读的风格再交给 DeepSeek-V3 批量改写、人工复核。目的不是教模型推理而是给 RL 一个可读、不跑偏的起点。第二步第一轮 RL。在冷启动模型上继续做推理 RL但这次奖励里多了一项语言一致性奖励Reward_language Num(Words_target) / Num(Words)即思维链中目标语言词数占比。消融实验显示这项奖励会带来轻微的性能损失但换来的是用户真正能读懂的输出——论文明确说这符合人类偏好。第三步拒绝采样 第二轮 SFT。用第一轮 RL 产出的 checkpoint 做拒绝采样只保留答对的轨迹拼上通用数据凑成约80 万条监督样本约 60 万推理数据数学 39.5 万、代码 21.1 万为主 约 20 万非推理数据写作、事实问答、翻译、软件工程等。这一步让模型同时补上推理与通用能力。第四步第二轮 RL。推理数据继续用规则奖励通用数据引入帮助性奖励模型基于 6.6 万条偏好对训练只评估最终摘要与安全性奖励模型基于 10.6 万条安全标注训练。团队特别指出偏好奖励只在最后 400 步引入——训练太久会导致奖励黑客表现为 Codeforces 成绩与奖励曲线背离。逐阶段看疗效Dev1 → Dev2 → Dev3 → R1论文给出了每个中间 checkpoints 的成绩单可以非常清楚地看到各阶段的分工基准R1-ZeroR1-Dev1R1-Dev2R1-Dev3R1IF-Eval指令跟随46.671.772.078.183.3AIME 2024数学77.959.074.078.179.8Codeforces Rating14441534168717462029AlpacaEval 2.024.750.155.862.187.6Arena-Hard53.677.073.275.692.3Dev1冷启动后指令跟随能力暴涨IF-Eval 25 分但推理分暂时回落AIME 77.9 → 59.0——冷启动数据量太小是必经的阵痛期Dev2第一轮 RL 后推理能力强势回归并超越 R1-ZeroAIME 回到 74.0Codeforces 升到 1687Dev3补上通用 SFT 后写作与工程能力大幅补强Aider-Polyglot 从 25.6 跳到 44.8R1第二轮 RL 后AlpacaEval 2.0 再暴涨 25 个百分点、Arena-Hard 再涨 17 个百分点数学、代码分数也小幅冲顶。最终 R1 在多个基准上对齐甚至反超 OpenAI o1 系列AIME 2024 达79.8o1-1217 为 79.2、MATH-500 达97.3o1 为 96.4、LiveCodeBench 达65.9o1 为 63.4、Codeforces 百分位 96.3%。以下是仓库 README 中完整对比图蒸馏把想得久压缩进小模型R1 的另一半价值在于蒸馏。团队用 R1 生成的 80 万条数据对 Qwen2.5 与 Llama 系列做了 6 个稠密小模型的 SFT只做 SFT不做 RLR1-Distill-Qwen-1.5BAIME 2024 pass1 28.9、MATH-500 83.9——仅 15 亿参数就超过了 GPT-4o9.3 / 74.6和 Claude-3.5-Sonnet16.0 / 78.3这两个非推理大模型R1-Distill-Qwen-32BAIME 72.6、LiveCodeBench 57.2全面超过 o1-mini63.6 / 53.8R1-Distill-Llama-70BAIME cons64 达 86.7刷新稠密模型纪录。论文还做了一个关键对照实验对 Qwen2.5-32B-Base 跑 1 万步以上大规模 RL得到 Qwen2.5-32B-Zero结果被蒸馏版 32B在 AIME47.0 vs 72.6、MATH91.6 vs 94.3、GPQA55.0 vs 62.1上全面碾压。结论很干脆蒸馏更划算但想突破人类智能的天花板仍然需要更强的基础模型和更大规模的 RL。成本账与开源账训练成本按 H800 每卡时 2 美元估算R1-Zero101K GPU 卡时约 20.2 万美元R1 全流程41K GPU 卡时约 8.2 万美元SFT 数据创建5K GPU 卡时约 1 万美元合计约 14.7 万卡时、29.4 万美元对比动辄数千万美元的训练账单这套配方在成本上几乎是降维打击。仓库本身也印证了这一点权重按 FP8 量化存放model.safetensors.index.json 显示总计约 1.37 TB、拆成 163 个分片config.json 则完整披露了架构细节——671B 总参数、每 token 激活 37B61 层 Transformer256 个路由专家 1 个共享专家、每 token 激活 8 个多头潜在注意力MLAq_lora_rank1536 / kv_lora_rank512负责长上下文压缩配合 YaRN 将位置编码从 4096 拉伸到 163,840。更有意思的是推理侧配置仓库的 generation_config.json 将默认温度设为0.6、top-p 设为0.95tokenizer_config.json 的对话模板在生成时自动追加Assistantthink\n前缀——这些不是随手的调参而是从训练中总结出的反翻车经验。README 的使用建议同样直白温度控制在 0.5-0.7 防止无限重复不要加 system prompt数学题要引导逐步推理并给出 \boxed{} 答案评测多测取平均。这些细节后来被几乎每一款推理模型的手册继承。三、这套范式给整个行业留下的配方关键公式难题 可靠验证器 足够算力R1 系列最大的方法论贡献是把推理能力的来源从数据标注切换为环境反馈只要提供足够难的题目、足够可靠的验证器、以及足够的 RL 算力复杂的推理行为自我验证、反思、回溯会自发涌现而不需要人类逐条标注思维过程。论文作者在结论中反复强调人工标注不是关键可靠的 verifier 才是。这也是为什么 R1-Zero 的数学与代码成绩能反超基于人类示范训练的模型——模型探索出了人类示范里不存在的、更优的推理路径。两条前置条件模型要够大奖励要够硬R1 的开发过程留下了两条血泪教训被后续研究反复引用第一基础模型容量是纯 RL 生效的前提。团队早期在 7B 稠密模型和 16B MoE 上做同样的 RL全部失败——小模型在长思维链下只会重复无法利用长 CoT 提升准确率换到 32B 稠密、230B MoE、671B MoE 后纯 RL 才开始显著见效。R1-Zero 式训练不是任何模型都能复制的。第二奖励可靠性决定成败。论文专门记录了两次失败尝试过程奖励模型PRM——细粒度推理步骤难以定义、中间步正确性难以自动判定、且必然招致奖励黑客蒙特卡洛树搜索MCTS——token 生成空间的搜索爆炸、细粒度价值模型难以训练迭代自我提升始终没走通。这两个反面案例直接塑造了后来者的共识推理 RL 优先用规则验证器别急着上神经奖励模型。从 R1 到人人都在炼推理R1 开源的不仅是权重和配方更是一套可复制的范式。此后一年内Hugging Face 的 Open-R1、TinyZero、Qwen、Kimi 等一批开源推理模型几乎都沿用了同一个骨架冷启动 SFT → 推理 RL规则奖励→ 拒绝采样扩充数据 → 偏好对齐蒸馏版本1.5B 到 70B则让本地部署成为可能社区里涌现了大量基于 Ollama、vLLM 的部署教程与量化方案甚至有人盘点出 20 个 R1 家族版本满血/蒸馏/量化供按需选择。一年后媒体已经开始报道R1 发布一周年、新模型 MODEL1 曝光——无论后继者是谁R1 确立的RL 炼推理范式已经成了行业默认起点。尚未解完的题当然这套范式也有明确的边界论文自己列得很清楚token 效率简单问题也会过度思考想太多是常态动态分配推理预算仍待优化语言覆盖主要针对中英优化其他语言的思维链仍会混入英语提示敏感性few-shot 会显著损害 R1 性能零样本直述问题才是正确用法软件工程长评测周期拖累 RL 迭代R1 在 SWE-bench 上对 V3 的提升有限奖励黑客仍是开放问题一旦任务无法用规则验证比如写作纯 RL 的优势就迅速消失——这正是 R1 管线里 SFT 与偏好对齐必须存在的原因。回看整条路线R1-Zero 与 R1 的关系堪称激进实验与工程收敛的经典对偶前者用最纯粹的手段证明了强化学习能激发出推理后者用最务实的混合管线把这种能力变成可用的产品。对研究者和工程师而言真正值得带走的不是某个具体的超参数而是那条反复被验证的判断标准——当你能为一个任务构建可靠的验证信号时就大胆交给 RL不能时老老实实回到监督数据。这大概是 R1 留给整个行业最简洁、也最深刻的一条公式。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/10 17:34:45

LoRA微调与知识蒸馏联合优化实战指南

1. 为什么“更省的微调”和“更小的学生”不是营销话术,而是工程落地的刚性需求LoRA 和知识蒸馏这两个词最近在大模型圈里被反复提起,但很多人一看到“微调”就下意识想到租三台A100跑一周、显存爆满、checkpoint动辄30GB——结果还没调完,预…

2026/10/10 18:45:28

车载智能座舱核心测试模块Checklist实战拆解

做车载智能座舱测试这些年,最大的感受就是:座舱系统已经不是一个简单的“车机”了,而是一个集仪表、中控、HUD、后排娱乐、语音、C-V2X、车家互联等多维交互于一体的车载移动终端。很多测试同学刚接触座舱项目时,第一反应是“这跟…

2026/10/10 18:45:28

把官方财务运营模板接进你自己的数据:从 CSV 到仪表盘全流程

把官方财务运营模板接进你自己的数据:从 CSV 到仪表盘全流程 【免费下载链接】financial-services 可将 Claude 转变为金融服务专家,适用于投资银行、股票研究等领域。提供核心及专项插件,支持端到端工作流,集成多数据源&#xff…

2026/10/10 18:45:28

基于PJ85718DM与STM32F411RE的双路温度监测方案

1. 项目缘起与整体设计思路嵌入式温度监测这个方向,看起来简单,实际上坑特别多。我最早接触这类需求是在一个HVAC控制柜的改造项目里,当时的要求很朴素:本地要能看到回风温度,远程中控室也要能读到同一路数据&#xff…

2026/10/10 18:40:28

Realtek声卡爆音根治指南:驱动、BIOS与Windows音频深度调优

1. 这不是“爆音”,是Realtek声卡在向你求救最近刷到好几条视频,标题都带着“Realtek声卡一开游戏就炸耳”“看个视频突然滋啦滋啦像烧电线”“耳机里传出电流声,音量调小也没用”——点进去一看,清一色是Windows台式机或笔记本用…

2026/10/10 7:31:36

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/9 20:15:56

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/8 6:05:44

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 0:04:53

从逻辑门到计算机:数字电路核心原理与全加器搭建实战

如果你拆过一台旧电脑的主板,盯着那些黑乎乎的小芯片看上一会儿,可能会冒出同一个疑问:这堆引脚密集的元件,到底是怎么“变”出那么复杂的应用的?答案并不在某个神秘的部件里,而是在所有芯片内部都在反复使…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑