发布时间:2026/8/26 17:50:15
腾讯科恩实验室 一面 四 目录一、DeepSeek-R1 的思维链CoT原理1.1 思维链到底是什么1.2 DeepSeek-R1 是怎么学会思考的1.3 思维链的本质三个关键特征1.4 信息论视角CoT 为什么有效1.5 架构支撑MoE 混合专家1.6 解码策略的严谨性1.7 GRPO思维链的锻造炉二、AI Agent 核心理解2.1 什么是 AI Agent2.2 核心公式Agent LLM 记忆 规划 工具2.3 现代 AI Agent 的三大关键能力2.4 Agent 的四种典型形态三、总结一、DeepSeek-R1 的思维链CoT原理1.1 思维链到底是什么思维链Chain of ThoughtCoT本质上是一种让模型把思考过程写下来的推理范式。它模仿人类解决复杂问题时的习惯——边写边想一步一步推导最终得出结论而不是在脑子里跳到答案。一个有趣的发现是早期研究者在训练大模型时意外观察到仅仅在提示词中加入一句请逐步思考Think step by step模型的准确率就出现了显著提升。这说明显式地把推理步骤展开本身就能改善模型的推理质量。1.2 DeepSeek-R1 是怎么学会思考的DeepSeek-R1对应 API 中的deepseek-reasoner在运用思维链时有一套清晰的训练路径先具备能力让模型拥有输出思维链的基本能力再强化训练通过人类反馈强化学习RLHF与基于规则的推理奖励Rule-Based Reward for Reasoning对模型进行强化自然涌现经过这样的训练模型在推理时就能自然而然地生成思维链并按照人类期望的方式思考和作答。1.3 思维链的本质三个关键特征1分步拆解将复杂问题分解为多个有序子问题像人类解题一样逐步推导2逻辑链条构建从问题到答案的连续推理路径每一步都以前一步的结论为基础保证逻辑的严密性3显式思考输出完整的思考过程被思考标签包裹让用户可见、可验证。1.4 信息论视角CoT 为什么有效从信息论的角度看CoT 在高复杂度的查询与答案之间建立了一条低熵通道。通过逐步分解每一步的条件概率都更加自然最终把原本跳跃式的结论转化为小步快走式的累积推导从而大幅降低了直接生成答案时的不确定性。1.5 架构支撑MoE 混合专家DeepSeek-R1 之所以用得起如此长的思维链离不开其底层的 MoEMixture of Experts混合专家架构采用256 个路由专家 1 个共享专家总参数671B但每次推理仅激活37B实现大模型能力、小模型开销专家选择每个 token 通过门控网络选择 8 个专家处理形成动态计算图注意力机制128 个注意力头分为 RoPE 与 NoPE 两部分提升长序列理解能力动态路由根据输入动态激活不同的专家组合形成个性化的推理路径。从推理流程上看模型可抽象为输入层 → 特征提取层 → 推理引擎层 → 输出层的分层结构融合符号逻辑与统计学习方法兼顾推理的严谨性与灵活性。1.6 解码策略的严谨性在思考模式下DeepSeek-R1 采用特殊的解码策略来保证推理的确定性低随机性将 temperature、top_p 等参数设为极低值甚至忽略避免蝴蝶效应导致推理偏离贪婪解码每一步都选择概率最高的 token保持逻辑一致性多路径生成通过束搜索beam search隐式生成多条路径最终选择得分最高的一条输出。1.7 GRPO思维链的锻造炉R1 没有走传统 RL 路线而是通过GRPO群体相对策略优化算法训练跳过 SFT 直接用纯强化学习激发推理能力摒弃 Critic 模型用组内相对优势估计替代价值函数减少约40%的显存占用奖励机制包含准确性奖励确保推理结果正确语言一致性奖励防止多语言混杂思考深度奖励鼓励生成完整推理链而非直接给答案KL 散度约束控制策略更新幅度防止模型遗忘已有知识将训练崩溃率从17% 降至 2%。二、AI Agent 核心理解2.1 什么是 AI AgentAI Agent人工智能代理是一种能够感知环境、自主决策并执行动作的智能实体。与传统 AI 系统不同Agent 不仅能回答问题还能主动完成一系列复杂任务。一个形象的比喻如果把大语言模型LLM比作一个超级大脑那么 AI Agent 就是给这个大脑装上了手脚和工具让它能够像人一样主动行动而不只是被动应答。传统 AI像个听话的工具你说跳它就跳一下AI Agent像个有主动性的助手你给个目标它自己规划怎么跳、跳多高。2.2 核心公式Agent LLM 记忆 规划 工具一个典型的 Agent 通常由四大核心组件构成大模型LLM提供语言理解、推理与生成能力是整个 Agent 的大脑任务规划Planning借助大模型对复杂任务进行分解、规划与调度并实时观察子任务执行结果、及时调整工具使用Tool Use根据决策结果执行具体动作与外部工具API、数据库、硬件设备等交互扩展能力边界相当于 Agent 的手脚记忆Memory存储经验与知识支持长期学习是 Agent 的存储器——既可以是短期记忆如单次任务中的多轮人机交互也可以是长期记忆如用户任务历史、个人信息与偏好。此外Agent 通常还需提供一个直观的入口可视化文字/语音输入或对外开放的 API方便用户下达指令、查看结果。2.3 现代 AI Agent 的三大关键能力1根据经验调整行为通过上下文学习In-Context Learning、记忆重要经验、从反馈中学习2使用工具搜索引擎获取实时信息、代码执行器编写并运行程序、API 调用与其他服务交互、数据库查询检索信息3规划能力任务分解、路径规划、资源分配、错误处理。2.4 Agent 的四种典型形态形态说明代表Reflection反思模式通过模型自身反思来改进任务执行ReAct、Self-Refine、RefineTool Use工具调用模型调用外部工具或库来解决问题——Planning规划模式提前计划与组织步骤提升效率与准确率——Multi-Agent Collaboration多智能体协作多个智能体协作提升任务执行能力A2A 协议三、总结思维链CoT与 AI Agent分别对应了大模型能力的两个关键维度想得更深与做得更多。前者通过显式推理 强化学习GRPO MoE 架构让模型在复杂问题上给出更可靠、可验证的答案后者通过LLM 记忆 规划 工具的组合让模型从会回答进化到会行动。对于准备大模型岗位面试的同学建议把这两块的原理、训练方法、架构细节都梳理清楚——它们既是技术热点也是面试官最爱深挖的连环追问考点。

相关新闻

2026/8/26 17:50:15

Aether 项目 3 年重构 4 次,我学到的 5 个教训

从"能跑就行"到"架构清晰",工业项目的进化之路一、一个真实的病历本 第一版 Aether:一个巨大的 main.cpp,所有代码堆在一起。 第二版 Aether:分出了 common/app/plugins,但耦合依然严重。 第三版 …

2026/8/26 17:45:15

【项目编号:project75677】【Spring Boot + MySQL】医院门诊信息管理系统:预约挂号、检查、处方与药房协同(源码可领)

【Spring Boot MySQL】医院门诊信息管理系统:预约挂号、检查、处方与药房协同(源码可领)医院门诊系统的核心不是某一个页面,而是患者、医生、检查人员、药房和管理员之间的协作。一个预约挂号会继续产生就诊、检查、诊疗、药品清…

2026/8/26 18:50:41

阿里巴巴国际站运营科普:平台逻辑、关键要素与增长路径

1. 阿里国际站是什么 阿里巴巴国际站是阿里巴巴集团旗下面向全球市场的B2B跨境电商平台,致力于连接中国供应商与海外采购商。自上线以来,平台逐步从早期的信息展示与商机撮合,演进为覆盖交易、支付、物流、通关等环节的数字化外贸基础设施。…

2026/8/26 18:50:41

一文学完linux必要点

本文仅作为了解使用linux。(个人笔记) 目录 一、linux认知与命令格式 1、 命令格式 1)选项的两种风格: 2)帮助系统 二、文件与目录操作 1、浏览与定位 1)ls 2)cd 2、创建操作 3、删除…

2026/8/26 18:45:40

Deep Learning for Computer Vision——Recurrent Neural Networks

第一部分:为什么需要 RNN?(序列建模问题)传统 CNN 和全连接网络(FC)的输入和输出大小是固定的(比如 224x224 的图片输入,输出 1000 个类别)。 但现实中有很多任务输入或输…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 11:48:27

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 16:56:43

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 0:04:32

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 1:19:35

JSON总结

JSON概念 JSON(JavaScript Object Notation) 是一种轻量级的数据交换格式,主要用于跟服务器进行交换数据。它基于ECMAScript的一个子集。 JSON采用完全独立于语言的文本格式,但是也使用了类似于C语言家族的习惯(包括C、C、C#、Java、JavaScr…

2026/8/26 1:19:35

保存连接sse 是什么原理,为什么不会一直请求

“保持连接”用的是 SSE(Server-Sent Events),本质是一个没有马上结束的 HTTP 请求。 过程是: 拷贝机发送一次请求: GET /api/code-sync/events服务器返回: Content-Type: text/event-stream但不关闭响应&…

2026/8/24 13:42:17

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/24 18:13:48

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/25 1:08:14

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…