从论文到代码:HER事后经验回放算法如何攻克稀疏奖励难题

发布时间:2026/10/3 4:10:07

从论文到代码:HER事后经验回放算法如何攻克稀疏奖励难题 “hindsight”这个词在强化学习圈子里可不是“事后诸葛亮”的贬义说法。它背后是一个相当经典的算法——Hindsight Experience Replay事后经验回放习惯简称HER。我第一次听说这个概念的时候心里想的是这不就是把“失败的经验”硬掰成“成功的经验”来用吗听起来有点像自欺欺人但实际跑过实验之后我发现这玩意在解决稀疏奖励问题上确实是目前最实用的思路之一。这几个月我一直在折腾一个机械臂抓取的任务用的是稀疏奖励环境目标是把方块放到指定位置只有放准了才有奖励其他时候全是0。刚开始用普通的DDPG训练了上百万步一点起色都没有agent完全是个呆子。后来我把HER加上去同样的算法、同样的超参数几十万步就开始出现明显的抓取动作了。这篇文章我想把我对HER的理解、从论文到代码的落地过程、还有我在实验里踩过的坑完整地记录下来希望能给正在跟稀疏奖励死磕的朋友一些参考。1. 为什么偏偏是HER先从稀疏奖励这个老大难说起1.1 你给不了密集奖励机器就不知道该学什么先说说我为什么会接触这个方向。我做的是一个机械臂仿真抓取项目任务本身不复杂机械臂从初始位置出发去抓取桌面上的一个方块然后放到目标位置。问题在于我给环境设计奖励函数时用的是稀疏奖励——成功得1分失败得0分中间没有任何过渡信号。这样的环境对强化学习算法来说极其不友好因为在训练初期agent随机探索时几乎不可能一次就成功所以它收到的一直是0、0、0……没有任何梯度信息算法根本无从更新策略。我试过换成密集奖励比如根据机械臂末端和目标的距离给一个负的距离惩罚这样确实能引导agent“动起来”但随之而来的是一堆工程问题奖励形状怎么设计权重怎么调距离用什么度量过于密集的奖励还会诱导agent“钻空子”比如机械臂停在某个中间位置虽然距离没变近但因为动作幅度小惩罚也小它就赖在那儿不动了。换句话说密集奖励让问题变得“手调味道”太重而且泛化性很差。正是这种体验让我意识到为什么HER在2020年前后会被那么多人关注。OpenAI那篇《Hindsight Experience Replay》论文提出的思路特别朴素既然agent在探索过程中大概率会失败那我们能不能别把失败的轨迹直接丢掉失败轨迹里机械臂虽然没有把方块放到指定的目标位置但它确实把方块“放到”了另外一个位置。那好我们就把那个实际到达的位置重新当成一个“目标”让agent去学着完成这个“新目标”。这样一来一条失败的轨迹就变成了一条“成功轨迹”——因为对于重新定义的目标来说agent确实是完成了的。这就是HER的“事后聪明”用实际发生的结果去重新解释过去的经验。1.2 为什么强化学习常规套路在这里会失效要真正理解HER的价值得先搞清楚标准强化学习在稀疏奖励下为什么会崩。以我当时用的DDPG为例它属于基于价值的方法核心是用critic网络去拟合Q函数也就是估计“在状态s采取动作a之后未来能获得多少回报”。在稀疏奖励环境下大部分状态动作对都没有收到过正向反馈Q函数的输出在所有地方都差不多——都接近0。critic给不出有区分度的价值信号actor的网络更新就失去方向策略梯度几乎就是噪声训练自然就停摆。这时候有人会说“那我就加大探索呗让agent多碰几次运气总有一次成功吧”问题在于高维度连续动作空间里运气碰出成功轨迹的概率低得可怜。拿我的机械臂任务来说动作空间是7维的关节角度变化每个维度稍微偏一点点末端执行器的位置就会差出好几厘米。在这么大的连续空间里随机探索撞到“安全区”的概率可能连百分之一都不到。哪怕算法真的偶然成功一次这一条轨迹放进replay buffer里也很快就被海量失败样本淹没训练根本稳住不住。另外还有一个容易被忽略的点在goal-conditioned的设定下失败并不是完全没价值。一个轨迹虽然没能达成目标g但如果它达成了另一个状态g那么这条轨迹对于目标g来说就是一条标准的成功轨迹。标准强化学习算法不会去挖掘这一层信息——它看到的只是“对目标g失败了”然后就把轨迹丢掉了。HER做的事情本质上就是把这种“隐性成功样本”显式地挖掘出来重新注入训练。1.3 HER解决的是哪一类问题这里必须说清楚HER不是一个通用的强化学习算法而是一种适用于特定任务族的思想。它适用的是goal-conditioned任务也就是任务可以被描述为“从任意初始状态出发达成某个目标状态”。典型例子包括机械臂抓取并放到指定位置、机器人导航到指定地点、魔方复原虽然动作空间离散但思路同样适用等。这类任务都有一个共性目标状态可以明确描述并且我们可以方便地拿到“轨迹实际结束时的状态”。HER的核心操作就是对这个实际结束状态做文章。如果任务不具备这种条件比如目标是“让机器人保持平衡不倒”没有明确的目标状态可以重标注那HER就不太合适。再比如像打网球这种有大量博弈成分的任务目标不是某个静态状态那也需要额外改造才能套用HER。所以当你决定要用HER时先确认三件事第一任务是不是goal-conditioned第二目标状态能不能在轨迹中自然地获取比如直接读取仿真环境中的物体坐标第三你手里是否有一个现成的off-policy强化学习算法比如DQN、DDPG、SAC可以承接HER的经验回放机制三个条件都满足HER才有用武之地。2. HER的核心机制拆解目标重标注是怎么运作的2.1 “新目标”从哪里来状态回放和目标回放的差异先看公式化的表述。假设我们定义了一个goal-conditioned MDP状态记为s动作记为a目标记为g奖励函数是r(s, a, g)。在稀疏奖励下r在绝大多数情况下都是0只有当s或状态的一部分和目标g匹配时才给正值。标准的强化学习流程是采一条轨迹τ (s₀, a₀, s₁, a₁, …, sT)在这条轨迹中目标g始终固定不变。轨迹放进replay buffer时存的是(s, a, r, s, g)这样的四元组。这个流程在密集奖励下没问题但在稀疏奖励下大多数四元组的r0critic学不到梯度。HER的做法是在存入buffer之前对目标做一次“替换”。同样一条轨迹除了原始目标g外我们再额外生成K个替代目标gعادة取轨迹中后面某个时刻的真实状态。对于每个替代目标我们重新计算奖励r r(s, a, g)。由于替代目标就是轨迹里实际到达过的状态这条轨迹的最后一个状态sT和目标g是匹配的所以最后的奖励r 1整条轨迹在替代目标下就变成了一条成功轨迹。这里有个关键细节我们在重标注时并不是对轨迹里所有time step都无脑给新奖励。还是得按照原始奖励函数的定义来算。HER只是把目标从g换成g奖励计算还是要走一遍正常的奖励逻辑。也就是说“某个状态是否达成目标”还是由原始奖励函数判定只不过目标本身变了。这也是HER能够完全复用原始奖励函数、不需要额外设计密集奖励的根本原因。2.2 替代目标怎么选future策略和final策略论文里介绍了多种替代目标的采样方式我实际用下来最常用且效果最稳的是两种final策略和future策略。final策略最简单对于每条轨迹只取轨迹的最终状态sT作为替代目标额外生成1个新样本。这种做法实现几乎零成本但缺点是信息量有限尤其当轨迹很长时最终状态与轨迹中很多早期状态差异很大agent需要在“离目标很远”的状态下学习怎么向目标靠近信号太稀疏。future策略更丰富一些对于轨迹中的每个时间步t随机从轨迹后续时间步t ∈ [t1, T]中采样一个状态作为该时间步的替代目标。这样做的好处是替代目标与当前状态的距离不会太远因为t t目标在时间上处于当前状态之后agent学习的是一条渐进的路径而不是一次性学会大跨度移动。我在实验中用的就是future策略每个原始样本额外生成K4个替代目标样本。还有一个值得提的采样trick不要完全均匀地从未来的时间步里选而是可以加重靠近轨迹末尾的时间步的采样权重。因为轨迹末尾的状态通常更接近“真正成功的结果”而早期状态和末尾状态之间的差距恰好能提供更有价值的监督信号。论文里用的是一种基于“时间距离”的采样方式大概意思就是越靠近末尾的时间步被选中的概率越高。我在实操中直接用了一个指数衰减的权重效果比均匀采样好一些。2.3 Replay Buffer的容量和组成别让重标注样本淹没原始样本HER的replay buffer里同一物理轨迹既会以原始目标g的形式存储也会以替代目标g的形式存储。这里就有一个很实际的工程问题这两种样本的比例怎么控制我最初踩过一个坑直接把替代目标样本全部塞进buffer结果原始成功样本被稀释得厉害。agent虽然用重标注出来的“伪成功”样本学到了不少东西但真正对原始任务有用的“真成功”样本反而占比太低策略在评估时很难稳定复现成功动作。后来我看了一些开源的复现实现比较合理的方式是每条轨迹在存入buffer时原始目标样本保留1份替代目标样本生成k个不等。一般k取1到4之间取决于你的buffer总量和任务复杂度。如果任务动作空间大、状态维度高可以适当把k调大用更多“伪成功”样本补偿探索不足的问题。但如果任务本身有比较简单的成功条件比如目标点很小、成功判定严格那k不用太大2左右就够了。另外buffer总容量也要注意。HER本质上是在做目标的重新标注这种方法会提升样本的利用率但代价是buffer里的样本之间存在很强的相关性同一轨迹的不同目标版本。buffer太小时这种相关性会让训练不稳定buffer太大时样本利用率又上不去。我用的DDPGHERbuffer容量在10^6量级效果还不错。如果你的算力紧张至少也要保证buffer能覆盖几十万条完整轨迹否则重标注的优势发挥不出来。3. 手把手落地从论文到可以跑的实验3.1 环境搭建和基线选择我选的是MuJoCo环境机械臂用的是FetchReach和FetchPickAndPlace这两种典型任务。FetchReach是让机械臂末端到达某个目标点相对简单适合快速验证HER代码是否写得对FetchPickAndPlace涉及抓取和移动复杂度高一个量级适合用来验证方法真正的大幅提升。算法层面我推荐用DDPG作为基线上的实现。原因很简单DDPG是off-policy连续控制方法天然的用replay buffer而且结构简单HER和buffer的融合改起来最直观。SAC也可以代码结构上稍微复杂一点但效果通常更好。我自己是从DDPG开始改的——因为入门成本低跑通了再迁移到SAC上也不难。如果你不想从零手写OpenAI的baselines库里有个her的文件夹里面有完整的DQN和DDPG实现。我建议先把它下载下来跑一遍确认环境能出结果然后再对照着理解每个模块怎么工作。我第一次就是急着手搓结果在标准库和第三方库之间来回踩坑浪费了不少时间。3.2 核心代码流程HER应该插在哪一步关键是理解HER在训练循环中的位置。伪代码如下# 伪代码标准DDPG HER训练循环 for episode in range(total_episodes): # 采样一个目标g重置环境 goal sample_initial_goal() obs env.reset(goalgoal) trajectory [] # 用来存(s, a, r, s)序列 for t in range(max_episode_steps): action agent.select_action(obs, goal, noiseTrue) next_obs, reward, done, info env.step(action) trajectory.append((obs, action, reward, next_obs, goal)) obs next_obs if done: break # HER的核心操作从trajectory中生成重标注样本 for t, (obs, action, reward, next_obs, g) in enumerate(trajectory): # 原始目标样本直接存 replay_buffer.add(obs, action, reward, next_obs, g) # 额外生成K个替代目标样本 for _ in range(K): # 从future策略采样目标从t后面任意时间步里随机选一个状态 if stride future: future_t np.random.randint(t1, len(trajectory)) new_goal trajectory[future_t][3] # next_obs作为新目标 new_reward compute_reward(next_obs, new_goal) replay_buffer.add(obs, action, new_reward, next_obs, new_goal) # 用replay_buffer的标准流程更新DDPG for _ in range(num_updates): batch replay_buffer.sample(batch_size) agent.update(batch)注意几个关键点第一compute_reward这个函数必须和原始环境的奖励逻辑保持一致。在FetchReach这类环境里奖励函数通常是判断某个状态比如机械臂末端和目标之间的欧氏距离是否小于阈值如果小于就为1否则为0。重标注时直接调用这个奖励函数即可。千万不要自己再写一套奖励否则整个算法的语义就乱了。第二替代目标采样时选的是next_obs也就是状态转移后的观测不是当前obs。因为Future策略的语义是“从当前状态之后能达到的状态”不能在t时刻就把当前的观测当作目标否则目标永远就在眼前学不到东西。第三当轨迹结束时最后一个时间步的替代目标可以选终态sT本身这样整条轨迹的最后一步就是一个完美的成功样本。对所有早于T的时间步从后续状态里采样。3.3 超参数应该怎么调我的五次实验记录我在这部分花了最多时间因为HER虽然效果好但超参数不像常规强化学习那么直观。下面是我调的几组主要参数和对应效果供大家参考参数经验值说明每条轨迹额外生成样本数K4K太小信息利用不足K太大buffer重复率过高Buffer容量10^6大buffer对HER更重要因为重标注增大了样本量替代目标采样方式future指数加权优于final和随机采样训练更新频率每5条轨迹更新一次更新太频繁容易过拟合当前buffer中的轨迹奖励函数阈值0.05FetchReach阈值越小任务越难建议先跑通大阈值再收紧第一次实验我用的final策略K1结果在FetchReach这种简单任务上效果还可以但在FetchPickAndPlace上训练曲线几乎不动。分析原因是任务复杂只靠终态一个替代目标提供的监督信号不够agent不知道中间过程该怎么走。第二次实验改成future策略K4FetchPickAndPlace的成功率开始稳步上升差不多训练到40万步时能看到明显效果。这里我体会到future策略的“渐进性”非常重要——它是在每一个时间步上都在给agent提供前进方向的信号等于变相提供了一种密集奖励的感觉。第三次实验我把buffer容量从10^5调到10^6发现训练后期稳定性明显提升。原因是容量小的时候早期的“伪成功”样本会被新的失败样本大量冲掉导致agent后半天性对成功的记忆丢失。第四次实验我在替代目标采样时加了指数权重让更靠近末尾的状态更容易被选中。效果是训练曲线的方差变小了最终收敛的成功率比均匀采样高了大概10%。第五次实验我尝试了用SAC替换DDPG发现同样的HER代码在SAC上效果只会更好但SAC调参复杂度高一些建议先把DDPG版本跑通再迁移。3.4 效果评估别只盯着最终成功率评估HER效果时我吃过一个亏只看最终成功率曲线导致我一度以为算法没效果。原因是我的评估逻辑是“跑一次完整的rollout看最后有没有达成目标”但HER训练出来的agent在前期目标是偏向“探索”成功率上升很慢。后来我改成每1000步做一次评估每次评估跑20个episode统计成功比例并且把“部分成功”比如方块被抓起来了但没放到位也单独统计才看到了趋势。这里建议评估时关注两个指标一是最终成功率二是“目标状态的有效覆盖率”即agent在路径上是否能够在一定容差内接近目标。覆盖率提升说明agent学到了趋向目标的能力最终成功率提升说明趋近能力已经细化到可以精确完成任务。两者结合才能正确判断HER是否在发挥作用。4. 实操中踩过的坑和排查实录4.1 重标注目标算错坐标空间训练完全不动我在FetchReach里遇过一个大坑替代目标采样时我把机械臂末端的坐标直接当成了“全局目标位置”但实际上环境里目标点有一个固定的坐标系而且目标点本身有随机偏移。我采样得到的状态是一个相对坐标直接用绝对值去算奖励结果奖励函数永远是0。这个bug花了整整两天才排查出来。排查方法很笨但有效去训练环境里随机采样几千条轨迹直接手动检查“重标注后”的奖励值是不是包含1。如果所有重标注样本的奖励都是0那说明目标采样的坐标空间有问题或者是奖励函数里目标的定义跟状态不匹配。这个测试异常重要可以说是HER代码正确性的金标准。4.2 训练后期成功率涨不上去目标分布太单一另一个常见问题是训练早中期效果不错但到后期成功率卡在30%-50%就不再涨了。我排查后发现原因是我在重标注时用得太集中于轨迹末尾那些“成功状态”导致agent对“真正需要精确达成的目标”产生的成功样本越来越少。换句话说重标注样本的分布和原任务的真实目标分布不匹配。解决办法是在重标注时不仅采样轨迹内部的状态还可以适当混入一些“探索失败状态”但用原始目标g来算奖励——也就是保留一部分失败的原始样本。这样可以让agent继续感知“对原始目标失败”的样子不至于过于乐观。具体做法是每条轨迹存数份原始目标样本且这部分样本比例不低于整体buffer的30%。我在实操中就是这么调的成功率从35%提到了55%左右。4.3 HER替代不了探索更不是万能解药最后必须说一点HER牛逼但它不是替你做探索的。它的作用是让你“已经做过的探索”变得更有价值而不是帮你去新的区域探索。在FetchReach这种简单任务里随机探索很容易覆盖到各种位置HER的威力非常明显但在高难度任务中如果agent的探索始终只停留在初始位置附近那重标注能提供的目标也都在附近它始终学不会“走向远方”的动作。我做了一个验证实验把机械臂的初始位置集中在桌面左下角目标在右上角HER在训练中后期一直无法突破初始区域的限制。后来我在动作空间上加了更大的噪声、让agent有一定概率执行随机重置策略把机械臂移到随机位置探索范围变大之后HER的作用才彻底发挥出来。所以HER和探索强度的关系不是替代而是配合——探索到哪HER就能学到哪。这块的实际经验可以总结成一句话用HER的项目一定要在训练初期把探索强度拉高一点比如动作噪声系数调大等看到覆盖率达到一定水准后再逐步降噪。如果一上来就用小的探索噪声HER的信息量会被源头枯竭卡死。5. 别只背算法HER在不同任务里的适用边界5.1 从逐步目标到长时序任务HER仍然是底层思想随着训练任务的复杂度提高HER本身也在不断演进。比如DIAYN、DCD等算法在做面向目标的无监督探索时常常会借鉴HER的目标重标注思想在分层强化学习中底层策略的目标往往也是由上层用“事后重标注”的方式生成的。这种思想贯穿了整个goal-conditioned RL的发展脉络。我自己的体会是HER最核心的价值不是某个具体代码实现而是提供了一种建模思路不要把经验看作“对与错”而要看它“对什么是对的”。这种思路在做任意稀疏奖励RL项目时都值得保持。5.2 什么时候别用HER离散奖励和状态不可观察时虽然HER很强但也有明确的反例。如果你的任务不是goal-conditioned比如奖励来自一些复杂的外部逻辑例如“是否超过某速度阈值”目标状态很难从轨迹中抽取出来那HER就没有用武之地。另外如果环境状态只有部分可观察比如只有图像但不能直接读取到物体坐标你需要先做一个状态表征提取再把HER叠加在上面否则直接对原始图像做目标重标注计算量大且容易过拟合到像素级别。还有一个隐蔽问题是HER对“目标”的定义必须连续且平滑。在离散控制任务中比如“按某个按钮”这样的任务目标状态是一个离散的标签HER的重标注操作意义有限。这种任务应该考虑使用别的探索策略比如参数噪声、状态计数探索等。写在最后的一个建议HER跑了这么久给我的最大感受是它把一个“失败堆积如山”的问题变成了“失败里找成功”的问题。如果你手头刚好有个稀疏奖励的goal-conditioned强化学习任务我强烈建议你先别急着设计复杂的dense reward或奖励塑形花两天时间把HER加到现有的off-policy算法里。实测下来代码量不大核心改动集中在replay buffer和目标采样上但带来的训练信号增益是非常显著的。跑通之后再去考虑更复杂的变体也不迟。
延伸阅读

更多相关文章

2026/10/3 4:10:07

不说话的AI:工业决策模型的范式革命

1. 项目概述:当“沉默的AI”成为新范式引爆点二十来号人、一个月估值从2亿冲到100亿——这个数字组合放在任何行业都足够刺眼,但真正让整个AI圈集体失语的,不是融资额,而是那个被媒体反复强调的定语:“不说话”的AI。它…

2026/10/3 4:10:07

LeetCode第55题跳跃游戏:从DFS到贪心,一步步优化到O(n)

LeetCode热题100里的第55题“跳跃游戏”,我围观过不少面试记录,这道题出现的频率高得离谱。但有意思的是,评论区里每次都能看到有人争论“到底该跳几步才能最快到终点”,有人说要倒着推,有人说要DFS暴力试,…

2026/10/3 4:05:07

广东速冻设备加工厂实力参考:常兴深冷科技制造厂家推荐

广东地区食品加工、预制菜、水产肉类企业众多,速冻设备作为冷链生产的核心装备,其制造厂家的专业程度直接决定了企业的生产效率与产品品质。选择一家真正有制造实力、有工程经验、有售后保障的速冻设备厂家,是企业控制成本、保障交付、实现合…

2026/10/3 5:05:09

Hypermesh Sets本质:ABAQUS求解器语义的前置声明

1. 为什么Sets不是“随便划个圈”——从ABAQUS求解器底层看Hypermesh建模的逻辑起点在Hypermesh里点几下鼠标创建一个Set,导出inp文件后发现ABAQUS报错“*NSET, NSETPART-1-1”找不到定义,或者明明设置了接触面却始终不生效,又或者提交作业后…

2026/10/3 5:05:09

Agent从Demo到生产:四道坎与工程化解法

搞 Agent 一年多了,我最大的感受就俩字:反差。Demo 阶段像开了挂,你让它查数据、调 API、写周报,它都能干得有模有样,客户看得两眼放光。可真推到生产环境,第一个月就原形毕露:不是超时就是乱答…

2026/10/3 5:05:09

稀疏奖励困境下的救星:HER事后经验回放原理与实战指南

如果你做过机器人抓取、机械臂推箱子或者二维导航方向的强化学习实验,大概率遇到过这种让人上头的场面:训练跑了几十万步,策略还是像个刚学走路的孩子,偶尔蒙对一次目标,回头一看奖励曲线毫无起色,甚至一路…

2026/10/3 5:05:09

深度学习三十年:从冷板凳到工程落地的演进逻辑

1. 这不是一场突然爆发的“AI烟花”,而是一群人三十年如一日在冷板凳上熬出来的火种你刷到过太多标题:“AI一夜爆火”“大模型颠覆一切”“人类要被取代了”——但如果你真去翻过1990年代的《神经网络学报》、查过2003年NIPS会议的录用率、看过2012年Ima…

2026/10/3 5:00:09

从问答到实干:Agent Skills、MCP与LangChain实战指南

1. 从“会用”到“用好”:AI大模型应用的能力分水岭很多人用AI大模型的路径都差不多:打开对话框,输入问题,等它吐出一段文字,复制粘贴,完事。这个阶段我称之为“问答模式”,本质上就是把大模型当…

2026/10/2 8:16:46

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/10/2 18:20:53

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 10:48:55

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/3 0:04:31

国内大学生必备的AI写作辅助软件是哪款?

国内高校学生在论文写作过程中,越来越依赖AI辅助工具提升效率,主流方案以本土化全流程工具为核心,结合通用大模型与专业插件,覆盖选题构思、框架搭建、初稿撰写、查重降重、格式调整等关键环节,本文将深入解析当前主流…

2026/10/3 0:04:31

Codex接入Jev模型完整指南:配置方法、本地部署与踩坑排查

最近不少人在讨论 Codex 搭配 Jev 这套玩法,我一开始没太当回事,直到自己把 Jev 接进 Codex跑了几轮编码任务之后,才明白那些说“直接起飞”的人是怎么想的。Codex 作为工具本身已经够能打了,但模型固定、上下文策略固定&#xff…

2026/10/3 0:04:31

GitHub 热门: NVIDIA/Model-Optimizer

👋 Hi,我擅长 AI 大模型应用落地、意识解码与 AI 开发工具链 。 💡 创业路上,用技术换时间,一起把 AI 变成生产力 🚀 >GitHub 热门: NVIDIA/Model-Optimizer 凌晨两点,你刚把跑通了的 Qwen3.…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑