[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"consumer-news-detail-871":3,"consumer-news-interaction-871":41,"consumer-news-related-871":44},{"detail":4,"item":36},{"card":5,"schemaVersion":23,"fields":24,"content":30},{"id":6,"kind":7,"targetType":8,"targetId":9,"subtype":7,"typeLabel":10,"title":11,"subtitle":12,"summary":13,"coverUrl":14,"badgeText":15,"href":16,"sourceName":12,"meta":17,"metrics":20,"tags":21,"resolved":22},"NEWS_ARTICLE:871","news","NEWS_ARTICLE",871,"资讯","\"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning\" 论文笔记","博客园","清华、浙大与美团 LongCat 团队合作的 AgentOPSD，目前挂在 Arxiv 26.08 上，做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0\u002F1 信号，GRPO 这类方法把轨迹级优势均匀广播到每个 token，无法把成败真正","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F3614753\u002F202609\u002F3614753-20260901141154042-339903878.png","","\u002Fnews\u002F871",[18,19],"2026","人工智能",{},[19],true,"consumer-content-detail-v1",{"sourceName":12,"authorName":25,"categoryName":19,"summary":13,"description":13,"publishTime":26,"updateTime":27,"sourceUrl":28,"language":29},"绵满","2026-09-01T14:14","2026-09-02T20:37:52","https:\u002F\u002Fwww.cnblogs.com\u002Fmianmaner\u002Fp\u002F22789737","中文",{"format":31,"policy":32,"normalized":22,"html":33,"text":34,"wordCount":35,"hasBody":22},"HTML","NEWS_CONTENT_V1","\u003Cp>清华、浙大与美团 LongCat 团队合作的 \u003Cstrong>AgentOPSD\u003C\u002Fstrong>，目前挂在 \u003Cstrong>Arxiv 26.08\u003C\u002Fstrong> 上，做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0\u002F1 信号，GRPO 这类方法把轨迹级优势均匀广播到每个 token，无法把成败真正归因到那几个关键决策，交互步数越长，这个问题越严重\u003C\u002Fp>\n\u003Cp>这篇工作的核心主张是：一个回合的信用不该由它自身孤立的局部信号决定，而应看这个信号把\"最终成功\"的估计概率改变了多少。作者把每回合的自蒸馏差距解释成一次贝叶斯信念更新的新证据，在对数几率空间里递归维护一个\"轨迹成功信念\"，再把这个信念的边际修正量当作回合级信用，重塑 GRPO 的优势。整个过程不需要额外 rollout，也不需要学习一个 critic，只多一次 teacher 前向\u003C\u002Fp>\n\u003Ch2>背景\u003C\u002Fh2>\n\u003Cp>多轮 Agent 与静态单轮推理不同，它要持续和部分可观测的环境交互，每一步根据当前观测行动、环境再转移到新观测。同一条轨迹里的决策作用差异很大：成功轨迹里也可能有冗余、误导性的动作，失败轨迹里也可能藏着有用的推理。GRPO 及其 Agent 变体从结果奖励构造轨迹级优势，然后均匀地广播到整条轨迹的每个 token，这种统一信用无法把少数关键决策和常规操作区分开，而且交互 horizon 越长问题越突出，所以回合级信用分配对识别真正影响结果的决策很关键\u003C\u002Fp>\n\u003Cp>另一条互补路线提供更稠密的 token 级监督。On-policy distillation 让学生在自己的 rollout 上向 teacher 学习，自蒸馏变体（OPSD）则通过让同一个策略额外条件在\"仅训练时可见的特权信息\"上，省掉了单独的 teacher。但把 OPSD 直接用到 Agentic RL 上有两个错配：\u003C\u002Fp>\n\u003Cul>\n \u003Cli>\u003Cp>OPSD 的 token 级信号和 Agent 交互天然不对齐，多个 token 共同构成一个动作，环境只在回合边界响应\u003C\u002Fp>\u003C\u002Fli>\n \u003Cli>\u003Cp>现有的 step-aware 方法即便按步来看，也是孤立地给每一步打分，没有考虑此前交互累积下来的证据\u003C\u002Fp>\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>由此中心难题是把孤立的局部 OPSD 信号转化为依赖历史的回合级信用\u003C\u002Fp>\n\u003Ch2>方法\u003C\u002Fh2>\n\u003Cp>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F3614753\u002F202609\u002F3614753-20260901141154042-339903878.png?w=720&amp;quality=65&amp;strip=all\" alt=\"image\">\u003C\u002Fp>\n\u003Ch3>\u003Cstrong>问题设定与 GRPO 基线\u003C\u002Fstrong>\u003C\u002Fh3>\n\u003Cp>给定任务 \u003Cspan>\\(x\\)\u003C\u002Fspan> 和初始观测 \u003Cspan>\\(o_0\\)\u003C\u002Fspan>，Agent 从 \u003Cspan>\\(s_1=(x,o_0)\\)\u003C\u002Fspan> 出发。第 \u003Cspan>\\(k\\)\u003C\u002Fspan> 回合按当前策略采样动作 \u003Cspan>\\(a_k=(y_{k,1},\\dots,y_{k,L_k})\\sim\\pi_\\theta(\\cdot\\mid s_k)\\)\u003C\u002Fspan>，\u003Cspan>\\(s_k\\)\u003C\u002Fspan> 是可见的交互历史、\u003Cspan>\\(L_k\\)\u003C\u002Fspan> 是动作长度，观测到 \u003Cspan>\\(o_k\\)\u003C\u002Fspan> 后历史变为 \u003Cspan>\\(s_{k+1}=(s_k,a_k,o_k)\\)\u003C\u002Fspan>，一条 \u003Cspan>\\(K\\)\u003C\u002Fspan> 回合的轨迹 \u003Cspan>\\(\\tau\\)\u003C\u002Fspan> 结束后拿到二元奖励 \u003Cspan>\\(R(\\tau)\\)\u003C\u002Fspan>。GRPO 对每个任务采样 \u003Cspan>\\(G\\)\u003C\u002Fspan> 条轨迹，用组内奖励的均值与标准差算出序列级优势，并把它赋给该轨迹里每一个 token，回合级信用始终没解决\u003C\u002Fp>\n\u003Ch3>\u003Cstrong>从结果贡献到贝叶斯回合证据\u003C\u002Fstrong>\u003C\u002Fh3>\n\u003Cp>直接度量第 \u003Cspan>\\(k\\)\u003C\u002Fspan> 回合的反事实贡献，需要对 \u003Cspan>\\(a_k\\)\u003C\u002Fspan> 之后所有可能的后续做边际化，长程交互下不可行。作者改用事后（hindsight）的证据视角：记 \u003Cspan>\\(C\\)\u003C\u002Fspan> 为\"轨迹最终成功\"这一事件，若 \u003Cspan>\\(a_k\\)\u003C\u002Fspan> 有助于成功，它就应该更像成功行为、而不像失败行为，贝叶斯规则把信念的变化写成动作侧的似然比：\u003C\u002Fp>\n\n\u003Cdiv>\n \\[\\text{logit}\\, p(C \\mid s_k, a_k) - \\text{logit}\\, p(C \\mid s_k) = \\log \\frac{p(a_k \\mid s_k, C)}{p(a_k \\mid s_k, \\neg C)} \\]\n\u003C\u002Fdiv>\n\n\u003Cp>右边是理想的 Bayes factor，符号表示这个动作增加还是减少对最终成功的支持。由于结果条件分布拿不到，作者用一个可计算的每回合自蒸馏对比来事后估计它：让同一个策略分别在\"特权成功相关的 self-teacher\"和\"标准学生\"两种上下文下，对同一个学生生成的动作打分。两者的 token 上下文为 \u003Cspan>\\(h_{k,t}=(s_k,y_{k,&lt;t})\\)\u003C\u002Fspan> 与 \u003Cspan>\\(h^+_{k,t}=(s_k,c^+,y_{k,&lt;t})\\)\u003C\u002Fspan>，其中 \u003Cspan>\\(c^+\\)\u003C\u002Fspan> 是仅训练时检索到的、描述有用子目标与动作模式的 skill\u003C\u002Fp>\n\u003Cp>对每个 token 定义 detached 的似然比 \u003Cspan>\\(\\delta_{k,t} = \\log \\pi_\\theta(y_{k,t}\\mid h^+_{k,t}) - \\log \\pi_\\theta(y_{k,t}\\mid h_{k,t})\\)\u003C\u002Fspan>，\u003Cspan>\\(\\delta_{k,t}&gt;0\\)\u003C\u002Fspan> 说明 \u003Cspan>\\(c^+\\)\u003C\u002Fspan> 提高了该 token 的似然。对回合内 \u003Cspan>\\(L_k\\)\u003C\u002Fspan> 个 token 求和，得到回合级证据：\u003C\u002Fp>\n\n\u003Cdiv>\n \\[e_k = \\sum_{t=1}^{L_k} \\delta_{k,t} = \\log \\frac{\\pi_\\theta(a_k \\mid s_k, c^+)}{\\pi_\\theta(a_k \\mid s_k)} \\]\n\u003C\u002Fdiv>\n\n\u003Cp>附录证明了在两个假设下 \u003Cspan>\\(e_k\\)\u003C\u002Fspan> 是理想 Bayes factor 的可计算近似，且始终保持符号一致（\u003Cspan>\\(\\text{sign}(e_k)=\\text{sign}(\\mathcal{B}_k)\\)\u003C\u002Fspan>），AgentOPSD 只用到它的符号与排序，因此把 \u003Cspan>\\(e_k\\)\u003C\u002Fspan> 当作一个 tractable 的贝叶斯启发式证据代理\u003C\u002Fp>\n\u003Ch3>\u003Cstrong>递归信念更新\u003C\u002Fstrong>\u003C\u002Fh3>\n\u003Cp>上一步得到的 \u003Cspan>\\(e_k\\)\u003C\u002Fspan> 只是一个孤立分数，看不出这条证据在前面回合的基础上到底关不关键。作者的办法是维护一个\"这条轨迹最终会成功\"的信念 \u003Cspan>\\(B_k\\)\u003C\u002Fspan>，每个回合就看它把这个信念推动了多少\u003C\u002Fp>\n\u003Cp>信念的起点 \u003Cspan>\\(B_0\\)\u003C\u002Fspan> 取组内成功率 \u003Cspan>\\(\\bar{R}=S\u002FG\\)\u003C\u002Fspan>，也就是这一批采样轨迹里成功的比例；之后每个回合把自己的证据 \u003Cspan>\\(e_k\\)\u003C\u002Fspan> 累加进来，越早的回合按衰减因子 \u003Cspan>\\(\\gamma\\)\u003C\u002Fspan> 逐渐淡出：\u003C\u002Fp>\n\n\u003Cdiv>\n \\[B_0 = \\text{clip}(\\bar{R},\\, \\epsilon_0,\\, 1-\\epsilon_0), \\qquad c_k = \\gamma\\, c_{k-1} + e_k, \\qquad B_k = \\sigma\\big(\\text{logit}(B_0) + c_k\\big) \\]\n\u003C\u002Fdiv>\n\n\u003Cp>\u003Cspan>\\(c_k\\)\u003C\u002Fspan> 是带衰减的证据累加值，外面套一个 sigmoid 把它压回 0 到 1 之间的信念，\u003Cspan>\\(\\gamma\\)\u003C\u002Fspan> 越小，久远回合的影响消退得越快。一个回合有多重要，就看它让信念动了多少：\u003C\u002Fp>\n\n\u003Cdiv>\n \\[\\Delta B_k = B_k - B_{k-1} \\approx B_{k-1}(1 - B_{k-1})\\big(e_k - (1-\\gamma)c_{k-1}\\big) \\]\n\u003C\u002Fdiv>\n\n\u003Cp>前面的系数 \u003Cspan>\\(B_{k-1}(1-B_{k-1})\\)\u003C\u002Fspan> 说明：信念还半信半疑（接近 0.5）时，一条证据能撬动的幅度最大；等信念已经笃定成功或失败，再多的证据也几乎改不动。更新在回合边界进行，逐 token 的版本只用于消融对比\u003C\u002Fp>\n\u003Ch3>\u003Cstrong>结果对齐信用与有界优势重塑\u003C\u002Fstrong>\u003C\u002Fh3>\n\u003Cp>有了每个回合的信念变化 \u003Cspan>\\(\\Delta B_k\\)\u003C\u002Fspan>，还要给它定个方向。方向由这条轨迹最终是成功还是失败决定（即验证器给的结果），大小则用信念被推动的幅度：\u003Cspan>\\(q_k = \\text{sign}(A_{\\text{seq}})\\,\\Delta B_k\\)\u003C\u002Fspan>。这样一来，成功轨迹里把信念往上推的回合、失败轨迹里把信念往下压的回合，都会拿到正的信用\u003C\u002Fp>\n\u003Cp>不过 \u003Cspan>\\(q_k\\)\u003C\u002Fspan> 只用来调节 GRPO 优势的大小。对每条轨迹，先把它各回合的 \u003Cspan>\\(q_k\\)\u003C\u002Fspan> 在轨迹内部标准化，再转成一个乘子 \u003Cspan>\\(w_k\\)\u003C\u002Fspan>：\u003C\u002Fp>\n\n\u003Cdiv>\n \\[z_k = \\frac{q_k - \\mu_q}{\\sigma_q + \\epsilon_0}, \\qquad w_k = \\text{clip}(1 + b z_k,\\, 1-b,\\, 1+b) \\]\n\u003C\u002Fdiv>\n\n\n\u003Cdiv>\n \\[\\widetilde{A}_k = A_{\\text{seq}}\\big[(1-\\lambda) + \\lambda w_k\\big], \\qquad b\\in(0,1),\\ \\lambda\\in[0,1] \\]\n\u003C\u002Fdiv>\n\n\u003Cp>乘子 \u003Cspan>\\(w_k\\)\u003C\u002Fspan> 被夹在 \u003Cspan>\\([1-b,\\,1+b]\\)\u003C\u002Fspan> 之间且恒为正，所以它只会把信用高的回合放大一点、信用低的回合缩小一点，绝不会把 GRPO 优势的正负号翻过来。\u003Cspan>\\(b\\)\u003C\u002Fspan> 决定放大缩小的幅度，\u003Cspan>\\(\\lambda\\)\u003C\u002Fspan> 决定整体重塑的强度，\u003Cspan>\\(\\lambda=0\\)\u003C\u002Fspan> 时 \u003Cspan>\\(\\widetilde{A}_k\\)\u003C\u002Fspan> 就等于原始的 \u003Cspan>\\(A_{\\text{seq}}\\)\u003C\u002Fspan>，完全退回 GRPO。每个 token 继承它所在回合的 \u003Cspan>\\(\\widetilde{A}\\)\u003C\u002Fspan>，代入裁剪的 GRPO 目标：\u003C\u002Fp>\n\n\u003Cdiv>\n \\[\\mathcal{L}_{\\text{AgentOPSD}}(\\theta) = -\\frac{1}{G}\\sum_{i=1}^{G}\\frac{1}{\\sum_t M_{i,t}}\\sum_t M_{i,t}\\min\\!\\Big(r_{i,t}\\widetilde{A}^{(i)}_{\\kappa_i(t)},\\ \\text{clip}(r_{i,t}, 1-\\varepsilon, 1+\\varepsilon)\\widetilde{A}^{(i)}_{\\kappa_i(t)}\\Big) + \\beta \\mathcal{L}_{\\text{KL}} \\]\n\u003C\u002Fdiv>\n\n\u003Cp>整套方法不额外加蒸馏损失，self-teacher 只提供不回传梯度的信号，唯一通过重塑后的 \u003Cspan>\\(\\widetilde{A}\\)\u003C\u002Fspan> 起作用。相比 GRPO，代价仅是每条轨迹多一次 teacher 前向，信念重塑都是逐元素的简单运算，不加 rollout、不加可学习参数\u003C\u002Fp>\n\u003Ch2>实验\u003C\u002Fh2>\n\u003Cp>在三个多轮交互环境上评测：\u003Cstrong>ALFWorld\u003C\u002Fstrong>（文本具身，六类家务任务）、\u003Cstrong>Search-QA\u003C\u002Fstrong>（Search-R1 设定，NQ、TriviaQA、HotpotQA 等七个数据集）、\u003Cstrong>WebShop\u003C\u002Fstrong>（在线购物，128 个固定验证任务）。骨干用 Qwen2.5-3B\u002F7B-Instruct，8×H800 训练，特权 skill 只在训练时按关键词检索注入，推理时不用任何外部 skill。对比方法覆盖训练无关（Vanilla、Skill-Prompt）、组相对 RL（GRPO、Skill-GRPO）、自蒸馏 RL（OPSD、GRPO+OPSD、Skill-SD、RLSD、SDAR、StepOPSD）三组，所有方法共享同一骨干、数据与预算\u003C\u002Fp>\n\u003Ch3>\u003Cstrong>主要结果\u003C\u002Fstrong>\u003C\u002Fh3>\n\u003Cp>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F3614753\u002F202609\u002F3614753-20260901141224425-20961927.png?w=720&amp;quality=65&amp;strip=all\" alt=\"image\">\u003C\u002Fp>\n\u003Cp>Qwen2.5-7B 上 AgentOPSD 在 ALFWorld 达到 \u003Cstrong>89.1%\u003C\u002Fstrong> 平均成功率，Search-QA 49.2%、WebShop 90.2\u002F79.7。关键论点是\"收益来自信用构造而非特权访问\"：AgentOPSD 与特权基线用同一批检索 skill，差别只在于 teacher-student 差距如何进入学习，而它在八个跨规模聚合对比里全面超过 GRPO+OPSD、Skill-SD、RLSD，在八个里六个超过 SDAR，且推理阶段完全不用 skill。这说明孤立的局部 teacher-student 差距还不是可靠的信用信号，把差距累进信念状态、再按信念修正来赋信用，才能更好地找出真正改变结果的回合\u003C\u002Fp>\n\u003Ch3>\u003Cstrong>随交互步数增长的鲁棒性\u003C\u002Fstrong>\u003C\u002Fh3>\n\u003Cp>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F3614753\u002F202609\u002F3614753-20260901141417320-286220258.png?w=720&amp;quality=65&amp;strip=all\" alt=\"image\">\u003C\u002Fp>\n\u003Cp>AgentOPSD 面向的正是\"均匀信用最有害\"的长程场景。作者用每子任务成功率对成功轨迹平均回合数做回归，看每多一个回合掉多少成功点：均匀信用的方法掉得最快（RLSD 每回合 \u003Cspan>\\(-3.59\\)\u003C\u002Fspan>、GRPO \u003Cspan>\\(-2.91\\)\u003C\u002Fspan>），而 AgentOPSD 最平，只有 \u003Cspan>\\(-0.54\\)\u003C\u002Fspan>。轨迹越长，单一广播优势要覆盖的决策越多，依赖历史的信念修正就越有用\u003C\u002Fp>\n\u003Ch3>\u003Cstrong>超参数敏感性\u003C\u002Fstrong>\u003C\u002Fh3>\n\u003Cp>单独扫每个旋钮、其余固定在 \u003Cspan>\\(\\lambda=0.5,\\gamma=0.95,\\epsilon_{\\text{high}}=0.24\\)\u003C\u002Fspan>。重塑权重 \u003Cspan>\\(\\lambda\\)\u003C\u002Fspan> 效果最清晰，\u003Cspan>\\(\\lambda=0.5\\)\u003C\u002Fspan> 最好、更小的值都变差；证据衰减 \u003Cspan>\\(\\gamma\\)\u003C\u002Fspan> 在 \u003Cspan>\\(\\{1.0,0.95,0.9,0.8\\}\\)\u003C\u002Fspan> 内波动只有几个点、无单调趋势，说明对旧证据折扣多快不敏感，主结果统一用温和的 \u003Cspan>\\(\\gamma=0.95\\)\u003C\u002Fspan>；策略裁剪 \u003Cspan>\\(\\epsilon_{\\text{high}}\\)\u003C\u002Fspan> 几乎无影响，重塑后的目标继承了 GRPO 的信赖域鲁棒性\u003C\u002Fp>\n\u003Ch2>总结\u003C\u002Fh2>\n\u003Cp>AgentOPSD 的核心贡献是把回合级信用形式化为\"每个回合对成功信念的修正量\"：在对数几率空间里，把每回合的自蒸馏差距接到一个递归贝叶斯更新上，从而说明孤立的自蒸馏差距本身并不是顺序信用。它把 token 级 teacher-student 差距在回合边界聚合成对齐环境的证据，再让证据在轨迹成功信念里递归传播，不需额外 rollout 或学习 critic\u003C\u002Fp>\n\u003Cp>个人看来，这套方法最巧的一点是\"符号来自验证器、幅度来自信念修正\"的分工，配合恒正的有界乘子既能重分配信用又不翻转 GRPO 方向，工程上只多一次 teacher 前向、几乎零额外成本，落地代价很低。消融里\"去掉 \u003Cspan>\\(B_0\\)\u003C\u002Fspan> 锚定掉到 78.9\"和\"只留幅度掉到 80.5\"说明性能相当依赖先验锚定与结果符号这两个较\"外部\"的信号，递归本身带来的净增益（82.8→89.1 里含粒度等多项）值得进一步拆分确认；此外证据 \u003Cspan>\\(e_k\\)\u003C\u002Fspan> 依赖训练时可检索的特权 skill \u003Cspan>\\(c^+\\)\u003C\u002Fspan>，在没有高质量 skill 库的任务上能否复现同样收益，还需要更多验证\u003C\u002Fp>\n\u003Cblockquote>\n \u003Cp>\u003Cstrong>PDF 链接：\u003C\u002Fstrong>\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05987\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05987\u003C\u002Fa>\u003C\u002Fp>\n \u003Cp>\u003Cstrong>Github 链接：\u003C\u002Fstrong>\u003Ca href=\"https:\u002F\u002Fgithub.com\u002FZethWang\u002FAgentOPSD\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fgithub.com\u002FZethWang\u002FAgentOPSD\u003C\u002Fa>\u003C\u002Fp>\n\u003C\u002Fblockquote>","清华、浙大与美团 LongCat 团队合作的 AgentOPSD，目前挂在 Arxiv 26.08 上，做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0\u002F1 信号，GRPO 这类方法把轨迹级优势均匀广播到每个 token，无法把成败真正归因到那几个关键决策，交互步数越长，这个问题越严重 这篇工作的核心主张是：一个回合的信用不该由它自身孤立的局部信号决定，而应看这个信号把\"最终成功\"的估计概率改变了多少。作者把每回合的自蒸馏差距解释成一次贝叶斯信念更新的新证据，在对数几率空间里递归维护一个\"轨迹成功信念\"，再把这个信念的边际修正量当作回合级信用，重塑 GRPO 的优势。整个过程不需要额外 rollout，也不需要学习一个 critic，只多一次 teacher 前向 背景 多轮 Agent 与静态单轮推理不同，它要持续和部分可观测的环境交互，每一步根据当前观测行动、环境再转移到新观测。同一条轨迹里的决策作用差异很大：成功轨迹里也可能有冗余、误导性的动作，失败轨迹里也可能藏着有用的推理。GRPO 及其 Agent 变体从结果奖励构造轨迹级优势，然后均匀地广播到整条轨迹的每个 token，这种统一信用无法把少数关键决策和常规操作区分开，而且交互 horizon 越长问题越突出，所以回合级信用分配对识别真正影响结果的决策很关键 另一条互补路线提供更稠密的 token 级监督。On-policy distillation 让学生在自己的 rollout 上向 teacher 学习，自蒸馏变体（OPSD）则通过让同一个策略额外条件在\"仅训练时可见的特权信息\"上，省掉了单独的 teacher。但把 OPSD 直接用到 Agentic RL 上有两个错配： OPSD 的 token 级信号和 Agent 交互天然不对齐，多个 token 共同构成一个动作，环境只在回合边界响应 现有的 step-aware 方法即便按步来看，也是孤立地给每一步打分，没有考虑此前交互累积下来的证据 由此中心难题是把孤立的局部 OPSD 信号转化为依赖历史的回合级信用 方法 问题设定与 GRPO 基线 给定任务 \\(x\\) 和初始观测 \\(o_0\\)，Agent 从 \\(s_1=(x,o_0)\\) 出发。第 \\(k\\) 回合按当前策略采样动作 \\(a_k=(y_{k,1},\\dots,y_{k,L_k})\\sim\\pi_\\theta(\\cdot\\mid s_k)\\)，\\(s_k\\) 是可见的交互历史、\\(L_k\\) 是动作长度，观测到 \\(o_k\\) 后历史变为 \\(s_{k+1}=(s_k,a_k,o_k)\\)，一条 \\(K\\) 回合的轨迹 \\(\\tau\\) 结束后拿到二元奖励 \\(R(\\tau)\\)。GRPO 对每个任务采样 \\(G\\) 条轨迹，用组内奖励的均值与标准差算出序列级优势，并把它赋给该轨迹里每一个 token，回合级信用始终没解决 从结果贡献到贝叶斯回合证据 直接度量第 \\(k\\) 回合的反事实贡献，需要对 \\(a_k\\) 之后所有可能的后续做边际化，长程交互下不可行。作者改用事后（hindsight）的证据视角：记 \\(C\\) 为\"轨迹最终成功\"这一事件，若 \\(a_k\\) 有助于成功，它就应该更像成功行为、而不像失败行为，贝叶斯规则把信念的变化写成动作侧的似然比： \\[\\text{logit}\\, p(C \\mid s_k, a_k) - \\text{logit}\\, p(C \\mid s_k) = \\log \\frac{p(a_k \\mid s_k, C)}{p(a_k \\mid s_k, \\neg C)} \\] 右边是理想的 Bayes factor，符号表示这个动作增加还是减少对最终成功的支持。由于结果条件分布拿不到，作者用一个可计算的每回合自蒸馏对比来事后估计它：让同一个策略分别在\"特权成功相关的 self-teacher\"和\"标准学生\"两种上下文下，对同一个学生生成的动作打分。两者的 token 上下文为 \\(h_{k,t}=(s_k,y_{k,\u003Ct})\\) 与 \\(h^+_{k,t}=(s_k,c^+,y_{k,\u003Ct})\\)，其中 \\(c^+\\) 是仅训练时检索到的、描述有用子目标与动作模式的 skill 对每个 token 定义 detached 的似然比 \\(\\delta_{k,t} = \\log \\pi_\\theta(y_{k,t}\\mid h^+_{k,t}) - \\log \\pi_\\theta(y_{k,t}\\mid h_{k,t})\\)，\\(\\delta_{k,t}>0\\) 说明 \\(c^+\\) 提高了该 token 的似然。对回合内 \\(L_k\\) 个 token 求和，得到回合级证据： \\[e_k = \\sum_{t=1}^{L_k} \\delta_{k,t} = \\log \\frac{\\pi_\\theta(a_k \\mid s_k, c^+)}{\\pi_\\theta(a_k \\mid s_k)} \\] 附录证明了在两个假设下 \\(e_k\\) 是理想 Bayes factor 的可计算近似，且始终保持符号一致（\\(\\text{sign}(e_k)=\\text{sign}(\\mathcal{B}_k)\\)），AgentOPSD 只用到它的符号与排序，因此把 \\(e_k\\) 当作一个 tractable 的贝叶斯启发式证据代理 递归信念更新 上一步得到的 \\(e_k\\) 只是一个孤立分数，看不出这条证据在前面回合的基础上到底关不关键。作者的办法是维护一个\"这条轨迹最终会成功\"的信念 \\(B_k\\)，每个回合就看它把这个信念推动了多少 信念的起点 \\(B_0\\) 取组内成功率 \\(\\bar{R}=S\u002FG\\)，也就是这一批采样轨迹里成功的比例；之后每个回合把自己的证据 \\(e_k\\) 累加进来，越早的回合按衰减因子 \\(\\gamma\\) 逐渐淡出： \\[B_0 = \\text{clip}(\\bar{R},\\, \\epsilon_0,\\, 1-\\epsilon_0), \\qquad c_k = \\gamma\\, c_{k-1} + e_k, \\qquad B_k = \\sigma\\big(\\text{logit}(B_0) + c_k\\big) \\] \\(c_k\\) 是带衰减的证据累加值，外面套一个 sigmoid 把它压回 0 到 1 之间的信念，\\(\\gamma\\) 越小，久远回合的影响消退得越快。一个回合有多重要，就看它让信念动了多少： \\[\\Delta B_k = B_k - B_{k-1} \\approx B_{k-1}(1 - B_{k-1})\\big(e_k - (1-\\gamma)c_{k-1}\\big) \\] 前面的系数 \\(B_{k-1}(1-B_{k-1})\\) 说明：信念还半信半疑（接近 0.5）时，一条证据能撬动的幅度最大；等信念已经笃定成功或失败，再多的证据也几乎改不动。更新在回合边界进行，逐 token 的版本只用于消融对比 结果对齐信用与有界优势重塑 有了每个回合的信念变化 \\(\\Delta B_k\\)，还要给它定个方向。方向由这条轨迹最终是成功还是失败决定（即验证器给的结果），大小则用信念被推动的幅度：\\(q_k = \\text{sign}(A_{\\text{seq}})\\,\\Delta B_k\\)。这样一来，成功轨迹里把信念往上推的回合、失败轨迹里把信念往下压的回合，都会拿到正的信用 不过 \\(q_k\\) 只用来调节 GRPO 优势的大小。对每条轨迹，先把它各回合的 \\(q_k\\) 在轨迹内部标准化，再转成一个乘子 \\(w_k\\)： \\[z_k = \\frac{q_k - \\mu_q}{\\sigma_q + \\epsilon_0}, \\qquad w_k = \\text{clip}(1 + b z_k,\\, 1-b,\\, 1+b) \\] \\[\\widetilde{A}_k = A_{\\text{seq}}\\big[(1-\\lambda) + \\lambda w_k\\big], \\qquad b\\in(0,1),\\ \\lambda\\in[0,1] \\] 乘子 \\(w_k\\) 被夹在 \\([1-b,\\,1+b]\\) 之间且恒为正，所以它只会把信用高的回合放大一点、信用低的回合缩小一点，绝不会把 GRPO 优势的正负号翻过来。\\(b\\) 决定放大缩小的幅度，\\(\\lambda\\) 决定整体重塑的强度，\\(\\lambda=0\\) 时 \\(\\widetilde{A}_k\\) 就等于原始的 \\(A_{\\text{seq}}\\)，完全退回 GRPO。每个 token 继承它所在回合的 \\(\\widetilde{A}\\)，代入裁剪的 GRPO 目标： \\[\\mathcal{L}_{\\text{AgentOPSD}}(\\theta) = -\\frac{1}{G}\\sum_{i=1}^{G}\\frac{1}{\\sum_t M_{i,t}}\\sum_t M_{i,t}\\min\\!\\Big(r_{i,t}\\widetilde{A}^{(i)}_{\\kappa_i(t)},\\ \\text{clip}(r_{i,t}, 1-\\varepsilon, 1+\\varepsilon)\\widetilde{A}^{(i)}_{\\kappa_i(t)}\\Big) + \\beta \\mathcal{L}_{\\text{KL}} \\] 整套方法不额外加蒸馏损失，self-teacher 只提供不回传梯度的信号，唯一通过重塑后的 \\(\\widetilde{A}\\) 起作用。相比 GRPO，代价仅是每条轨迹多一次 teacher 前向，信念重塑都是逐元素的简单运算，不加 rollout、不加可学习参数 实验 在三个多轮交互环境上评测：ALFWorld（文本具身，六类家务任务）、Search-QA（Search-R1 设定，NQ、TriviaQA、HotpotQA 等七个数据集）、WebShop（在线购物，128 个固定验证任务）。骨干用 Qwen2.5-3B\u002F7B-Instruct，8×H800 训练，特权 skill 只在训练时按关键词检索注入，推理时不用任何外部 skill。对比方法覆盖训练无关（Vanilla、Skill-Prompt）、组相对 RL（GRPO、Skill-GRPO）、自蒸馏 RL（OPSD、GRPO+OPSD、Skill-SD、RLSD、SDAR、StepOPSD）三组，所有方法共享同一骨干、数据与预算 主要结果 Qwen2.5-7B 上 AgentOPSD 在 ALFWorld 达到 89.1% 平均成功率，Search-QA 49.2%、WebShop 90.2\u002F79.7。关键论点是\"收益来自信用构造而非特权访问\"：AgentOPSD 与特权基线用同一批检索 skill，差别只在于 teacher-student 差距如何进入学习，而它在八个跨规模聚合对比里全面超过 GRPO+OPSD、Skill-SD、RLSD，在八个里六个超过 SDAR，且推理阶段完全不用 skill。这说明孤立的局部 teacher-student 差距还不是可靠的信用信号，把差距累进信念状态、再按信念修正来赋信用，才能更好地找出真正改变结果的回合 随交互步数增长的鲁棒性 AgentOPSD 面向的正是\"均匀信用最有害\"的长程场景。作者用每子任务成功率对成功轨迹平均回合数做回归，看每多一个回合掉多少成功点：均匀信用的方法掉得最快（RLSD 每回合 \\(-3.59\\)、GRPO \\(-2.91\\)），而 AgentOPSD 最平，只有 \\(-0.54\\)。轨迹越长，单一广播优势要覆盖的决策越多，依赖历史的信念修正就越有用 超参数敏感性 单独扫每个旋钮、其余固定在 \\(\\lambda=0.5,\\gamma=0.95,\\epsilon_{\\text{high}}=0.24\\)。重塑权重 \\(\\lambda\\) 效果最清晰，\\(\\lambda=0.5\\) 最好、更小的值都变差；证据衰减 \\(\\gamma\\) 在 \\(\\{1.0,0.95,0.9,0.8\\}\\) 内波动只有几个点、无单调趋势，说明对旧证据折扣多快不敏感，主结果统一用温和的 \\(\\gamma=0.95\\)；策略裁剪 \\(\\epsilon_{\\text{high}}\\) 几乎无影响，重塑后的目标继承了 GRPO 的信赖域鲁棒性 总结 AgentOPSD 的核心贡献是把回合级信用形式化为\"每个回合对成功信念的修正量\"：在对数几率空间里，把每回合的自蒸馏差距接到一个递归贝叶斯更新上，从而说明孤立的自蒸馏差距本身并不是顺序信用。它把 token 级 teacher-student 差距在回合边界聚合成对齐环境的证据，再让证据在轨迹成功信念里递归传播，不需额外 rollout 或学习 critic 个人看来，这套方法最巧的一点是\"符号来自验证器、幅度来自信念修正\"的分工，配合恒正的有界乘子既能重分配信用又不翻转 GRPO 方向，工程上只多一次 teacher 前向、几乎零额外成本，落地代价很低。消融里\"去掉 \\(B_0\\) 锚定掉到 78.9\"和\"只留幅度掉到 80.5\"说明性能相当依赖先验锚定与结果符号这两个较\"外部\"的信号，递归本身带来的净增益（82.8→89.1 里含粒度等多项）值得进一步拆分确认；此外证据 \\(e_k\\) 依赖训练时可检索的特权 skill \\(c^+\\)，在没有高质量 skill 库的任务上能否复现同样收益，还需要更多验证 PDF 链接：https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05987 Github 链接：https:\u002F\u002Fgithub.com\u002FZethWang\u002FAgentOPSD",5363,{"id":6,"kind":7,"title":11,"summary":13,"image":14,"href":16,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":40},"2026 · 人工智能","#2563eb","16 \u002F 10",[19],{"targetType":8,"targetId":9,"likedByMe":42,"likeCount":43,"commentCount":43,"contentLikeCount":43,"contentCommentCount":43,"sourceLikeCount":43,"sourceCommentCount":43},false,0,[45,52,59,66,72,78,85,92],{"id":46,"kind":7,"title":47,"summary":48,"image":49,"href":50,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":51},"NEWS_ARTICLE:827","MHS 三部曲（下）：谁允许 AI 行动？——权力、合规与中国厂商的答卷","我们总在等待一个像 ChatGPT 那样的机器人时刻。但具身智能真正的拐点，也许先发生在更不起眼的地方：一台陌生设备，第一次能把自己的能力、状态和边界完整告诉 AI；一个 Agent，第一次能把试出来的经验固化成可验证、可复用的机器技能。","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F510\u002F202608\u002F510-20260830153745229-1536981088.jpg","\u002Fnews\u002F827",[19],{"id":53,"kind":7,"title":54,"summary":55,"image":56,"href":57,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":58},"NEWS_ARTICLE:835","体验向量数据库 qdrant","作者:张富春(ahfuzhang)，转载时请注明作者和引用链接，谢谢！ cnblogs博客 zhihu Github 公众号:一本正经的瞎扯 背景 为了早点搞懂公司的百万行 C# 的祖传代码，我想在缺乏文档、缺乏帮手的情况下，先建立一个 企业知识库 来快速帮我理清头绪。 一开始，我是打算以 weav","https:\u002F\u002Fimg2022.cnblogs.com\u002Fblog\u002F1457949\u002F202202\u002F1457949-20220216153819145-1193738712.png","\u002Fnews\u002F835",[19],{"id":60,"kind":7,"title":61,"summary":62,"image":63,"href":64,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":65},"NEWS_ARTICLE:853","为什么团队用了 AI 之后，测试质量反而下降了！","一、AI 提效之后，往往先崩的是质量 前两天刷到一篇同行的复盘。 「AI 提效半年后，我们的测试团队规模反而更大了」 用AI 提效半年，人数不降，反而变更多了？ 这位老哥是认真做过团队实践的，观察写得很扎实。提测质量肉眼可见地下滑，需求做漏了，单位时间里测试捞出来的 bug 反而变多，最后测试团队加","https:\u002F\u002Fimage.kjdaohang.com\u002Fimg\u002F20260831223910845.png","\u002Fnews\u002F853",[19],{"id":67,"kind":7,"title":68,"summary":69,"image":15,"href":70,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":71},"NEWS_ARTICLE:856","AI生产力：从效率到工作流重构","当初学专业的笔记还在吗？相信大部分人都没保留，而能力在不断积累和更新，关注和思考的角度在变化，在AI蒸馏我们的同时。也可以用AI的能力，去蒸馏一下魔幻的职场。","\u002Fnews\u002F856",[19],{"id":73,"kind":7,"title":74,"summary":75,"image":15,"href":76,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":77},"NEWS_ARTICLE:861","个体看衰AI，企业加速转型","信息化数字化智能化，十年前的说法在逐步兑现。最后回到一个灵魂拷问：当业务运营更加高效。组织间的协作更加流畅，企业究竟想去拓宽市场，还是手起刀落降低成本？","\u002Fnews\u002F861",[19],{"id":79,"kind":7,"title":80,"summary":81,"image":82,"href":83,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":84},"NEWS_ARTICLE:864","阿里开源：skill-up，一款Agent Skill 评测工具！","2026 年走到现在，Agent Skill 已经成了 AI 领域的标配。 把个人经验沉淀成 SKILL.md，把团队最佳实践封装成可复用的技能包，这些都已经是很常规的操作了。最近在社区上看到有篇文章问了一个特别扎心的问题。 「一个 Skill 的『好坏』，到底由谁定义？评判它的标准又是什么？」 这","https:\u002F\u002Fimage.kjdaohang.com\u002Fimg\u002F20260831105634380.png","\u002Fnews\u002F864",[19],{"id":86,"kind":7,"title":87,"summary":88,"image":89,"href":90,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":91},"NEWS_ARTICLE:868","DeepSeekHarness-MCP-Manager 一款DSH超好用的MCP管理跟Skills管理插件","链接：https:\u002F\u002Fgithub.com\u002Fxxxyz\u002FDeepSeekHarness-MCP-Manager 设置 → MCP 管理&#160;管理项目级与全局&#160;cordis.patch.yml&#160;中的&#160;@deepseek-ai\u002Fdsh-mcp-client&#160;","https:\u002F\u002Fcamo.githubusercontent.com\u002F5d48b15e4e45c30746d4410bd5dd51552b20ed0294e6703d220931a8377c3ff8\u002F68747470733a2f2f696d672e736869656c64732e696f2f6e706d2f762f40787878797a2f6473682d6d63702d6d616e616765723f6c6f676f3d6e706d26636f6c6f723d636233383337","\u002Fnews\u002F868",[19],{"id":93,"kind":7,"title":94,"summary":95,"image":49,"href":96,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":97},"NEWS_ARTICLE:880","MHS 三部曲（中）：8 小时集成、六种被拦截的故障，和一次教科书级的翻车","四个案例合起来说明三件事：接入与编排成本可以数量级下降（CMU\u002FJanelia），闭环试错和跨设备补救是真的（CMU\u002FTetsuwan），但物理直觉仍是硬伤（Genentech），安全必须长在模型之外。","\u002Fnews\u002F880",[19]]