論文の概要: Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
- arxiv url: http://arxiv.org/abs/2608.14945v1
- Date: Fri, 14 Aug 2026 23:56:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.13351
- Title: Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
- Title(参考訳): 信頼は十分ではない: エージェントRLのオン・ポリシィ自己蒸留の校正に影響を及ぼす
- Authors: Qizhen Lan, Xi Xiao, Xiangchen Guan, Mengchen Fan, Moule Lin, Jung Im Choi, Lijing Zhu,
- Abstract要約: 政治上の自己蒸留により、言語エージェントは、政策自身の軌道に関する特権を持つ自己教育者から、密集したトークンレベルの監督を受けることができる。
既存の手法では、主に教師の信頼によってこの監督を割り当てているが、トークンの強調が現在の政策目標を支持するかどうかを信頼は明らかにしていない。
これを信頼ユーティリティミスマッチと呼び、自己蒸留(ICSD)の影響を導入する。
ICSDは、教師が指示するトークンに対する重み付けされたサロゲート貢献の1次応答を測定する。
- 参考スコア(独自算出の注目度): 10.371051360109758
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy self-distillation (OPSD) gives language agents dense token-level supervision from a privileged self-teacher on the policy's own trajectories. Existing methods allocate this supervision mainly by teacher trust, but trust does not reveal whether emphasizing a token supports the current policy objective. We call this the trust-utility mismatch and introduce Influence Calibration for Self-Distillation (ICSD). For each supervised token, ICSD measures the first-order response of its importance-weighted RL surrogate contribution to a teacher-directed output perturbation. Batch-adaptive calibration converts this non-stationary signal into a bounded allocation weight while preserving the original auxiliary-loss mass within each action turn. These detached weights affect only the distillation loss and require no additional model pass. Across ALFWorld, WebShop, and Search-QA, ICSD improves all matched aggregate metrics over trust-only allocation under Group Relative Policy Optimization (GRPO) and Group-in-Group Policy Optimization (GiGPO), across two model families spanning 1.5B to 7B. At 7B, it reaches 96.1% ALFWorld success and a WebShop score of 93.1. Frozen-batch analyses show that ICSD reduces teacher-supported mass assigned to objective-opposed tokens from 60.1% to 37.8% and raises cosine compatibility with the RL gradient by 0.192. A companion repository is avail- able at https://github.com/lanqz7766/Influence-Calibration-for-On-Policy-Self-Distillation-in-Agentic-RL.
- Abstract(参考訳): On-policy self-distillation (OPSD) は、言語エージェントに対して、政策の軌跡に関する特権的な自己教育者からの密集したトークンレベルの監督を与える。
既存の手法では、主に教師の信頼によってこの監督を割り当てているが、トークンの強調が現在の政策目標を支持するかどうかを信頼は明らかにしていない。
我々はこれを信頼ユーティリティミスマッチと呼び、自己蒸留(ICSD)に対する影響校正を導入する。
教師付きトークンごとに、ICSDは教師が指示する出力摂動に対する重要重み付きRLサロゲート寄与の1次応答を測定する。
バッチ適応キャリブレーションは、この非定常信号を、各アクションターン内で元の補助損失質量を保持しながら、有界な割り当て重みに変換する。
これらの分離された重量は蒸留損失のみに影響し、追加のモデルパスを必要としない。
ALFWorld、WebShop、Search-QA全体で、ICSDは、1.5Bから7Bにまたがる2つのモデルファミリにわたる、グループ相対ポリシー最適化(GRPO)とグループ内ポリシー最適化(GiGPO)の下で、信頼のみのアロケーションよりも、一致したすべての集計メトリクスを改善している。
7Bでは96.1%のALFWorldで成功し、WebShopスコアは93.1だった。
凍結バッチ解析により、ICSDは客観的なトークンに割り当てられた教師支援の質量を60.1%から37.8%に減らし、RL勾配とのコサイン互換性を0.192に向上させた。
コンパニオンリポジトリはhttps://github.com/lanqz7766/Influence-Calibration-for-On-Policy-Self-Distillation-in-Agentic-RLで利用可能である。
関連論文リスト
- I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization [5.536267204193318]
グループ相対ポリシー最適化は、ロールアウトグループ内の報酬差から学習するが、サンプリングされた応答が正しくない場合に有用な相対信号を受け取らない。
原始的な自己蒸留は、密集したトークンの監督によってこのギャップを埋めることができますが、トレーニングを通じて適用することで、異なる障害モードを生成します。
I-SDPO (Instance-Level Adaptive Self-Distillation Policy Optimization) を導入する。
論文 参考訳(メタデータ) (2026-08-13T08:37:24Z) - Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Automatic Modulation Classification [1.547549252134621]
本稿では,クロスフィット型残効ユーティリティとプライマリ保存型認知決定ポリシーを用いて,推論後の問題について検討する。
構造化されたkan-Fourier分類器はデフォルトの確率を提供し、ニューラルおよび非ニューラル候補は観測可能な証拠を提供する。
RMLA、RMLB、HISARでは、完全なシステムは全体の精度を63.632%から66.332%、65.161%から66.168%、77.769%から79.867%に改善している。
論文 参考訳(メタデータ) (2026-08-03T11:07:37Z) - PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning [47.656931433805745]
オンラインの自己蒸留は、特権のある教師から密集したトークンレベルの監督を提供する。
既存の方法は、ノイズに敏感な孤立したトークンレベルの不一致に依存している。
本稿では,教師が好む信号の局所的持続性からトークンレベルの蒸留重量を導出する,一貫性持続型自己蒸留(PCSD)を提案する。
論文 参考訳(メタデータ) (2026-08-03T07:47:59Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents [0.0]
検証可能な報酬による強化学習は推論とツールの使用を改善するが、長期の言語エージェントは依然として、証拠連鎖と信念の漂流を学習する。
本稿では, 厳密な検証可能な報酬, 介入正当性ゲーティング, および政策条件付き対実的貢献(PCCC)推定器を用いた制約付きポリシー勾配アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-06-03T16:19:36Z) - Self-Distilled Policy Gradient [51.95967256628261]
都市の自己蒸留は、スパース・リワード強化学習のための密集した監督源として有望である。
SDPGは,グループ相対検証の利点と正規化標準偏差を組み合わせた,自己蒸留型政策段階のフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T02:31:13Z) - StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning [6.365332042924078]
本稿では,ロールアウト後の自己蒸留フレームワークであるStepOPSDについて紹介する。
StepOPSDは、軌跡をアクション中心のステップセグメントに分解し、後見豊かな教師コンテキスト下でそれらを再構成する。
より小さい_clipは広範囲に安定化された局所信頼領域として作用するが、最適な大域混合強度_mixはタスク依存のままである。
論文 参考訳(メタデータ) (2026-05-26T15:07:03Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Monotonic Improvement Guarantees under Non-stationarity for
Decentralized PPO [66.5384483339413]
我々は,MARL(Multi-Agent Reinforcement Learning)における分散政策の最適化のための新しい単調改善保証を提案する。
本研究では,訓練中のエージェント数に基づいて,独立した比率を限定することにより,信頼領域の制約を原則的に効果的に実施可能であることを示す。
論文 参考訳(メタデータ) (2022-01-31T20:39:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。