論文の概要: When Does Action Credit Need Updating?
- arxiv url: http://arxiv.org/abs/2609.29007v1
- Date: Thu, 24 Sep 2026 04:13:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.712326
- Title: When Does Action Credit Need Updating?
- Title(参考訳): アクションクレジットはいつ更新する必要があるか?
- Abstract要約: 従来の行動ランキングを覆すには政策によるドリフトが小さすぎる限り、過去の行動クレジットが有用であることを示す。
我々は、クレジットの再利用、輸送、再サンプリングのどちらを選択するかを選択する決定に十分なクレジットゲートを提案する。
- 参考スコア(独自算出の注目度): 2.255961793913651
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-using agents are continually updated with new interaction data. After each policy update, however, previously estimated action credits may become stale. Recomputing them from scratch can require many additional tool calls and environment interactions, making repeated updates increasingly expensive. We ask a simple question: when does historical action credit actually need to be updated? Our key observation is that a change in action value does not necessarily imply a change in the decision. Historical credit can still be useful as long as policy-induced drift is too small to overturn the existing action ranking. Building on this idea, we introduce pairwise branch sensitivity to capture how strongly a policy update affects the downstream regions that distinguish two candidate actions. We then derive a first-order anchored credit-transport estimator that updates historical credit using old interventional trajectories, and propose a Decision-Sufficient Credit Gate (DSC-Gate) that chooses whether to reuse, transport, or resample credit. Experiments show that branch sensitivity explains credit drift substantially better than global policy distance. With sufficient historical data, credit transport reduces estimation error, while its benefit to decision making is concentrated on updates that affect action-distinguishing branches. On a fully independent test set, DSC-Gate changes mean regret by only +0.00004 relative to a gap-based gate while reducing mean new tool steps from 472 to 286, a 39.4% reduction. We observe the same pattern after a real tool-agent parameter update. Overall, our results show that agents do not need to recompute action credit after every policy update: much of the historical evidence can be reused or cheaply corrected, reducing the additional interaction required to keep action decisions up to date.
- Abstract(参考訳): ツール使用エージェントは、新しいインタラクションデータで継続的に更新される。
しかし、各ポリシー更新の後、事前に見積もられたアクションクレジットは時代遅れになる可能性がある。
それらをスクラッチから再計算するには、多くのツールコールと環境インタラクションが必要になるため、繰り返し更新するコストがますます高くなる。
過去のアクションクレジットは、いつ更新する必要があるのか?
私たちのキーとなる観察は、アクション値の変化が必ずしも決定の変更を意味するとは限らないということです。
政策によって引き起こされたドリフトが、既存の行動ランキングを覆すには小さすぎる限り、歴史的信用は依然として有用である。
このアイデアに基づいて、ポリシー更新が2つの候補アクションを区別する下流領域にどれほど強く影響するかを把握するために、ペアワイズ分岐感度を導入する。
次に、古い介入トラジェクトリを使用して過去の信用を更新する1次固定付クレジット・トランスポート推定器を導出し、クレジットの再利用、輸送、再サンプリングを選択できる決定対応クレジット・ゲート(DSC-Gate)を提案する。
実験によると、支店の感度は、グローバルな政策距離よりも信用のドリフトがかなり良く説明されている。
十分な履歴データがあれば、クレジットトランスポートは推定誤差を減らし、意思決定の利点はアクション識別ブランチに影響を及ぼす更新に集中する。
完全に独立したテストセットでは、DSC-Gate の変更はギャップベースのゲートに対して +0.00004 しか後悔しないが、平均的な新しいツールステップを 472 から 286 に減らし、39.4% 削減した。
実際のツールエージェントパラメータの更新後に同じパターンを観察する。
全体としては、エージェントはポリシー更新のたびにアクションクレジットを再計算する必要はなく、歴史的証拠の多くは再利用または安価に修正でき、アクション決定を最新に保つのに必要な追加のインタラクションを減らすことができる。
関連論文リスト
- When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression [55.84813053778976]
ロングホライズル言語モデルエージェントは、推論履歴を継続的に蓄積する。
歴史的推論の除去は、将来の行動と結果として生じる相互作用の軌跡を変える可能性がある。
長軸推論のためのインタラクションアウェア圧縮を提案する。
論文 参考訳(メタデータ) (2026-09-24T14:28:43Z) - ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization [13.354353071601379]
我々は、特権付き監督を成果ベースアクションクレジットに変換するTASPOを紹介する。
3つのエージェントベンチマークで、TASPOはGRPOよりも10.6%改善し、目に見えないタスクを一般化する。
論文 参考訳(メタデータ) (2026-08-31T16:51:50Z) - From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use [12.466318496864742]
本稿では,国家行動競争を緩和するためのクローズドループ方式であるOODA-Toolを紹介する。
OODA-Toolは、コントローラがチェックした中間状態を通じて各決定をルーティングし、最終的な出力が現在のタスク状態に残されていることを保証します。
我々は,マルチターン,マルチツール,不完全情報設定にまたがるQwen3モデルを用いて,直接関数呼び出しとReActポリシーに対するOODAツールの評価を行った。
論文 参考訳(メタデータ) (2026-08-25T10:27:25Z) - Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? [78.81308700607651]
アクションチャンキングは単一のアクションではなく、複数のアクションを予測し、実行する。
非マルコフ表現率の増大と、マルコフポリシーと比較して複合誤差の低減による作用チャンキングの利点が示された。
本稿では,アンサンブルを明示的にインスタンス化することで,アクションチャンキングのメリットを増幅するポリシークラスを提案する。
論文 参考訳(メタデータ) (2026-08-03T17:32:45Z) - TCPO: Turn-Level Credit Policy Optimization [3.5758528239482477]
検証器誘導型マルチターンRLのターンレベルクレジット代入法であるTCPOを提案する。
TCPOは、クレジット割り当てをスコア・ツー・クレディット変換とし、基準ベースの比較を通じてターンレベルの利点を構築する。
数学推論、コード生成、AppWorldエージェントタスクの実験は、TCPOがモデルスケール、タスクドメイン、検証対象タイプで最強のベースラインを改善したり、適合させたりしていることを示している。
論文 参考訳(メタデータ) (2026-08-03T04:01:36Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。