論文の概要: Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
- arxiv url: http://arxiv.org/abs/2605.04984v1
- Date: Wed, 06 May 2026 14:38:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.882797
- Title: Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
- Title(参考訳): 自己誘導型アウトカムの可能性:検証対象のないエージェントに対するターンレベルクレジットアサインメント
- Authors: Senkang Hu, Yong Dai, Xudong Han, Zhengru Fang, Yuzhi Zhao, Sam Tak Wu Kwong, Yuguang Fang,
- Abstract要約: 自己誘導型アウトカム電位は、最終回答のセマンティッククラスタを、ポテンシャルに基づくターンレベルのクレジット割り当てのための潜在的な将来の結果状態として扱う。
我々は,このフレームワークを形式化し,監督対象のゴールド・アンサー・リミットを特徴付けるとともに,SIOPが検証自由な結果レベルベースラインよりも平均性能を向上させることを示す。
- 参考スコア(独自算出の注目度): 26.97849381770806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon LLM agents depend on intermediate information-gathering turns, yet training feedback is usually observed only at the final answer, because process-level rewards require high-quality human annotation. Existing turn-level shaping methods reward turns that increase the likelihood of a gold answer, but they require answer supervision or stable task-specific verifiers. Conversely, label-free RL methods extract self-signals from output distributions, but mainly at the answer or trajectory level and therefore cannot assign credit to intermediate turns. We propose Self-Induced Outcome Potential (SIOP), which treats semantic clusters of final answers as latent future outcome states for potential-based turn-level credit assignment. For each query, SIOP samples multiple rollouts, clusters final answers into semantic outcome modes, and builds a reliability-aware target distribution over these states. It then rewards turns for increasing posterior support for reliable future states using a tractable cluster-level approximation. The objective generalizes information-potential shaping from gold-answer supervision to settings without task-specific gold verifiers while avoiding the broadcasted rollout-level advantages used by standard GRPO. We formalize the framework, characterize its supervised gold-answer limit, and show that SIOP improves average performance over verifier-free outcome-level baselines on seven search-augmented agentic reasoning benchmarks while approaching a gold-supervised outcome baseline. Code is available at https://github.com/dl-m9/SIOP.git.
- Abstract(参考訳): ロングホライゾンLSMエージェントは中間情報収集のターンに依存するが、トレーニングフィードバックは通常最終回答でのみ観察される。
既存のターンレベルの整形法では、報酬は金の答えの可能性を増加させるが、答えの監督や安定したタスク固有の検証が必要である。
逆に、ラベルフリーなRL法は出力分布から自己署名を抽出するが、主に答えや軌道レベルで、従って中間ターンにクレジットを割り当てることはできない。
本稿では,最終回答のセマンティック・クラスタを,ポテンシャルに基づくターンレベル・クレジット・アサインのための潜在的な結果状態として扱う,自己誘導型アウトカム・ポテンシャル(SIOP)を提案する。
各クエリに対して、SIOPは複数のロールアウトをサンプリングし、最終的な回答をセマンティックな結果モードにクラスタ化し、これらの状態に対する信頼性に配慮したターゲット分布を構築する。
次に、トラクタブルクラスタレベルの近似を用いて、信頼性の高い将来の状態に対する後続サポートを増やすために、ターンを報いる。
本研究の目的は、標準GRPOの放送されたロールアウトレベルの利点を回避しつつ、タスク固有のゴールドバリデーションを使わずに、ゴールド・アンサー・インスペクションから設定への情報潜在的シェーピングを一般化することである。
我々は,本フレームワークを形式化し,監督対象のゴールド・アンサー・リミットを特徴付けるとともに,SIOPがゴールド・アンサー・ベースラインに近づきながら7つの検索強化エージェント推論ベンチマークにおいて,検証対象のない結果レベルベースラインよりも平均性能を向上させることを示す。
コードはhttps://github.com/dl-m9/SIOP.gitで入手できる。
関連論文リスト
- RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses [7.123785374544969]
大規模言語モデル(LLM)は、強化学習における報酬設計をかなりスケーラブルにするが、生成された報酬は自動的に信頼性のある訓練目標ではない。
本稿では,現在の政策の能力に依拠する報酬仮説として,生成した報酬を扱い,この展開時問題を考察する。
我々は,有能な検証とフェーズアウェアなデプロイメントプロトコルであるtextscRHyVEを提案する。
論文 参考訳(メタデータ) (2026-04-30T16:01:51Z) - Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance [8.66471442661456]
隠れ状態分布は局所的推論品質に有用な信号を含むことを示す。
各GRPO群では, 局所的推論品質が変動する領域を中心に, スパンレベル隠れ状態分布間のワッサースタイン距離が増加する。
textbfSpan-level textbfHidden state textbfEd textbfAdvantage textbfReweightingを提案する。
論文 参考訳(メタデータ) (2026-04-25T14:11:23Z) - P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering [51.04492568024515]
本稿では,プロセス報酬を微粒化するための新しいフレームワークである確率的プロセススーパービジョン(P2S)を紹介する。
P2Sは、個別の報酬モデルや人間に注釈を付けた推論ステップを必要とせずに、きめ細かいプロセス報酬を提供する。
論文 参考訳(メタデータ) (2026-01-28T14:35:20Z) - Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks [12.31210445905605]
ステップレベルの評価と結果の検証を統一するRLアプローチである原則プロセス・リワード(PPR)を導入する。
PPRは幅広いベンチマークで最先端のパフォーマンスを実現し、その顕著な堅牢性と一般化を実証している。
論文 参考訳(メタデータ) (2025-09-29T23:44:55Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。