論文の概要: LocusRL: Diagnosing LLM Reward and Policy Interventions in Competitive Games
- arxiv url: http://arxiv.org/abs/2610.04441v1
- Date: Sat, 03 Oct 2026 11:03:16 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:32:29.552905
- Title: LocusRL: Diagnosing LLM Reward and Policy Interventions in Competitive Games
- Title(参考訳): LocusRL: LLMのリワードと競合ゲームにおける政策介入の診断
- Abstract要約: 大規模な言語モデルは、報酬設計とアクション選択の両方を通じて強化学習に介入することができる。
同様のリターンは異なる学習メカニズムを隠蔽し、もっともらしい報酬は望ましくない振る舞いを引き起こす。
本稿では,報酬比較と報酬判定,信号配信,最適化目標,実行行動の監査を結びつける診断フレームワークであるLocusRLを紹介する。
- 参考スコア(独自算出の注目度): 5.808442678639854
- License:
- Abstract: Large language models can intervene in reinforcement learning through both reward design and action selection, yet aggregate performance offers an incomplete account of what these interventions actually do. Similar returns can conceal different learning mechanisms, while plausible rewards can induce undesirable behavior. We introduce LocusRL, a diagnostic framework that connects controlled reward-policy comparisons with audits of reward judgments, signal delivery, optimization objectives, and executed actions. The framework traces performance differences to testable explanations and checks targeted corrections through executable rules and counterfactual replay. Across two evaluation batches covering ten Connect Four training seeds, we uncover seed-dependent reversals in intervention effects and show how tracing actual updates changes their interpretation: historical Qwen training operates through reward-weighted teacher-action likelihood. A separate matched three-seed reward-direction experiment distinguishes sensitivity to a learning signal from its usefulness. With terminal rewards held fixed, a sign-reversed dense oracle yields a 2.8% aggregate win rate, compared with 57.2% for terminal-only training and 46.7% for the positive dense oracle. Thus, a reward can strongly influence learning without improving performance. At the decision level, counterfactual replay verifies a winning correction to a diagnosed action error. Complementary experiments in Leduc and reward-validation studies in Goofspiel extend the analysis to imperfect-information settings, revealing how reference-label definitions and validation-data exposure affect intervention assessment. Together, these findings show why evaluating LLM interventions requires tracing how their outputs become learning signals and actions. LocusRL turns aggregate outcomes into actionable diagnoses and verifiable corrections.
- Abstract(参考訳): 大規模な言語モデルは、報酬設計とアクション選択の両方を通じて強化学習に介入することができるが、集約されたパフォーマンスは、これらの介入が実際に何をするのかを不完全な説明を提供する。
同様のリターンは異なる学習メカニズムを隠蔽し、もっともらしい報酬は望ましくない振る舞いを引き起こす。
本稿では,報酬比較と報酬判定,信号配信,最適化目標,実行行動の監査を結びつける診断フレームワークであるLocusRLを紹介する。
このフレームワークは、テスト可能な説明にパフォーマンスの違いをトレースし、実行可能ルールと偽のリプレイを通じてターゲットの修正をチェックする。
10個のコネクテッド・フォー・トレーニングシードをカバーする2つの評価バッチで、介入効果におけるシード依存の逆転を発見し、実際の更新の追跡が解釈をどう変えるかを示す。
マッチした3シードの報酬指向実験は、学習信号に対する感度と有用性を区別する。
終末報酬が固定された場合、符号反転密度の高いオラクルの総当たり勝利率は2.8%となり、終末のみのトレーニングでは57.2%、正密度の高いオラクルでは46.7%となる。
これにより、報酬は、性能を向上することなく、学習に強く影響を与えることができる。
判定レベルでは、反ファクトリプレイは、診断された動作誤差に対する勝利補正を検証する。
Leducでの補完実験とGoofspielでの報酬検証研究は、分析を不完全な情報設定にまで拡張し、基準ラベルの定義と検証データ露出が介入評価にどのように影響するかを明らかにした。
これらの結果から, LLM介入の評価には, 学習信号や行動の追跡が必要であることが示唆された。
LocusRLは、集計結果を実行可能な診断と検証可能な修正に変換する。
関連論文リスト
- Reinforcement Learning with Comparative Evidence for Social Intelligence [71.36958862570982]
Reinforcement Learning with Comparison Evidence (RLCE) は、厳密なアノテーションから報酬を構築することなく、ラベルのないトレーニングデータから社会的理解を学ぶ。
RLCEは、7つの手法の中で最強のパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-10-02T21:35:23Z) - PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning [13.723588585738831]
アウトカムベースの強化学習は、すべてのアクションチャンクに同じ軌道レベルの利点を割り当てる。
軌道上の物理的関係は、具体化されたRLにおいてアクション・チャンク・クレジットを提供することができる。
LIBERO、RoboTwin 2.0、および実際のロボットの実験では、結果ベースラインよりもタスクの成功が向上した。
論文 参考訳(メタデータ) (2026-09-30T03:37:31Z) - Self-Confirming Superposition Traps in Reinforcement Learning [62.71685993550818]
強化学習はエージェントのポリシーによって選択されたデータに基づいて表現し、その結果のリターンを使って次の選択を導く。
これらのデータに対して表現フィッティングがグローバルに最適である場合でも,このループは低リターンポリシーを維持可能であることを示す。
論文 参考訳(メタデータ) (2026-09-26T21:56:26Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL [10.399451281089318]
我々はMiniGridをコア評価として,MuJoCoを境界応力試験として用いたPPO訓練剤について検討した。
私たちの監査では、報酬の洪水とセマンティック/API誤解という、2つの主要なワンショット障害モードを見つけました。
本稿では,トレーニング診断と障害モード分類ガイドが報酬関数の修正を対象とする,診断駆動反復改善法を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:57:43Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Using Contrastive Samples for Identifying and Leveraging Possible Causal
Relationships in Reinforcement Learning [4.924126492174801]
そこで本稿では,後続の報酬に異常に大きな変動がある状態において,遷移と大きなずれを関連付ける手法を提案する。
このような遷移は因果効果としてマークされ、対応する状態-作用対が別のリプレイバッファに追加される。
我々は、CERが、あらゆる非政治強化学習アルゴリズムを含む幅広い学習タスクに有用であると信じている。
論文 参考訳(メタデータ) (2022-10-28T11:21:17Z) - Robust Pre-Training by Adversarial Contrastive Learning [120.33706897927391]
近年の研究では、敵の訓練と統合されると、自己監督型事前訓練が最先端の堅牢性につながることが示されている。
我々は,データ強化と対向的摂動の両面に整合した学習表現により,ロバストネスを意識した自己指導型事前学習を改善する。
論文 参考訳(メタデータ) (2020-10-26T04:44:43Z) - Learning "What-if" Explanations for Sequential Decision-Making [92.8311073739295]
実世界の意思決定の解釈可能なパラメータ化を実証行動に基づいて構築することが不可欠である。
そこで我々は,「何」の結果に対する嗜好の観点から,報酬関数をモデル化し,専門家による意思決定の学習的説明を提案する。
本研究は,行動の正確かつ解釈可能な記述を回復する上で,実効的逆強化学習手法であるバッチの有効性を強調した。
論文 参考訳(メタデータ) (2020-07-02T14:24:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。