論文の概要: RLVP: Penalize the Path, Reward the Outcome
- arxiv url: http://arxiv.org/abs/2607.07435v1
- Date: Wed, 08 Jul 2026 14:06:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.402601
- Title: RLVP: Penalize the Path, Reward the Outcome
- Title(参考訳): RLVP:パスのペナルティ化とアウトカムの回避
- Abstract要約: 検証可能な報酬(RLVR)からの強化学習は、両方の課題に盲目である。
進捗に報いることで監督を強化しようとする試みは、検証の難しい方向を狙う。
のレシピは、ほぼゼロに近い違反で高いタスクの成功を達成します。
- 参考スコア(独自算出の注目度): 0.33451037881913753
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agents acting on our behalf in the real world (e.g. placing phone calls) must learn online from costly, often irreversible interactions rather than cheap simulator steps. Two things follow. First, deployability depends on the path, not only the outcome. An agent must respect outcome-neutral constraints such as not repeatedly calling an unresponsive user, respecting business hours, or completing required authentication constraints that outcome-based rewards cannot express, since violating them frequently improves apparent success. Second, because each interaction is expensive, the agent must learn efficiently from very few examples. Reinforcement learning from verifiable rewards (RLVR) is blind to both challenges: it optimizes solely on the outcome and wastes expensive rollouts on all-fail groups where group-relative advantage collapses to zero. Attempts to densify supervision by rewarding progress target the hard-to-verify direction. In contrast, real agentic environments can cheaply detect bad moves. Since group-relative advantage is equivalent to within-group variance, a dense signal helps only when it supplies variance the outcome lacks. A verifiable penalty on the path meets this condition reliably, while a progress potential helps only where partial progress is reachable. The resulting recipe "penalize the path, reward the outcome" achieves high task success with near-zero violations, where outcome-only training violates constraints on nearly every episode. We provide four design rules for effective penalties, including avoidance of the inaction trap that arises when a penalty is used in isolation.
- Abstract(参考訳): 現実の世界で私たちの代理として行動するエージェント(例えば、電話を置くなど)は、安価なシミュレーターステップではなく、コストがかかる、しばしば不可逆的なインタラクションからオンラインで学ぶ必要があります。
2つのことが続く。
第一に、デプロイ容易性は結果だけでなく、パスに依存します。
エージェントは、不応答なユーザを何度も呼び出さない、ビジネス時間を尊重しない、あるいは結果に基づく報酬が表現できないような必要な認証制約を完了しない、といった結果中立的な制約を尊重しなければならない。
第二に、相互作用は高価であるため、エージェントはごく少数の例から効率的に学習する必要がある。
検証可能な報酬(RLVR)からの強化学習は、結果のみを最適化し、グループ相対的な優位性がゼロに崩壊する全失敗グループに対する高価なロールアウトを無駄にする、という2つの課題に盲目です。
進捗に報いることで監督を強化しようとする試みは、検証の難しい方向を狙う。
対照的に、実際のエージェント環境は、悪い動きを安価に検出することができる。
群相対的優位性は群内分散と同値であるため、密度の高い信号は結果が不足する分散を供給する場合にのみ有効である。
経路上の検証可能なペナルティはこの条件を確実に満たし、進行電位は部分的な進行が到達可能な場合にのみ有効である。
結果として得られるレシピは、ほぼゼロに近い違反によってタスクの成功を達成し、結果のみのトレーニングは、ほぼすべてのエピソードの制約に違反する。
我々は、ペナルティを単独で使用する場合に生じる不作用トラップの回避を含む、効果的な罰則に関する4つの設計規則を提供する。
関連論文リスト
- Tail-Likelihood Reinforcement Learning [63.90013981311359]
Tail-Likelihood Reinforcement Learning (TailRL)は、ランダムに選択された報酬閾値を超える対数確率を最大化する。
TailRLは、利点関数に簡単な修正しか必要とせず、既存の強化学習パイプラインと互換性がある。
論文 参考訳(メタデータ) (2026-09-02T14:54:45Z) - FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - Learning Process Rewards via Success Visitation Matching for Efficient RL [54.67547527674048]
本稿では,スパース結果報酬を高密度プロセス報酬に変換するための簡単な手法を提案する。
我々のアプローチは、以前の成功と失敗のエピソードを区別するために差別者を訓練することに依存しています。
この報酬は、タスクの成功に対応するものだけでなく、すべての州への訪問に対応するポリシーをインセンティブにすることで、タスク完了に向けた進捗が進められているかどうかについての深いフィードバックを提供する。
論文 参考訳(メタデータ) (2026-06-22T17:30:24Z) - Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes [40.20394793623452]
事前トレーニングされたVLAポリシーがオンラインRLを介して微調整されると、各ロールアウトエピソードは単一のバイナリ結果のみを生成する。
階層的アドバンテージ・重み付き行動クローン (HABC) を提案する。
HABCは教師付き微調整(SFT)ベースラインを36%、44%、12%から92%、88%、38%で成功している。
論文 参考訳(メタデータ) (2026-06-15T17:57:14Z) - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short [51.667769734342635]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力向上のための主要なパラダイムとなっている。
本研究では,非多変量報酬群を判定システムにルーティングする適応学習フレームワークであるReasoning Arenaを提案する。
我々は、Reasoning Arenaが、競争数学やコーディングベンチマークにおいて、RLVRベースラインを平均で7.6%上回っていることを示す。
論文 参考訳(メタデータ) (2026-06-08T11:57:17Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - AI Alignment via Incentives and Correction [14.986111703734222]
我々は、抑止と執行の法・経済モデルのレンズを通してAIアライメントを研究する。
解決者は、説得力があるが誤った答えを出し、不確実性を隠蔽したり、急激なショートカットを悪用する恩恵を受けることができる。
この相互作用を、主成分が共同補正結果よりも報酬を選択する2エージェントモデルで定式化する。
論文 参考訳(メタデータ) (2026-05-02T23:28:02Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning [25.562101968892833]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデル(LLM)における長い連鎖推論を導く
既存のアプローチでは、トークンレベルのエントロピーやシーケンスレベルの長さ制御を通じてRLVRを改善するが、推論の進捗を意味的に基礎づけたステップレベルの尺度は欠如している。
本研究では,潜在的利得を増幅し,潜在的利得をペナルティ化し,飽和後のペナルティを適用してタイムリーな終了を促す,詳細な信用割当手法であるステップ電位アドバンテージ推定(SPAE)を提案する。
論文 参考訳(メタデータ) (2026-01-07T11:36:01Z) - R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification [44.99719889905381]
強化学習は推論とエージェント能力の最近の進歩を促進するが、現在のアプローチは探索と搾取の両方で苦労している。
本稿では,R$3$L,Reflection-then-Retry Reinforcement Learning with Language-Guided Exploration,Pivotal Credit,Positive Amplificationを提案する。
エージェントおよび推論タスクの実験は、トレーニング安定性を維持しながら、ベースラインよりも5%から52%改善したことを示している。
論文 参考訳(メタデータ) (2026-01-07T09:04:52Z) - Rethinking Reward Miscalibration of GRPO in Agentic RL [18.495499496405635]
結果に基づく報酬は、これらの欠陥のある中間ステップに対して期待される負の優位性を保証することを示す。
我々は,善悪行為の埋め込みを分離するために,善悪行為を分類するアクターの訓練を提案する。
論文 参考訳(メタデータ) (2025-09-28T13:24:38Z) - Semi-supervised reward learning for offline reinforcement learning [71.6909757718301]
トレーニングエージェントは通常、報酬機能が必要ですが、報酬は実際にはほとんど利用できず、エンジニアリングは困難で手間がかかります。
限定されたアノテーションから学習し,ラベルなしデータを含む半教師付き学習アルゴリズムを提案する。
シミュレーションロボットアームを用いた実験では,動作のクローン化が大幅に向上し,真理の報奨によって達成される性能に近づいた。
論文 参考訳(メタデータ) (2020-12-12T20:06:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。