論文の概要: PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.38890v1
- Date: Wed, 30 Sep 2026 03:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.143205
- Title: PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning
- Title(参考訳): 身体強化学習のための身体的関係クレジットアサインメント
- Abstract要約: アウトカムベースの強化学習は、すべてのアクションチャンクに同じ軌道レベルの利点を割り当てる。
軌道上の物理的関係は、具体化されたRLにおいてアクション・チャンク・クレジットを提供することができる。
LIBERO、RoboTwin 2.0、および実際のロボットの実験では、結果ベースラインよりもタスクの成功が向上した。
- 参考スコア(独自算出の注目度): 13.723588585738831
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Outcome-based reinforcement learning (RL) post-trains vision--language--action policies using terminal success signals, but assigns the same trajectory-level advantage to every action chunk. A failed episode can thus penalize useful early actions as if they caused the failure. Existing approaches seek finer-grained feedback through learned evaluators, adding task-specific supervision or additional model training. We explore, for the first time to our knowledge, whether physical relations across trajectories can provide action-chunk credit in embodied RL from terminal outcomes alone, without an auxiliary evaluator. The key insight is that rollouts reaching corresponding physical situations can serve as references for one another: their terminal outcomes provide evidence for assessing local progress. We introduce Physical Relations for Inferring Credit from Episodes(PRICE), with two components: (i) a physical relational graph that pools current and historical outcomes at corresponding chunk boundaries to estimate success potentials; and (ii) confidence-gated credit assignment that uses changes in these potentials to refine trajectory-level supervision. Our analysis connects oracle potential changes to the terminal-success objective and provides a finite-sample directional bound for outcome-independent evidence pools. Independent continuation tests show that PRICE's retained credits align with local progress, while experiments on LIBERO, RoboTwin 2.0, and real robots demonstrate improved task success over outcome-based baselines and faster learning.
- Abstract(参考訳): アウトカムベース強化学習(RL)は、終端成功信号を用いた視覚-言語-アクションポリシーを後訓練するが、全てのアクションチャンクに同じ軌道レベルの利点を割り当てる。
これにより、失敗したエピソードは、障害の原因となったような有用な早期アクションをペナルティ化することができる。
既存のアプローチは、学習した評価者を通じてよりきめ細かいフィードバックを求め、タスク固有の監督や追加のモデルトレーニングを追加する。
我々は, トラジェクトリ間の物理的関係が, 補助評価器を使わずに, 終末結果のみから, エンボディされたRLにおけるアクション・チャンク・クレジットを提供できるかどうかを, 初めて検討した。
重要な洞察は、対応する物理的状況に到達したロールアウトが、互いの参照として機能し得ることである。
エピソードからクレジットを推測する物理関係(PRICE)を2つの要素で紹介する。
一 成功ポテンシャルを推定するために、対応するチャンク境界における現在及び歴史的成果をプールする物理関係グラフ
(二)これらのポテンシャルの変化を利用して軌道レベルの監督を洗練させる信用割当
我々の分析は、オラクルポテンシャル変化を終末成功目標に結び付け、結果非依存のエビデンスプールに対して有限サンプル方向のバウンダリを提供する。
一方、LIBERO、RoboTwin 2.0、および実際のロボットの実験では、結果に基づくベースラインと学習の高速化よりもタスクの成功が向上している。
関連論文リスト
- Credit-Guided Policy Improvement for Test-time Adaptive Vision-Language Navigation [53.30116823667751]
視覚言語ナビゲーションのためのテスト時適応(TTA-VLN)により、事前訓練されたポリシーは、目に見えない環境にオンラインで適応できる。
分散シフトは、局所的な行動選好を歪め、オフコース決定につながる可能性がある。
我々は,行動誘発観察遷移から署名付き参照関連決定クレジットを回収する信用誘導政策改善(CGPI)を提案する。
論文 参考訳(メタデータ) (2026-09-29T13:46:11Z) - SWE-MILE: Asynchronous Potential-Induced Milestone Credit Assignment for Long-Horizon Software Engineering Agents [52.92536111845184]
SWE-MILEは、ワークフローランタイムからきめ細かいプロセス監視を導出するプロセス監視フレームワークである。
非同期シャドウプローブは、分離されたサンドボックス内のリポジトリ変更アクションを再生し、エージェントのプライマリインタラクションと並行して検証を実行する。
2つの代表的な長期SWEタスクの実験は、エージェント性能を大幅に改善したことを示している。
論文 参考訳(メタデータ) (2026-09-26T13:49:14Z) - VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning [6.237984544487965]
VICT(VerifierInstrumented Credit Tracing)は、原子を依存性検証エッジを通じて動作にトレースするトレーニングタイムインターフェースである。
結果のみのトレーニングよりも大幅に改善され、最近のきめ細かいクレジットメソッドと並行して、強力なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-08-28T09:43:54Z) - MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents [26.262385802144323]
プロセスレベルの信用を3つの設計を通じてグループ化されたオン・ポリティクス・ロールアウトから導き出すMileGPOを提案する。
MileGPOは補助モデルも追加の環境相互作用も必要としない。
論文 参考訳(メタデータ) (2026-08-20T08:58:27Z) - AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment [35.978805768172656]
ロングホライゾンのエージェントタスクは、結果ベース強化学習の基本的なクレジット割り当て課題となる。
PBSD (Privileged Bayesian Self-Distillation) はベイズが校正した自己蒸留法である。
論文 参考訳(メタデータ) (2026-06-08T11:20:58Z) - RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents [37.33108522642245]
本稿では,検索インタラクションを局所的な学習信号に変換する,批判のないポリシー最適化フレームワークであるRICE-POを提案する。
BRIGHTとBEIRでは、RICE-POはプロンプトベースのエージェントとグループベースのRLベースラインを同じレシーバー設定で一貫して上回る。
論文 参考訳(メタデータ) (2026-05-25T21:56:29Z) - Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation [71.16738415436458]
本稿では、生の障害フィードバックを補正管理のアクティブソースに変換するフレームワークであるReflection-Enhanced Self-Distillation(RESD)を紹介する。
RESDは、局所的なエラーを診断するために振り返りリフレクションを生成し、持続的なグローバルなプレイブックをキュレートすることで、障害の軌跡を解釈する。
複数の連続学習課題に対する実証的な評価は、RESDが標準の自己蒸留ベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-12T20:46:05Z) - Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning [87.7836502955847]
本稿では,Large Language Model (LLM)推論を強化するための,自己回帰型強化学習フレームワークを提案する。
私たちのキーとなる洞察は、正しい応答はモデルの可能性の観点から一貫した軌道パターンを示すことが多いということです。
本稿では,安定度とボラティリティを,頑健なベクトル空間集約戦略を通じて統合する,本質的な報酬機構であるCoVoを紹介する。
論文 参考訳(メタデータ) (2025-06-10T12:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。