論文の概要: REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff
- arxiv url: http://arxiv.org/abs/2609.17745v1
- Date: Tue, 15 Sep 2026 18:57:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.506528
- Title: REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff
- Title(参考訳): ReverSal-BENCH: Reset-free RL Cliff 測定のための可逆軸とリセット Oracle
- Abstract要約: 自律的な強化学習の主目的は、外部リセットを伴わない継続的政策訓練である。
連続パラメータ$in[0, 1]$で可逆性を制御するベンチマークであるREVERSAL-BENCHを紹介する。
本研究では、この吸収現象が、学習された操作ポリシーの下での完全な物理シミュレーションにおいて持続することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A central goal of autonomous reinforcement learning is continuous policy training without external resets. However, existing paradigms largely depend on underlying environmental reversibility, a property absent in real world manipulation, where events such as pushing objects off tables or spilling granular substances cannot be undone. We introduce REVERSAL-BENCH, a benchmark that controls reversibility via a continuous parameter $ρ\in [0, 1]$ and provides a reset oracle, a ground-truth verification mechanism to test state recoverability across eight manipulation settings in five physics engines. Evaluating a broad spectrum of policy architectures, including standard actor-critic algorithms, safe RL, and specialized reset-free frameworks, reveals a sharp reversibility cliff: reset-free agents are consistently absorbed into irrecoverable states as $ρ$ increases, whereas episodic agents maintain steady learning. We see this failure mode across autonomous reset-free baselines and constrained RL. Because reset-free agents lack external resets, any transition into an irrecoverable state results in permanent absorption, leaving the agent trapped where further learning halts. We show that this absorption phenomenon persists in full physics simulations under learned manipulation policies. By evaluating against geometrically identical reversible counterparts, we confirm that this breakdown is causally driven by irreversibility rather than obstacle complexity. We release the benchmark suite, a large multi-simulator dataset labeled with recoverability and a reset oracle. We also evaluate a safety shield that intervenes before irreversible failures occur, showing that while recoverability can be predicted accurately, active recovery primarily succeeds only when the agent can physically steer clear of the trap
- Abstract(参考訳): 自律的な強化学習の主目的は、外部リセットを伴わない継続的政策訓練である。
しかし、既存のパラダイムは、オブジェクトをテーブルから押し出したり、粒状物質をこぼすような出来事が、現実の操作に欠如している環境の可逆性に大きく依存している。
連続パラメータ$ρ\in [0, 1]$で可逆性を制御するベンチマークであるREVERSAL-BENCHを導入する。
標準的なアクタークリティカルアルゴリズム、安全なRL、特殊なリセットフリーフレームワークを含む幅広いポリシーアーキテクチャを評価すると、明確な可逆性の崖が明らかになる。
この障害モードは、自律的なリセットフリーベースラインと制約付きRLにまたがる。
リセットのないエージェントは外部のリセットを欠くため、発見不可能な状態への遷移は永久に吸収され、エージェントはさらなる学習が停止する場所に閉じ込められる。
本研究では、この吸収現象が、学習された操作ポリシーの下での完全な物理シミュレーションにおいて持続することを示す。
幾何的に同一の可逆性に対して評価することにより、この分解は障害物の複雑さよりも不可逆性によって因果的に引き起こされていることを確認した。
我々は、リカバリ性とリセットオラクルをラベル付けした大規模なマルチシミュレーターデータセットであるベンチマークスイートをリリースする。
我々はまた、不可逆的障害が起こる前に介入する安全シールドの評価を行い、回復性は正確に予測できるが、アクティブリカバリは主に、エージェントがトラップを物理的に排除できる場合にのみ成功することを示す。
関連論文リスト
- Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents [56.434418859203085]
大規模言語モデル(LLM)エージェントは、多段階の環境相互作用を通じて、長い水平タスクに対処する。
単一の誤動作は、その後の状態や観測を変更でき、時間とともにエラーが複雑になる。
信頼性回復はロールバック境界制御問題として扱われるべきである。
論文 参考訳(メタデータ) (2026-09-16T08:26:14Z) - ResLRP: The Role of Residual Cancellation in Attribution Instability in Vision Transformers [58.411900827911346]
欠落する成分は,残余接続の治療であることを示す。
ResLRP(Residual-Aware Layer-wise Relevance Propagation)を導入する。
ResLRP は LRP の単純な拡張であり、その伝搬規則は残枝のキャンセルを明示的に考慮している。
論文 参考訳(メタデータ) (2026-09-15T13:17:30Z) - ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - Towards Reversible Forgetting: Managing Obsolete Knowledge in Continual Enterprise AI Agents [0.0]
継続的な学習は伝統的に忘れを失敗として扱い、環境が進化するにつれて獲得した知識の保存を強調する。
この目的は、非定常環境で動作するエンタープライズAIエージェントには不完全である、と我々は主張する。
本稿では,3つの動作記憶状態 – アクティブ,休眠状態,退職状態 – と,関連する知識を回復可能な再活性化遷移を備えた概念的フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-18T00:38:46Z) - Backbone-Agnostic Stochastic Perturbation Learning for End-to-End Real-World Image Dehazing [2.3013099757243056]
Backbone-Agnostic Perturbation Learningを提案する。
BSPLは連続的に複数のバックボーン代表を改良し、余分な追加の推論オーバーヘッドのみを発生させる。
論文 参考訳(メタデータ) (2026-07-13T14:44:12Z) - ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples [65.74946647574696]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力を大幅に向上させた。
本研究では,この不安定性の重要源である過最適化について検討する。
我々は,このパラダイムを受動的ペナルティからアクティブ標本安定化に移行するフレームワークARMORを提案する。
論文 参考訳(メタデータ) (2026-07-11T21:22:46Z) - SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior [38.75847400495247]
スパースオートエンコーダ(SAE)は残ストリームの活性化を解釈可能な特徴に分解する。
特定の有害な特徴をクランプすることで,モデルの誤動作を確実に防止できることが示唆された。
我々は、この脆弱性を、制約付き残空間最適化問題であるポスト・インターベンション・リカバリ(英語版)として定式化する。
論文 参考訳(メタデータ) (2026-06-16T15:04:17Z) - Agile Fall Recovery for Quadrotors with Bidirectional Thrust via Reinforcement Learning [8.39070114446824]
本稿では、任意の地上姿勢から、軽量なオンボードセンサーのみを用いた安定ホバリングまで、四重項の自律的落下回復のためのRLベースのフレームワークを提案する。
限定的で信頼性の低いオンボードセンシングのみを使用して,明示的な状態推定を行うことなく,アジャイルの4倍体フォールリカバリを実現することができることを示す。
論文 参考訳(メタデータ) (2026-06-15T10:15:10Z) - ARES: Scalable and Practical Gradient Inversion Attack in Federated Learning through Activation Recovery [73.8181449261685]
Federated Learning(FL)は、モデルの更新を生データではなく共有することで、ユーザのプライバシ保護を目的としたコラボレーションモデルトレーニングを可能にする。
最近の研究によると、これらの共有更新は、勾配反転攻撃(GIA)を通じて、不注意にセンシティブなトレーニングデータを漏洩する可能性がある。
論文 参考訳(メタデータ) (2026-03-18T11:40:44Z) - How Far Can Unsupervised RLVR Scale LLM Training? [57.44753418846446]
検証可能な報酬を伴う教師なし強化学習(URLVR)は、監督ボトルネックを越えてLLMトレーニングをスケールするための経路を提供する。
最近の研究は、モデル固有の信号を活用し、期待できる早期の利得を示しているが、その可能性と限界は未だ不明である。
我々は、URLVRメソッドを報酬源に基づく固有対外部に分類し、統一された理論的枠組みを確立する。
論文 参考訳(メタデータ) (2026-03-09T17:38:11Z) - Embedding Classical Balance Control Principles in Reinforcement Learning for Humanoid Recovery [1.0883174135300417]
人間は転倒や回復不能な障害状態に対して脆弱であり、非構造化環境での実用性を制限する。
古典的バランス指標を埋め込むことにより、この制限に対処する統一的なRLポリシーを提案する。
このポリシーは、ランダム化された初期ポーズと記述されていないフォール設定で93.4%のリカバリ率を達成する。
論文 参考訳(メタデータ) (2026-03-09T17:02:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。