論文の概要: Learning to Undo: Rollback-Augmented Reinforcement Learning with Reversibility Signals
- arxiv url: http://arxiv.org/abs/2510.14503v1
- Date: Thu, 16 Oct 2025 09:48:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-17 21:15:14.803368
- Title: Learning to Undo: Rollback-Augmented Reinforcement Learning with Reversibility Signals
- Title(参考訳): Undoへの学習: 可逆性信号を用いたロールバック強化型強化学習
- Abstract要約: 本稿では,価値に基づく強化学習エージェントの堅牢性と効率を向上させるための可逆学習フレームワークを提案する。
このフレームワークには2つの補完的なコア機構がある: s の Phi と割り込みと呼ばれる経験的に導出された遷移可逆性測度、選択状態のロールバック演算である。
- 参考スコア(独自算出の注目度): 1.9537983097153042
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper proposes a reversible learning framework to improve the robustness and efficiency of value based Reinforcement Learning agents, addressing vulnerability to value overestimation and instability in partially irreversible environments. The framework has two complementary core mechanisms: an empirically derived transition reversibility measure called Phi of s and a, and a selective state rollback operation. We introduce an online per state action estimator called Phi that quantifies the likelihood of returning to a prior state within a fixed horizon K. This measure is used to adjust the penalty term during temporal difference updates dynamically, integrating reversibility awareness directly into the value function. The system also includes a selective rollback operator. When an action yields an expected return markedly lower than its instantaneous estimated value and violates a predefined threshold, the agent is penalized and returns to the preceding state rather than progressing. This interrupts sub optimal high risk trajectories and avoids catastrophic steps. By combining reversibility aware evaluation with targeted rollback, the method improves safety, performance, and stability. In the CliffWalking v0 domain, the framework reduced catastrophic falls by over 99.8 percent and yielded a 55 percent increase in mean episode return. In the Taxi v3 domain, it suppressed illegal actions by greater than or equal to 99.9 percent and achieved a 65.7 percent improvement in cumulative reward, while also sharply reducing reward variance in both environments. Ablation studies confirm that the rollback mechanism is the critical component underlying these safety and performance gains, marking a robust step toward safe and reliable sequential decision making.
- Abstract(参考訳): 本稿では,価値に基づく強化学習エージェントの堅牢性と効率を向上させるための可逆学習フレームワークを提案する。
このフレームワークには、2つの相補的なコア機構がある: s と a の Phi と呼ばれる経験的に導出された遷移可逆性測度と、選択状態のロールバック演算である。
本手法は,時間差更新時のペナルティ項を動的に調整し,可逆性認識を直接値関数に統合する。
システムは選択的ロールバック演算子も含む。
アクションが予測リターンをその瞬時に推定値よりも著しく低くし、予め定義されたしきい値に違反すると、エージェントは罰せられ、進行ではなく前の状態に戻る。
これは準最適高リスク軌道を中断し、破滅的なステップを避ける。
可逆性評価と目標ロールバックを組み合わせることにより,安全性,性能,安定性を向上させる。
CliffWalking v0ドメインでは、壊滅的な転倒を99.8%減らし、平均エピソードリターンが55%増加した。
タクシーv3ドメインでは、違法行為を99.9%以上抑制し、累積報酬を65.7%改善した。
アブレーション研究は、ロールバック機構がこれらの安全性とパフォーマンス向上の根底にある重要な要素であることを確認し、安全で信頼性の高いシーケンシャルな意思決定に向けた堅牢なステップを示している。
関連論文リスト
- Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning [7.373349445059511]
リスク対応Q-ラーニング(RaQL)は、動的リスク目標に対するモデルフリーで2時間スケールの推定手段を提供する。
本稿では,CVaR(Conditional Value-at-Risk) RaQLの適応型トレーニングコントローラを提案し,これを日々のBitcoin取引タスクで評価する。
論文 参考訳(メタデータ) (2026-08-05T00:26:22Z) - Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms [21.868021164923515]
本研究では、不確実性信号を用いて信頼できない生成領域を識別し、モデルを再訓練することなく、以前の有効なプレフィックスにロールバックする推論時戦略について検討する。
評価結果から,ロールバックフレームワークは評価ベンチマークとモデル設定において,等予算の再起動よりも改善されていることがわかった。
論文 参考訳(メタデータ) (2026-07-31T05:26:42Z) - Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems [2.1686718805804976]
現代のITオペレーション(IT-Ops)では、不正な修理のコストは、アクションのコストをまったく上回ることが多い。
このギャップを埋めるためには, (i) リスク制約のある介入決定問題として安全な修復を再構築し, (ii) 三次元的リスク分解を導入し, (iii) コンテキスト適応型ヒューマン・イン・ザ・ループ(HITL)ゲートを設計し, バイナリ・フェイルセーフから帯域幅対応制御層に転換する。
論文 参考訳(メタデータ) (2026-07-22T10:43:14Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation [13.151825012034886]
本稿では,外部のTD3バックボーン上での条件付きバリュー・アット・リスク(CVaR)制約による最適化を通じて,リスクに敏感なポリシをトレーニングするフレームワークを提案する。
トレーニング中、このポリシーは累積コストに対するCVaR制約の下で最適化され、高コストテール結果に対する感受性が促進される。
重要な発見は、CVaR制約で訓練されたポリシーが、評価された状態の障害からより大きな安全マージンを維持することである。
論文 参考訳(メタデータ) (2026-05-13T22:53:47Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization [51.11398557420066]
我々は、推論時ポリシー最適化としてジェイルブレイクを改定するフレームワークであるMetisを紹介する。
メティスは比較手法の中でも89.2%で最強のアタック成功率(ASR)を達成している。
冗長な探索を最適化に置き換えることで、Metisはトークンコストを平均8.2倍、最大11.4倍に削減する。
論文 参考訳(メタデータ) (2026-05-11T06:45:00Z) - Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking [0.0]
現実世界の目的はしばしば不確実であり、文脈に依存し、内部的に矛盾している。
このミスマッチは、報酬のハッキング、過度な最適化、過度に信頼された振る舞いなど、アライメントの失敗につながる可能性がある。
本稿では,評価の不確かさと人間の嗜好の不確実性の両方を明示的にモデル化する二元的不確実性認識報酬フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T07:14:01Z) - OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences [64.01706941950489]
現在の安全パラダイムは、主に悪意のある意図や状況違反をターゲットとしている。
我々は,自律型および実施型エージェントのロバスト展開に不可欠なパラダイムである,結果駆動型安全に向けた安全フロンティアのシフトを提案する。
本稿では,トークンレベルの自己蒸留報酬の動的参照として,モデル固有の推論を統合したCASPO(Consequence-Aware Safety Policy Optimization)フレームワークを開発する。
論文 参考訳(メタデータ) (2026-03-10T14:16:43Z) - IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking [67.20568716300272]
Reinforcement Learning from Human Feedback (RLHF)は強力なLDMアライメントを実現するが、報酬ハッキングを導入することができる。
IR3(Interpretable Reward Reconstruction and Rectification)は,RLHFモデルを用いた暗黙的目標をリバースエンジニアリングし,解釈し,外科的に修復するフレームワークである。
我々は、IR3が地道報酬と0.89の相関を達成し、90%以上の精度でハッキング機能を識別し、元のモデルの3%以内の機能を維持しながら、ハッキングの挙動を著しく低減することを示した。
論文 参考訳(メタデータ) (2026-02-23T01:14:53Z) - Uncertainty-Aware Jamming Mitigation with Active RIS: A Robust Stackelberg Game Approach [65.06640919319413]
本稿では,アクティブリコンフィギュアブルインテリジェントサーフェス(ARIS)を利用したジャミング緩和について検討する。
正当側と敵側の戦略的相互作用をモデル化するために,Stackelbergゲーム定式化を採用する。
まず、ロバストなアンチジャミング設計のための正当側最適化に組み込む、従者のベストレスポンスとして最適なジャミングポリシーを導出する。
論文 参考訳(メタデータ) (2026-02-20T12:02:01Z) - Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity [16.835098688159004]
静的条件付きリスクリスク(CVaR)のようなテールエンドのリスク対策は、稀だが破滅的な事態を防止するために安全クリティカルな応用に用いられている。
我々は、離散化された拡張状態に依存するリスク逆値とモデルなしQ-ラーニングアルゴリズムを開発した。
実験により,本アルゴリズムはCVaR感受性ポリシーを学習し,効果的な性能保証トレードオフを実現することができた。
論文 参考訳(メタデータ) (2026-02-03T17:39:45Z) - Illuminating the Black Box: Real-Time Monitoring of Backdoor Unlearning in CNNs via Explainable AI [0.0]
バックドア攻撃は、誤分類を強制する悪意のあるトリガーを埋め込むことで、ディープニューラルネットワークに深刻なセキュリティ脅威を引き起こす。
本稿では,Grad-CAM(Grad-CAM)を学習プロセスに統合し,リアルタイムモニタリングと説明可能性を実現する新しいフレームワークを提案する。
BadNets攻撃によるCIFAR-10の実験では、我々のアプローチが96.51%から5.52%に減少し、99.48%のクリーン精度(82.06%)を維持した。
論文 参考訳(メタデータ) (2025-11-26T11:29:11Z) - SafeEvalAgent: Toward Agentic and Self-Evolving Safety Evaluation of LLMs [37.82193156438782]
本稿では, エージェント安全評価の新しいパラダイムとして, 継続的かつ自己進化的なプロセスとしてのリフレーミング評価を提案する。
本稿では、構造化されていないポリシー文書を自律的に取り込み、包括的な安全ベンチマークを生成し、永続的に進化させる、新しいマルチエージェントフレームワークSafeEvalAgentを提案する。
本実験はSafeEvalAgentの有効性を実証し,評価が強まるにつれてモデルの安全性が一貫した低下を示す。
論文 参考訳(メタデータ) (2025-09-30T11:20:41Z) - Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection [18.467741067831877]
本稿では,大規模言語モデルを自己監視に活用し,その出力を動的に補正する新しい推論時間手法であるプログレッシブ・セルフリフレクションを紹介する。
Llama-3.1-8B-Instructに提案手法を適用した結果,攻撃成功率は77.5%から5.9%に低下した。
提案手法はテスト時間スケーリングの手法として機能し,追加の自己回帰ラウンドによって推論オーバーヘッドのコストで安全性が向上する。
論文 参考訳(メタデータ) (2025-09-29T12:54:28Z) - Aurora: Are Android Malware Classifiers Reliable and Stable under Distribution Shift? [51.12297424766236]
AURORAは、その信頼性と運用上のレジリエンスに基づいて、マルウェア分類器を評価するためのフレームワークである。
AURORAは、ポイント・イン・タイムのパフォーマンスを超えるように設計されたメトリクスのセットによって補完される。
さまざまなドリフトのデータセットにわたるSOTAフレームワークの脆弱性は、ホワイトボードへの復帰の必要性を示唆している。
論文 参考訳(メタデータ) (2025-05-28T20:22:43Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z) - Safety Margins for Reinforcement Learning [53.10194953873209]
安全マージンを生成するためにプロキシ臨界度メトリクスをどのように活用するかを示す。
Atari 環境での APE-X と A3C からの学習方針に対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-07-25T16:49:54Z) - Towards Safe Reinforcement Learning via Constraining Conditional
Value-at-Risk [30.229387511344456]
本稿では,CVaR を所定の閾値以下に保ち,リスクに敏感な制約付き最適化問題を定式化する CVaR-Proximal-Policy-Optimization (CPPO) の新たな強化学習アルゴリズムを提案する。
実験の結果,CPPOは高い累積報酬を達成し,観察および遷移障害に対してより堅牢であることがわかった。
論文 参考訳(メタデータ) (2022-06-09T11:57:54Z) - Smooth Sequential Optimisation with Delayed Feedback [0.0]
累積入力からスムーズな報酬推定を推定する収縮への新しい適応を提案する。
数値シミュレーションにより, この適応は収縮の利点を保ち, 報酬推定の安定性を50%以上向上させることを示した。
論文 参考訳(メタデータ) (2021-06-21T17:51:36Z) - Corruption-robust exploration in episodic reinforcement learning [76.19192549843727]
本研究は, システムにおける報酬と遷移確率の両面において, 敵対的腐敗下での多段階・多段階・多段階強化学習について検討した。
我々の枠組みは、汚職の欠如をほぼ最適に後悔する効率的なアルゴリズムをもたらす。
特に,本研究は,根本的強化学習のためのBandit-Feedbackモデルにおいて,純粋にI.d.遷移からの逸脱を保証した最初のサブ線形後悔の保証を提供する。
論文 参考訳(メタデータ) (2019-11-20T03:49:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。