論文の概要: Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance
- arxiv url: http://arxiv.org/abs/2605.12561v1
- Date: Mon, 11 May 2026 23:55:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.574754
- Title: Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance
- Title(参考訳): 実行時の学習:実行時保証によるコミュニケーション効率の良い強化学習
- Authors: Adam Haroon, Erick J. Rodríguez-Seda, Cody Fleming, Tristan Schuler,
- Abstract要約: Lyapunov の安全性保護の下で制御入力と通信効率のタイミング決定を単一ポリシで学習できることが示される。
実行時保証層は、1ステップのリアプノフ予測と事前計算されたLQRバックアップを介してポリシーをオーバーライドする。
12-state 3D quadrotor のケーススタディでは、古典的な STC が難解な高次元システムにフレームワークを拡張している。
- 参考スコア(独自算出の注目度): 0.27998963147546146
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safe reinforcement learning (RL) typically asks $\textit{what}$ an agent should do. We ask $\textit{when}$ it needs to act, and show that a single policy can jointly learn control inputs and communication-efficient timing decisions under a pointwise Lyapunov safety shield. We focus on stabilization around a known equilibrium, where CARE-based LQR backups, Lyapunov certificates, and classical Lyapunov-STC are well defined, enabling clean comparison against analytical baselines. A run-time assurance (RTA) layer overrides the policy via a one-step-ahead Lyapunov prediction and a precomputed LQR backup, providing a strictly stronger guarantee than constrained MDP methods that enforce safety only in expectation. On an inverted pendulum, cart--pole, and planar quadrotor, the learned policy achieves $1.91\times$, $1.45\times$, and $3.51\times$ higher mean inter-sample interval (MSI) than a Lyapunov-triggered baseline; a fixed LQR controller at the same average rate is unstable on all three plants, showing that adaptive timing, not a lower average rate, makes sparsity safe. A CARE-derived Lyapunov reward transfers across environments without redesign, with a single weight $w_c$ controlling the stability--communication tradeoff; ablations confirm the RTA shield is essential, with its removal reducing MSI by $1.27$--$1.84\times$ and degrading state norms. A preference-conditioned extension recovers the full tradeoff frontier from one model at $\tfrac{2}{11}$ of training compute, and SAC experiments show the results are algorithm-agnostic across discrete and continuous domains. A 12-state 3D quadrotor case study extends the framework to higher-dimensional systems where classical STC is intractable, and robustness to $\pm30\%$ mass variation and disturbances shows graceful degradation, with the RTA absorbing what the learned policy cannot.
- Abstract(参考訳): 安全な強化学習(RL)は通常、エージェントがすべき$\textit{what}$を要求します。
我々は$\textit{when}$を振る舞い、単一のポリシーが、制御入力と通信効率の高いタイミング決定を、ポイントワイズなLyapunov安全シールドの下で共同で学習できることを示します。
本稿では,CARE ベースの LQR バックアップや Lyapunov 証明書,古典的な Lyapunov-STC が適切に定義され,解析的ベースラインに対するクリーンな比較を可能にするような,既知の平衡の安定化に着目する。
実行時保証(RTA)レイヤは、一段階のリアプノフ予測と事前計算されたLQRバックアップを通じてポリシーをオーバーライドし、期待時にのみ安全を強制する制限されたMDPメソッドよりも厳格な保証を提供する。
逆振り子、カートポール、平面四極子では、学習されたポリシーは1.91\times$, $1.45\times$, and $3.51\times$ the mean inter-sample interval (MSI) than a Lyapunov-triggered baseline; 同じ平均速度で固定されたLQRコントローラは3つの植物で不安定であり、平均速度が低く、適応的なタイミングがスパシティを安全にすることを示している。
CARE 由来の Lyapunov の報酬は再設計なしに環境間で伝達され、安定性と通信のトレードオフを制御できる単一の重量$w_c$ が与えられ、RTA シールドは必須であることが保証され、MSI の除去は 1.27$-$1.84\times$ に減らされ、状態規範が低下する。
選好条件付き拡張は、トレーニング計算の$$\tfrac{2}{11}$のモデルから完全なトレードオフフロンティアを復元し、SAC実験は、結果を離散的および連続的なドメイン間でアルゴリズムに依存しないことを示す。
12-state 3D quadrotor のケーススタディでは、古典的な STC が抽出可能な高次元システムにフレームワークを拡張し、ロバスト性は$\pm30\% の質量変動と乱れに拡張され、RTA は学習方針ができないことを吸収する。
関連論文リスト
- MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents [0.0]
検索強化エージェントに対するメモリ中毒攻撃を,統合評価フレームワークを用いたStackelbergゲームとして定式化する。
ASR-R: 0.25〜1.00$) による攻撃成功度を4倍に向上させる。
私たちの主な貢献は、勾配結合に接地したキャリブレーションに基づく防御であるMEMSADである。
論文 参考訳(メタデータ) (2026-05-05T08:15:41Z) - $V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts [81.48669089692189]
一般値モデル(例えば$V_0.5$)は、コンテキスト内のモデル機能を明示的にエンコードすることで、事前訓練された値推定を実現する。
本稿では,このような値モデルにより予測されるベースラインと,スパースロールアウトから導出される経験的平均とを適応的に融合する$V_0.5$を提案する。
V_0.5$はGRPOとDAPOを大きく上回り、より高速な収束と約10%のパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:41Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs [19.079556051442168]
強化学習(Reinforcement Learning, RL)は、推論タスクにおける大規模言語モデルの改善に広く用いられている。
しかし、REINFORCE や GRPO のような広く採用されている批判のない政策段階的手法では、高い非同期性によって政策段階的推定器は明らかにノイズを生じさせる。
本稿では,REINFORCE/GRPOスタイルのアルゴリズムの安定化手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T18:40:51Z) - Unifying Stable Optimization and Reference Regularization in RLHF [64.16830602324345]
本稿では、報酬ハッキングの防止と安定したポリシー更新の維持を目標とする統一正規化手法を提案する。
我々の単純で原則化されたアライメント目的は、監督された微調整の損失を軽減し、優れたトレードオフをもたらし、アライメント結果と実装の複雑さの両方を明らかに改善する。
論文 参考訳(メタデータ) (2026-02-12T03:31:19Z) - Safe Langevin Soft Actor Critic [10.683491090059867]
拘束強化学習における報酬と安全性のバランスをとるために,安全ランゲヴィン・ソフト・アクター・クリティカル(SL-SAC)を導入した。
SL-SACは10タスク中7タスクで最低コストを達成し,競争的リターンを維持していることを示す。
Safety-Gymnasiumでは、SL-SACは最先端のベースラインと比較して、速度タスクの19-63%のコスト削減を実現している。
論文 参考訳(メタデータ) (2026-01-31T08:06:35Z) - Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning [48.34492357368989]
本稿では,安定なオン・ポリティクス学習をサポートし,オフ・ポリティクスデータの再利用を原則とするプリミティブ・デュアル・フレームワークを提案する。
R2VPO$は、強いクリッピングベースのベースラインよりも17%の平均的な相対的なゲインで優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-06T14:01:42Z) - Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning [14.852334980733369]
共用型マルチエージェント強化学習において、各エージェントの共用報酬への貢献を阻害する信用割り当ては重要な課題である。
本稿では、この制約から信用モデリングを分離するアプローチであるTAR(Temporal-Agent Reward Redistribution)を導入する。
本手法は,モデル精度によらず最適ポリシーが維持されることを保証するPBRSと等価であることを示す。
論文 参考訳(メタデータ) (2025-02-07T12:07:57Z) - Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption [60.958746600254884]
本研究は、モデルベース強化学習(RL)における敵対的腐敗の課題に取り組む。
本稿では,MLE に対する不確実性重みとして全変量 (TV) に基づく情報比を利用する,汚損楽観的 MLE (CR-OMLE) アルゴリズムを提案する。
我々は、重み付け手法をオフライン設定にまで拡張し、汚損性悲観的MLE (CR-PMLE) というアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-02-14T07:27:30Z) - Provably Efficient Safe Exploration via Primal-Dual Policy Optimization [105.7510838453122]
制約付きマルコフ決定過程(CMDP)を用いた安全強化学習(SRL)問題について検討する。
本稿では,関数近似設定において,安全な探索を行うCMDPの効率の良いオンラインポリシー最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-03-01T17:47:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。