論文の概要: Adversarial observations in probabilistic State-Space Models for robust Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.20880v1
- Date: Thu, 18 Jun 2026 19:15:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 12:18:19.337635
- Title: Adversarial observations in probabilistic State-Space Models for robust Reinforcement Learning
- Title(参考訳): 頑健な強化学習のための確率的状態空間モデルの逆観測
- Authors: M. Santos-Pascual, D. Ríos Insua,
- Abstract要約: 部分的あるいは対向的な観測可能性の下での意思決定は、環境の潜伏状態とその関連する不確実性の正確な推測を必要とする。
本研究は、線形確率的状態空間モデルに対する逆攻撃を解析し、一般に強化学習アーキテクチャに統合される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Decision-making under partial or adversarial observability requires accurate inference of the environment's latent state and its associated uncertainty. This work analyses adversarial attacks on linear probabilistic state-space models, commonly integrated within reinforcement learning architectures, where the attacker alters observations under likelihood constraints that ensure the perturbations remains consistent. We analyze how such adversarial yet realistic observation shifts influence the latent state and influence policy decisions. This perspective provides a principled pathway toward building more robust reinforcement learning systems, with direct relevance to safety-critical domains such as robotics, where reliable operation under sensor noise, partial failures, and adversarial conditions is essential.
- Abstract(参考訳): 部分的あるいは対向的な観測可能性の下での意思決定は、環境の潜伏状態とその関連する不確実性の正確な推測を必要とする。
この研究は、線形確率的状態空間モデルに対する敵対的攻撃を解析し、一般に強化学習アーキテクチャに組み込まれ、攻撃者は摂動が一定であることを保証するため、確率的制約の下で観測を変更する。
我々は、このような敵対的かつ現実的な観察変化が潜伏状態にどのように影響し、政策決定に影響を及ぼすかを分析する。
この視点は、より堅牢な強化学習システムを構築するための原則的な経路を提供し、センサーノイズ、部分的故障、敵の条件下での信頼性の高い操作が不可欠であるロボット工学のような安全クリティカルな領域に直接関係している。
関連論文リスト
- Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions [0.0]
本稿では,非マルコフ決定プロセスと古典的強化学習アーキテクチャのギャップを埋める新しいフレームワークである予測強化学習(ARL)を紹介する。
ジャンプ拡散と構造破壊によって特徴づけられる環境では、伝統的な状態に基づく手法は、正確なフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホ
論文 参考訳(メタデータ) (2026-04-06T13:15:44Z) - Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry [19.669339224904277]
決定的なリスクは本質的な詐欺であり、モデルがユーザを戦略的に誤解させ、自身の目的を達成させる。
CoT監視に基づく既存のアライメントアプローチは、明確な推論トレースを監督する。
本稿では,この分布非対称性を正規化する新たなアライメント目標である安定非対称性正規化(SAR)を提案する。
論文 参考訳(メタデータ) (2026-03-27T09:47:57Z) - State-Dependent Safety Failures in Multi-Turn Language Model Interaction [70.52906620450847]
我々は、状態空間の観点から安全性障害を研究し、多くのマルチターン障害が構造化状態の進化から生じることを示す。
本稿では,対話履歴を状態遷移演算子として扱う状態指向診断フレームワークSTARを紹介する。
静的な評価の下で頑健なように見えるシステムは、構造化されたマルチターン相互作用の下で、迅速かつ再現可能な安全破壊を受けることができる。
論文 参考訳(メタデータ) (2026-03-15T12:13:01Z) - Sim2Act: Robust Simulation-to-Decision Learning via Adversarial Calibration and Group-Relative Perturbation [54.29523408543184]
シミュレーションと意思決定の学習は、現実世界の展開を危険にさらすことなく、デジタル環境で安全なポリシートレーニングを可能にする。
既存のアプローチでは、平均的なシミュレーションの忠実さを改善するか、保守的な正規化を採用するかに重点を置いている。
提案するSim2Actは,シミュレータとポリシーのロバスト性の両方に対処するロバストなシミュレーション・トゥ・意思決定フレームワークである。
論文 参考訳(メタデータ) (2026-03-10T00:51:47Z) - Transformer-Based Reinforcement Learning for Autonomous Orbital Collision Avoidance in Partially Observable Environments [0.3093890460224435]
自律軌道衝突回避のためのトランスフォーマーに基づく強化学習フレームワークを提案する。
この研究の中心的な貢献は、トランスフォーマーベースのPartially Observable Markov Decision Processアーキテクチャの利用である。
この統合は、不完全な監視環境下でより確実に動作可能な衝突回避エージェントを訓練するための基盤を提供する。
論文 参考訳(メタデータ) (2026-02-05T04:57:58Z) - Enhancing Uncertainty Quantification for Runtime Safety Assurance Using Causal Risk Analysis and Operational Design Domain [0.0]
本研究では,環境条件を明確に取り入れた従来の不確実性定量化の強化を提案する。
本研究では,ハザード解析・リスクアセスメント(HARA)とフォールトツリーモデリングを活用し,システム機能に影響を及ぼす重要な運用条件を特定する。
実行時に、このBNはリアルタイム環境観測を用いてインスタンス化され、安全推定よりも確率分布を推定する。
論文 参考訳(メタデータ) (2025-07-04T12:12:32Z) - Realistic Adversarial Attacks for Robustness Evaluation of Trajectory Prediction Models via Future State Perturbation [1.124958340749622]
軌道予測は自動運転車システムの重要な要素である。
現在のアプローチでは、周囲のエージェントの過去の位置を乱すことに重点を置いている。
本稿では,これらの対向軌道の現実性と影響を評価するための新しい性能指標を提案する。
論文 参考訳(メタデータ) (2025-05-09T15:40:32Z) - Benchmarking the Spatial Robustness of DNNs via Natural and Adversarial Localized Corruptions [49.546479320670464]
本稿では,セグメンテーションモデルの空間的ロバスト性を評価するための特別な指標を紹介する。
本稿では,モデルロバスト性をより深く理解する手法として,地域対応型マルチアタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック分析を提案する。
その結果、モデルがこれらの2種類の脅威に異なる反応を示すことが明らかとなった。
論文 参考訳(メタデータ) (2025-04-02T11:37:39Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。