論文の概要: Privileged Critic Training Enables Sensor-Free Thruster Fault Adaptation in End-to-End RL
- arxiv url: http://arxiv.org/abs/2608.22976v1
- Date: Mon, 24 Aug 2026 08:36:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.996072
- Title: Privileged Critic Training Enables Sensor-Free Thruster Fault Adaptation in End-to-End RL
- Title(参考訳): 終端RLにおけるセンサレススラスタ故障適応を可能にするPrivileged Critic Training
- Authors: Ricard Marsal I Castan, Miguel A. Olivares-Méndez,
- Abstract要約: スラスタ駆動ロボットの耐故障ナビゲーションには、バイナリでもなく、完全に観測不可能な障害へのオンライン適応が必要である。
センサレス故障適応には,特権的批判訓練が十分であることを示す。
我々は、特権的非対称批評家によって訓練された繰り返しメモリを持つRAFT(Recurrent Asymmetric Fault Tolerant)を提案する。
- 参考スコア(独自算出の注目度): 2.492300648514128
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fault-tolerant navigation for thruster-actuated robots requires online adaptation to failures that are neither binary nor fully observable: thrusters may degrade continuously, fail dead, or jam stuck-open. Classical fault detection pipelines require dedicated sensors unavailable at deployment; oracle controllers that observe the true failure state are equally impractical. We show that privileged critic training is sufficient for sensor-free fault adaptation: giving the PPO value function access to the true degradation state dgt during training, while the actor receives only standard task observations, shapes a policy that compensates for failures at deployment without any dedicated fault sensing. We propose RAFT (Recurrent Asymmetric Fault Tolerant), a policy with recurrent memory trained with a privileged asymmetric critic. Evaluated on a floating-platform robot (8 thrusters, 1 reaction wheel) under up to four simultaneous thruster failures, RAFT achieves 70.2% success at four concurrent failures, closing 84% of the gap from a failure-naive baseline (4.8%) to an oracle policy that sees the full degradation state at deployment (82.4%). All code, checkpoints, and data are open-source.
- Abstract(参考訳): スラスタ駆動ロボットの耐故障ナビゲーションには、バイナリでも完全に観測不可能な障害へのオンライン適応が必要である。
古典的な障害検出パイプラインは、デプロイ時に利用できない専用のセンサーを必要とする。
PPO値関数をトレーニング中に真の劣化状態dgtにアクセスできる一方で、アクターは標準的なタスク観察のみを受け取り、専用の障害検出をせずにデプロイ時の障害を補償するポリシーを形成する。
我々は、特権的非対称批評家によって訓練された繰り返しメモリを持つRAFT(Recurrent Asymmetric Fault Tolerant)を提案する。
RAFTは、最大4回の同時スラスタ故障で浮動式プラットフォームロボット(8つのスラスタ、1つのリアクションホイール)で評価され、4回の同時故障で70.2%の成功を達成し、障害を負うベースライン(4.8%)から配置時の完全な劣化状態(82.4%)を見るオラクルポリシー(英語版)までのギャップの84%を閉じた。
すべてのコード、チェックポイント、データはオープンソースです。
関連論文リスト
- FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - RL-Ballast: Ship Ballast Water Path Planning and Clog Prediction via Reinforcement Learning [0.0]
本稿では,適応的バラスト水経路計画とセンサフルーガルブロック候補スコアリングのためのグラフベース深部強化学習フレームワークRL-Ballastを提案する。
部分的に観測可能なバラスト環境は、フレームスタッキングされたタンクレベルとアクション結果と近似され、高次元のPMDPを明示的にモデル化することなく、隠蔽効果を推測することができる。
モンテカルロシミュレーションにより、RL-Ballastは予期せぬ1ブロックシナリオをすべて完了し、Dijkstraルールベースのベースラインと比較して平均決定ステップを61.0から41.5に削減した。
論文 参考訳(メタデータ) (2026-07-06T10:35:51Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - What Actually Works for Spacecraft Fault-Tolerant Control: An Honest Settled-Gate Benchmark of Learned and Classical Methods [2.28438857884398]
近年のFTCの研究は、宇宙船のアクチュエーターの故障で高い成功を収めたことを報告している。
我々は、成功がトレーニングで見たことのない欠陥にそれを保持することを意味しているとき、宇宙船が何を指しているのかを尋ねる。
私たちは、落ち着いたゲートの周りに構築されたベンチマークで回答します。
論文 参考訳(メタデータ) (2026-06-24T04:08:39Z) - Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield [2.28438857884398]
ルールベースの自律性は認証可能であるが不安定であり、学習された自律性は能力があるが検証するのは難しい。
AMPLE-GNCは3層誘導、ナビゲーション、制御スタックである。
文法制約付き復号化による事前訓練された360Mモデルの微調整は、ハードな出力値保証を与える。
我々は,有能な制御器であっても,ラッチングセーフホールドシールドが抑制可能であることを示す。
論文 参考訳(メタデータ) (2026-06-24T03:55:21Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors [41.78467154106763]
本稿では,実行エラーをRLトレーニングループ内の修正監視に変換するフレームワークであるFission-GRPOを提案する。
私たちのコアメカニズムは、微調整されたエラーシミュレータの診断フィードバックによって、新しいトレーニングインスタンスへの各障害軌跡を増大させます。
BFCL v4 Multi-Turnでは、Fission-GRPOはQwen3-8Bのエラー回復率を5.7%改善し、その精度は4%向上した。
論文 参考訳(メタデータ) (2026-01-22T03:57:35Z) - Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation [48.26705293834693]
FARL(Failure-Aware Offline-to-Online Reinforcement Learning)は、実世界の強化学習における障害を最小限にする新しいパラダイムである。
本研究では,オンライン探索における障害防止のために,世界モデルに基づく安全評論家とオフラインで訓練された回復ポリシーを統合するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-12T18:53:11Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Soft Actor-Critic Deep Reinforcement Learning for Fault Tolerant Flight
Control [3.236217153362305]
オフライントレーニングされたソフトアクター・クリティカル深部強化学習コントローラは、高度に結合した操作で成功している。
制御器は6つの故障事例に対して堅牢であり、その中には15デグで詰まった舵、アイレロンの有効性を70%低下させ、構造的故障、アイシング、後向きのc.g.シフトなどが含まれる。
論文 参考訳(メタデータ) (2022-02-16T07:22:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。