論文の概要: How to Learn from What a Human Would Avoid? Intervention-Aware World Models with Real-World RL for Dexterous Manipulation
- arxiv url: http://arxiv.org/abs/2609.06009v1
- Date: Sat, 05 Sep 2026 10:28:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 11:56:55.775223
- Title: How to Learn from What a Human Would Avoid? Intervention-Aware World Models with Real-World RL for Dexterous Manipulation
- Title(参考訳): 人間が避けるべきことから学ぶ : リアルワールドRLを応用したインターベンション・アウェア・ワールド・モデル
- Abstract要約: WHIRLは、二元的人間の介入を前方予測信号に変換する安全を意識したRLフレームワークである。
16-DoF LEAPハンドの枠組みを凸や不規則な物体の把握、プリズマティックな操作、多段階の長期タスクにまたがって評価した。
- 参考スコア(独自算出の注目度): 27.05205948648607
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-fingered dexterous manipulation remains a frontier for real-world reinforcement learning (RL) due to the high-dimensional action space and the prohibitive cost of hardware failures. While human-in-the-loop (HIL) RL allows operators to intervene before failures occur, current pipelines often treat these interventions as reactive corrections, discarding the rich safety signal inherent in the operator's decision to take control. In this paper, we ask: How can we learn from what a human would avoid? We present WHIRL, a safety-aware RL framework that transforms binary human interventions into forward-predictive signals for proactive risk avoidance. Our approach centers on an intervention-aware latent world model with four prediction heads: dynamics, reward, termination, and a novel per-state intervention-probability head that learns to predict the likelihood of a human takeover at future states. This head provides an actor-side risk-shaping term that discourages the policy from entering "intervention-prone" regions, modeling the operator's internal safety threshold. We evaluate our framework on a 16-DoF LEAP Hand across tasks spanning convex and irregular object grasping, prismatic manipulation, and long-horizon multi-stage tasks. Our results show that predictive risk-shaping enables the system to achieve a 96.7 percent success rate on complex grasping tasks while reducing the operator intervention burden by up to 84 percent in step-weighted terms. By closing the loop between human intuition and predictive world modeling, this work provides a practical safety-aware recipe for training complex dexterous agents in the real world while reducing operator fatigue and hardware-risk exposure.
- Abstract(参考訳): マルチフィンガードデキスタラスな操作は、高次元のアクション空間とハードウェア障害の禁止コストのため、実世界の強化学習(RL)のフロンティアである。
HIL(Human-in-the-loop) RL(Human-in-the-loop)は、障害が発生する前にオペレータが介入することを可能にするが、現在のパイプラインはしばしばこれらの介入を反応性の修正として扱い、オペレータが制御する決定に固有の豊富な安全信号を捨てる。
この論文では、人間が避けるべきものからどのように学ぶことができるのかを問う。
WHIRLは、二元的人間の介入を前方予測信号に変換する安全を意識したRLフレームワークである。
我々のアプローチは、動的、報酬、終了という4つの予測ヘッドを持つ介入対応の潜伏世界モデルと、将来の国家における人間の乗っ取りの可能性を予測する新しい国家ごとの介入確率ヘッドに焦点を当てている。
このヘッドは、オペレータの内部安全閾値をモデル化して、ポリシーが"干渉防止"領域に入るのを阻止するアクター側のリスク形成用語を提供する。
16-DoF LEAPハンドの枠組みを,凸や不規則な物体の把握,プリズマティックな操作,長距離多段階タスクにまたがるタスクにわたって評価した。
その結果,予測的リスク形成により,複雑な把握作業において96.7%の成功率を達成できると同時に,作業者の介入負担を,ステップ重み付き用語で最大84%削減できることがわかった。
人間の直感と予測的世界モデリングのループを閉じることで、操作者の疲労とハードウェアリスクの曝露を低減しつつ、現実世界で複雑な外乱エージェントを訓練するための実用的安全に配慮したレシピを提供する。
関連論文リスト
- GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning [35.461668686434244]
強化学習(RL)における不整合人間の介入信号を活用するための枠組みを提案する。
本研究では、分散RLと量子Qネットワークを用いて、スパースタスク報酬や不整合人間の介入によって引き起こされるリターン変動をモデル化する。
我々は,4つの多種多様なシミュレーション操作タスクと,最先端の介入に基づく手法に対する2つの現実シナリオについて,GAINSを評価した。
論文 参考訳(メタデータ) (2026-08-16T12:19:04Z) - ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning [44.43333438148224]
人間の介入が不十分な人型VLA後トレーニングのための強化学習フレームワークであるROVEを提案する。
まず、ROVEは、ヒューマノイド操作のためのデプロイメントと介入データを収集できる、Human-in-the-loopパイプラインを導入している。
第二に、OVE(Optimistic Value Estimation)を用いて、混合質軌道から高価値な振る舞いを優先順位付けする。
論文 参考訳(メタデータ) (2026-06-15T17:45:06Z) - OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation [16.28822074948203]
Online Human Preference as Guidance in Reinforcement Learning (OHP-RL) は、政策学習の指針となる選好情報として人間の介入を利用するフレームワークである。
OHP-RLは、強い成功率、より高速な収束、そして従来のアプローチよりもはるかに低い人間の介入努力を一貫して達成する。
論文 参考訳(メタデータ) (2026-05-15T14:02:34Z) - Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming [64.48633529149579]
本稿では,VLA(Vision-Language-Action)モデルの言語的変異に対する脆弱性を明らかにするための新しいフレームワークを提案する。
本手法は, ストレス試験用VLAエージェントへのスケーラブルなアプローチを示すため, 平均作業成功率を93.33%から5.85%に下げる。
論文 参考訳(メタデータ) (2026-04-07T08:43:36Z) - Safety, Security, and Cognitive Risks in World Models [0.0]
世界モデルは環境力学の内部シミュレーターを学習する。
世界モデルは、ロボット工学、自動運転車、エージェントAIにおいて、自律的な意思決定の基礎となってきています。
本稿では,世界モデル景観を調査し,軌跡の持続性と表現的リスクの形式的定義を紹介する。
本稿では,GRUベースのRSSMに対するトラジェクティブ・パーシスタント・アタックを実証する実証的概念証明を提案する。
論文 参考訳(メタデータ) (2026-04-01T19:57:33Z) - Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving [82.69496624372944]
「専門家のように運転するのが普通」は限定的な一般化に苦しむ。
E2E-ADシステムは専門家の行動監督なしに信頼できる判断を下せるか?
本稿では,リスクを意識した世界モデル予測制御という統合フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-26T17:32:30Z) - Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models [62.16655896700062]
活性化ステアリングは大規模言語モデル(LLM)の有用性を高める技術である
重要かつ過度に調査された安全リスクを無意識に導入することを示します。
実験によると、これらの介入は強制乗算器として機能し、ジェイルブレイクに新たな脆弱性を発生させ、標準ベンチマークで攻撃成功率を80%以上向上させる。
論文 参考訳(メタデータ) (2026-02-03T12:32:35Z) - Real-world Reinforcement Learning from Suboptimal Interventions [39.23110010675281]
SiLRI (SiLRI) は、現実のロボット操作タスクのための州立ラグランジアン強化学習アルゴリズムである。
我々のアルゴリズムは,人間間遠隔操作システムに基づいて,多様な操作タスクに関する実世界の実験を通じて評価される。
論文 参考訳(メタデータ) (2025-12-30T15:26:42Z) - AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models [75.214287449744]
我々は,Impartial World Modelを中心に構築されたポストトレーニング政策改善のためのフレームワークを紹介する。
私たちの主な貢献は、このモデルに危険について正直であることを教えることです。
大規模な実験を通じて、我々のモデルは失敗を予測する上で、ベースラインを著しく上回っていることを実証する。
論文 参考訳(メタデータ) (2025-11-25T13:57:24Z) - BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models [57.5404308854535]
大型言語モデル(LLM)における安全バックドア攻撃は、正常な相互作用中の検出を回避しながら、安全でない振る舞いをステルス的に引き起こすことができる。
モデル埋め込み空間において,バックドアトリガーが比較的均一なドリフトを引き起こすという知見を活かした緩和手法であるBEEARを提案する。
両レベル最適化手法は、不要な振る舞いを誘発する普遍的な埋め込み摂動を特定し、モデルパラメータを調整し、これらの摂動に対する安全な振舞いを強化する。
論文 参考訳(メタデータ) (2024-06-24T19:29:47Z) - Safeguarded Progress in Reinforcement Learning: Safe Bayesian
Exploration for Control Policy Synthesis [63.532413807686524]
本稿では、強化学習(RL)におけるトレーニング中の安全維持の問題に対処する。
探索中の効率的な進捗と安全性のトレードオフを扱う新しいアーキテクチャを提案する。
論文 参考訳(メタデータ) (2023-12-18T16:09:43Z) - Efficient Learning of Safe Driving Policy via Human-AI Copilot
Optimization [38.21629972247463]
我々はHuman-AI Copilot Optimization (HACO)と呼ばれる新しいループ学習手法を開発した。
提案したHACOは、トライアル・アンド・エラー探査と人間の部分的なデモンストレーションの両方から、ハイパフォーマンスエージェントのトレーニングに有効に活用する。
実験により、HACOは安全な運転ベンチマークにおいて、かなり高い試料効率を達成することが示された。
論文 参考訳(メタデータ) (2022-02-17T06:29:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。