論文の概要: A Safe Action Is Not Enough: Feasible-Future Decoding for Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2610.05166v1
- Date: Sun, 04 Oct 2026 12:24:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.358221
- Title: A Safe Action Is Not Enough: Feasible-Future Decoding for Vision-Language-Action Policies
- Title(参考訳): 安全なアクションは、ビジョンランゲージ・アクション・ポリシーで実現可能な未来的デコード
- Abstract要約: 凍結したヴィジュアル・ランゲージ・アクション(VLA)ポリシーの下では、行動は可能であり、局所的に許容できるが、安全なタスク完了のためのポリシー支援のルートは残らない。
我々は、安全タスク完了に制限された、歴史条件付き政策環境トラジェクトリ法の、正確な次のブロック限界を導出する。
安全基準では、VICS-Gは6つの設定で累積安全コストを1.9%-57.5%削減するが、成功率は2.5ポイント、平均エピソードの長さは0.82ステップに留まる。
- 参考スコア(独自算出の注目度): 14.454207411896595
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A safe action is not necessarily a viable one. Under a frozen vision-language-action (VLA) policy, an action can be likely and locally admissible yet leave no policy-supported route to safe task completion. We call this the feasibility-likelihood gap: likelihood ranks the current action, whereas feasibility depends on the futures that remain after it. We derive the exact next-block marginal of the history-conditioned policy-environment trajectory law restricted to safe task completion. The derivation exposes a candidate-dependent feasible-future mass with two roles: its support records whether safe completion remains possible under the frozen continuation process, and its magnitude measures how much weighted safe-completion mass is preserved. Exact evaluation is impractical online, so we develop a selective finite-candidate approximation, derive conditions for recovering the best retained viable candidate, and instantiate it as an alarm-triggered, training-free reranker. On Safety-CHORES, VICS-G lowers mean cumulative safety cost by 1.9%-57.5% across six settings while remaining within 2.5 percentage points of policy sampling in success and 0.82 steps in mean episode length. The resulting decoder is tied to an exact policy-relative safe-completion target, yet requires neither retraining of the base policy nor online trajectory rollouts.
- Abstract(参考訳): 安全な行動は必ずしも実行可能な行動ではない。
凍結したヴィジュアル・ランゲージ・アクション(VLA)ポリシーの下では、行動は可能であり、局所的に許容できるが、安全なタスク完了のための政策支援のルートは残らない。
可能性は現在の行動をランク付けするが、実現可能性はその後に残る未来に依存する。
我々は、安全タスク完了に制限された、歴史条件付き政策環境トラジェクトリ法の、正確な次のブロック限界を導出する。
この導出は、凍結した継続過程下で安全な完了が可能であるかどうかの支持記録と、その大きさがどれだけの重み付けされたセーフコンプリート質量が保存されているかを測定するという、2つの役割を持つ候補に依存した実現可能な質量を露呈する。
厳密な評価はオンラインでは行わないので、選択的な有限候補近似を開発し、最良の有効候補を復元するための条件を導出し、アラームトトリガーでトレーニング不要なリランカとしてインスタンス化する。
安全基準では、VICS-Gは6つの設定で累積安全コストを1.9%-57.5%削減するが、成功率は2.5ポイント、平均エピソードの長さは0.82ステップに留まる。
結果として生成されたデコーダは、厳密なポリシー上のセーフコンプリートターゲットと結びついているが、基本方針の再トレーニングやオンライントラジェクトリのロールアウトは必要としない。
関連論文リスト
- Humanoid Safe Stop via Learned Stoppability Value [61.25464390942355]
本稿では,学習した停止ポリシーと学習した停止可能性推定器を組み合わせたタスク非依存のフレームワークを提案する。
推定器は、固定された停止ポリシーの実際の結果によって監督される停止確率推定器と、ハミルトン・ヤコビの物理的状態に対するバックアップによって監督される到達回避推定器である。
論文 参考訳(メタデータ) (2026-09-02T09:29:39Z) - Beyond Task Completion: Training Capable and Safe Computer-Use Agents [6.43574655903064]
コンピュータ利用エージェント(CUA)は、良質なタスクを完了し、環境の危険を回避し、安全な完了パスが残っているときに継続する必要がある。
我々は、タスク実行能力と安全対応意思決定のためのCUAを共同で訓練するSCOPE(Safety and Capability Optimization for Policy Execution)を開発した。
SCOPE-RLはOSWorldで54.17%のタスク成功率、OS-BLINDで64.30%のアタック回避率を達成した。
論文 参考訳(メタデータ) (2026-08-27T05:43:50Z) - From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving [56.30087557121323]
AlignADVは学習性誘導型クローズドループ対向トレーニングフレームワークである。
敵のシナリオを解決可能で能力に整合したカリキュラムに変換する。
実験の結果、最大40.6%のトレーニングステップが短縮された。
論文 参考訳(メタデータ) (2026-06-12T02:13:55Z) - VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring [60.53395558502203]
Vision-Language Embodied Safety Agent (VLESA)は、自我中心のビデオから人間の活動を監視する。
VLESAは、コンテキストに応じて同一のアクションが安全または危険である意図に依存した安全性に対処する。
目標を共同で推測し,映像から将来の行動を予測するための意図-行動予測エージェントを提案する。
論文 参考訳(メタデータ) (2026-06-02T17:42:17Z) - Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation [13.151825012034886]
本稿では,外部のTD3バックボーン上での条件付きバリュー・アット・リスク(CVaR)制約による最適化を通じて,リスクに敏感なポリシをトレーニングするフレームワークを提案する。
トレーニング中、このポリシーは累積コストに対するCVaR制約の下で最適化され、高コストテール結果に対する感受性が促進される。
重要な発見は、CVaR制約で訓練されたポリシーが、評価された状態の障害からより大きな安全マージンを維持することである。
論文 参考訳(メタデータ) (2026-05-13T22:53:47Z) - Safe-Support Q-Learning: Learning without Unsafe Exploration [5.892169642535822]
トレーニング中の安全でない状態訪問を解消するQラーニングに基づく安全なRLフレームワークを提案する。
誘導軌道が安全な集合内にあるという仮定の下で、このポリシーは、ほぼ最適性を必要とせず、安全な領域内で十分な探索を可能にする。
実験結果から,提案手法は安定な学習とよく校正された値推定を実現し,既存のベースラインと同等あるいは優れた性能で安全な振る舞いを得られることが示された。
論文 参考訳(メタデータ) (2026-04-28T08:43:39Z) - Conformal Policy Control [50.46542384484142]
我々は、安全な参照ポリシーを、最適化されているが未試験のポリシーの確率的規制として使う方法を示す。
保守的な最適化方法とは異なり、ユーザーが正しいモデルクラスを識別したとは仮定しない。
自然言語質問応答から生体分子工学まで,本研究の応用実験は,デプロイ開始当初から安全な探索が可能であることを示唆している。
論文 参考訳(メタデータ) (2026-03-02T18:54:36Z) - SafePath: Conformal Prediction for Safe LLM-Based Autonomous Navigation [67.22657932549723]
SafePathは,LLM(Large Language Models)を公式な安全保証とともに拡張するフレームワークである。
第1段階では,多様な候補経路を生成するLCMを用いて,エージェントの挙動と環境条件に基づく軌道探索を行う。
第2段階では、SafePathはリスクの高いトラジェクトリをフィルタリングし、少なくとも1つのセーフオプションがユーザ定義の確率に含まれていることを保証します。
最終段階では,不確実性が低い場合や不確実性が高い場合,人間に制御を委譲する場合の衝突リスクが最も低い経路を選択する。
論文 参考訳(メタデータ) (2025-05-14T14:28:24Z) - Safe Reinforcement Learning with Dead-Ends Avoidance and Recovery [13.333197887318168]
安全は、現実的な環境課題に強化学習を適用する上で大きな課題の1つである。
安全かつ安全でない状態を識別する境界を構築する手法を提案する。
我々の手法は、最先端のアルゴリズムよりも安全性違反が少ないタスク性能を持つ。
論文 参考訳(メタデータ) (2023-06-24T12:02:50Z) - Feasible Actor-Critic: Constrained Reinforcement Learning for Ensuring
Statewise Safety [1.9573380763700712]
本稿では,モデルレス制約付き安全な強化学習法であるFACアルゴリズムを提案する。
我々は、どの政策を選択しても本質的に安全ではないと主張する州もあるが、他の州には安全を保証する政策があり、そのような州や政策は実現可能であると我々は主張する。
我々は,FACが制約満足度と報酬最適化の両方の観点から,従来の予測に基づく制約付きRL法より優れていることを理論的に保証する。
論文 参考訳(メタデータ) (2021-05-22T10:40:58Z) - Conservative Safety Critics for Exploration [120.73241848565449]
強化学習(RL)における安全な探索の課題について検討する。
我々は、批評家を通じて環境状態の保守的な安全性推定を学習する。
提案手法は,破滅的故障率を著しく低く抑えながら,競争力のあるタスク性能を実現することができることを示す。
論文 参考訳(メタデータ) (2020-10-27T17:54:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。