論文の概要: Learning Adaptive Safety Margins for Visual Navigation
- arxiv url: http://arxiv.org/abs/2607.18200v1
- Date: Mon, 20 Jul 2026 17:40:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.724872
- Title: Learning Adaptive Safety Margins for Visual Navigation
- Title(参考訳): 視覚ナビゲーションのための適応型安全マージンの学習
- Authors: Junyi Hu, Shuaihang Yuan, Geeta Chandra Raju Bethala, Anthony Tzes, Yi Fang,
- Abstract要約: 拡散に基づくプランナーは、エゴセントリックなRGB-Dから様々な軌道候補を提案するが、信頼性のある選択がボトルネックのままである。
本稿では,文脈条件付き安全評論家に対して,ランキング拡散提案に対する適応的クリアランス選好を学習する手法を提案する。
本研究では,ESDF 幾何学をシミュレーションで訓練し,それを2段階の教師学生の指導により,認識のみのセレクタに蒸留する。
- 参考スコア(独自算出の注目度): 10.650323979444982
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Robots in cluttered indoor spaces often fail not because they cannot generate collision-free paths, but because a fixed safety margin is mis-calibrated: conservative margins cause detours and timeouts, while permissive margins lead to near-boundary shortcuts under perception bias. Diffusion-based planners propose diverse trajectory candidates from egocentric RGB-D, yet reliable selection remains the bottleneck. We propose a context-conditioned safety critic that learns an adaptive clearance preference for ranking diffusion proposals, decomposed into three complementary terms: (i) a safety term with a clearance-budget penalty and a control-barrier-function residual for waypoint- and transition-wise safety, (ii) an efficiency term combining a smoothness penalty with a safety-gated detour-ratio penalty that avoids detours without incentivizing risky shortcuts, and (iii) a distance-constraint matching term that anchors the learned budget to realized ESDF clearances to prevent margin collapse. We train the critic with privileged ESDF geometry in simulation and distill it into a perception-only selector via a two-stage teacher-student procedure. On PointGoal navigation in HM3D and MP3D, including cross-dataset transfer, our method achieves the highest success rate (SR) and success weighted by path length (SPL) among strong diffusion, optimization, and RL baselines. Trained purely in simulation, it transfers to a Unitree G1 humanoid and navigates cluttered indoor scenes without task-specific tuning.
- Abstract(参考訳): 乱れた屋内空間のロボットは、衝突のない経路を生成できないためではなく、固定された安全マージンが誤校正されているため失敗することが多い。
拡散に基づくプランナーは、エゴセントリックなRGB-Dから様々な軌道候補を提案するが、信頼性のある選択がボトルネックのままである。
我々は,3つの相補的な用語に分解されたランキング拡散提案に対する適応的クリアランス選好を学習する文脈条件付き安全評論家を提案する。
一 過渡的及び過渡的安全のため、クリアランス予算の処罰及び制御障壁機能残余を有する安全用語
二 リスクのあるショートカットのインセンティブを伴わずにデトゥーアを回避し、かつ、スムーズなペナルティと安全に制限されたデトゥーア比のペナルティを併用した効率の用語
三 学習予算を固定してESDFクリアランスを実現し、マージン崩壊を未然に防ぐ距離制約マッチング用語。
本研究では,ESDF 幾何学をシミュレーションで訓練し,それを2段階の教師学生の指導により,認識のみのセレクタに蒸留する。
HM3D と MP3D のポイントゴールナビゲーションでは,高い拡散,最適化,RL ベースライン間の経路長 (SPL) による最大成功率 (SR) と成功率 (SPL) を達成する。
シミュレーションで純粋に訓練され、Unitree G1のヒューマノイドに移行し、タスク固有のチューニングなしで、散らかった屋内シーンをナビゲートする。
関連論文リスト
- RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework [49.531001563853984]
RAD-2はクローズドループ計画のための統一されたジェネレータ・ディスクリミネーターフレームワークである。
様々な軌道候補を生成する一方、RL最適化判別器は、これらの候補を長期的な運転品質に応じて再現する。
強い拡散ベースのプランナーに比べて衝突速度を56%削減する。
論文 参考訳(メタデータ) (2026-04-16T17:59:44Z) - PC-Diffuser: Path-Consistent Capsule CBF Safety Filtering for Diffusion-Based Trajectory Planner [15.914164951048614]
PC-Diffuserは、拡散計画のデノイングループに直接パス一貫性のあるバリア関数構造を組み込む安全強化フレームワークである。
車両形状をよりよく反映するカプセル距離バリア関数を用いて衝突リスクを評価する。
自転車の車体モデルの下で、識別されたウェイポイントを動的に実現可能な運動に変換する。
論文 参考訳(メタデータ) (2026-03-11T01:52:56Z) - BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - Understanding and Preserving Safety in Fine-Tuned LLMs [20.821783178639063]
微調整データが無害であっても、微調整は安全性を著しく低下させる可能性がある。
低ランクな安全部分空間と矛盾する勾配成分を明示的に除去する軽量なアプローチSPFを提案する。
SPFは、ダウンストリームタスクのパフォーマンスを一貫して維持し、敵の微調整シナリオであっても、トレーニング済みのほぼすべての安全アライメントを回復する。
論文 参考訳(メタデータ) (2026-01-15T07:33:13Z) - SWIFT-Nav: Stability-Aware Waypoint-Level TD3 with Fuzzy Arbitration for UAV Navigation in Cluttered Environments [0.0]
障害物認識経路への高速で安定した収束を実現するTD3ベースのナビゲーションフレームワークを提案する。
TD3とリプレイ優先、探索、ファジィセーフティルールを組み合わせることで、散らかったシーンにおけるUAVナビゲーションの堅牢でデプロイ可能なソリューションが得られることを示す。
論文 参考訳(メタデータ) (2025-12-17T23:19:06Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - Boundary-to-Region Supervision for Offline Safe Reinforcement Learning [56.150983204962735]
バウンダリ・トゥ・レギオン(Bundary-to-Region, B2R)は、コスト信号による非対称な条件付けを可能にするフレームワークである。
B2Rは、CTGを固定された安全予算の下で境界制約として再定義し、すべての実行可能な軌道のコスト分布を統一する。
実験の結果,B2Rは38項目中35項目の安全制約を満たすことがわかった。
論文 参考訳(メタデータ) (2025-09-30T03:38:20Z) - Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts [80.32933059529135]
TTA(Test-Time Adaptation)メソッドが出現し、推論中にターゲット分布に適応する。
我々は、堅牢なM3ODの両不確実性を共同で最小化するために設計された、最初のTTAフレームワークであるDual Uncertainity Optimization (DUO)を提案する。
並列に,明瞭な意味的手がかりを持つ領域における幾何学的コヒーレンスを保存する意味認識型正規場制約を設計する。
論文 参考訳(メタデータ) (2025-08-28T07:09:21Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z) - AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin [38.577959886489076]
大規模言語モデル(LLM)は、微調整中に安全性のリスクに対して脆弱である。
AsFT(Anchoring Safety in Fine-Tuning)と呼ばれる安全微調整手法を提案する。
論文 参考訳(メタデータ) (2025-06-10T05:59:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。