論文の概要: Social-WM: Safety-Aware Latent World Models for Robot Social Navigation
- arxiv url: http://arxiv.org/abs/2609.40177v1
- Date: Wed, 30 Sep 2026 17:03:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.124963
- Title: Social-WM: Safety-Aware Latent World Models for Robot Social Navigation
- Title(参考訳): 社会WM:ロボット社会ナビゲーションのための安全に配慮した潜在世界モデル
- Abstract要約: 我々は,エゴセントリックなRGBビデオシーケンスから学習した,効率的な潜伏型ワールドモデル計画フレームワークSocial-WMを提案する。
Social-WMは、行動条件付き将来の予測を通じて、安全関連の結果を直接学習する。
Social-HM3Dでは、Social-WMは63.77%の成功を達成し、人間の衝突を21.67%に減らし、Social-MP3Dへのゼロショット転送下での強いパフォーマンスを維持している。
- 参考スコア(独自算出の注目度): 5.442955439283728
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Safe social navigation requires a robot to anticipate not only the future consequences of its actions, but also whether a nominal action can actually be executed under surrounding physical and social constraints. We present Social-WM, an efficient latent world-model planning framework trained from egocentric RGB video sequences. Our key observation is that social-navigation experience contains a systematic discrepancy between the nominal action and the realizable action: a nominal forward action may be fully executed in free space, but needs to be constrained when heading towards a pedestrian or obstacle. Social-WM learns these safety-relevant consequences directly through action-conditioned future prediction, where the target is the actual observed future following each command. We further introduce a realizable inverse-dynamics objective that associates observed latent transitions with the action actually realized rather than the nominal one. At deployment, candidate actions are imagined through the latent world model, and the inverse dynamics model estimates their realizability; nominal--realizable discrepancy then provides a safety signal before execution. The learned dynamics and realizability model remain goal-independent and support both position- and image-goal navigation. On Social-HM3D, Social-WM achieves 63.77% success while reducing human collisions to 21.67%, and maintains strong performance under zero-shot transfer to Social-MP3D, without explicit pedestrian tracking, privileged human state, or online reinforcement learning.
- Abstract(参考訳): 安全なソーシャルナビゲーションには、ロボットが行動の将来の結果だけでなく、物理的な制約や社会的制約の下で、名目上の行動が実際に実行されるかどうかを予測する必要がある。
我々は,エゴセントリックなRGBビデオシーケンスから学習した,効率的な潜伏型ワールドモデル計画フレームワークSocial-WMを提案する。
我々の重要な観察は、社会的ナビゲーション体験は、名目行動と実現可能な行動の体系的な相違を含んでいる:名目前方行動は、自由空間で完全に実行されるが、歩行者や障害物に向かう際には制約される必要がある。
Social-WMは、アクション条件付き将来の予測を通じて、これらの安全関連結果を直接学習する。
さらに、潜在遷移と実際に実現された行動とを関連づける、実現可能な逆力学の目的を導入する。
デプロイメントにおいて、候補アクションは潜在世界モデルを通じて想像され、逆ダイナミクスモデルはそれらの実現可能性を推定する。
学習されたダイナミクスと実現可能性モデルは、目標に依存しないままであり、位置と画像のゴールナビゲーションの両方をサポートする。
Social-HM3Dでは、Social-WMは63.77%の成功を達成し、人間の衝突を21.67%に減らし、明示的な歩行者追跡、特権的人間状態、オンライン強化学習なしに、Social-MP3Dへのゼロショット転送下での強いパフォーマンスを維持している。
関連論文リスト
- SocialRL: Refining LLMs' Social Intelligence through Multi-turn Reinforcement Learning and Reward Design [52.69818441707104]
ソーシャルインテリジェンスにより、エージェントは社会的文脈を読み、意図を推測し、持続的な対話に適応することができる。
既存の強化学習手法は、1ターン発話とスパース結果報酬を最適化する。
両課題に対処する多ターン強化学習フレームワークSocialRLを提案する。
論文 参考訳(メタデータ) (2026-09-09T06:06:34Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models [42.84072399565553]
事前学習された視覚・言語・行動モデルは既に歩行者・物体の区別と将来の衝突信号を内部表現にエンコードしていることを示す。
SALSAは2段階のアノテーションのないポストトレーニングフレームワークである。
SCANDおよび実世界の展開において、SALSAは近距離衝突を86.4%削減し、社会的反事実の精度を53%から93%に改善する。
論文 参考訳(メタデータ) (2026-06-09T07:18:01Z) - Social-Mamba: Socially-Aware Trajectory Forecasting with State-Space Models [81.44955493339835]
ソーシャル・マンバ(Social-Mamba)は、社会的相互作用を構造化されたシーケンシャルなプロセスとして再構築する予測アーキテクチャである。
Social-Mambaは、エゴセントリックなグリッド上でエージェントを組織し、社会的三重項分解を導入する。
5つの軌道予測ベンチマークの実験は、Social-Mambaが最先端の精度を達成していることを示している。
論文 参考訳(メタデータ) (2026-05-14T21:16:01Z) - HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation [26.790598190282136]
VLNは、データとモデルのキャパシティのスケーリングによって、驚くべき進歩を遂げた。
VLNのための最初の人中心型フレームワークであるHCSGを提案する。
このフレームワークは、動的人間ロボット環境における安全で社会的にインテリジェントなナビゲーションのための堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-05-13T10:34:47Z) - NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation [20.161788094382526]
社会的なナビゲーションには、ロボットがダイナミックな人間の環境で安全に行動する必要がある。
我々は,行動条件付き世界モデルと政治強化学習を結合した将来的なフレームワークであるNavThinkerを提案する。
シングルロボットとマルチロボットのSocial-HM3Dの実験では、最先端のナビゲーションが成功し、Social-MP3Dにゼロショットで転送され、Unitree Go2上で現実世界にデプロイされる。
論文 参考訳(メタデータ) (2026-03-16T14:37:16Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection [57.74400052368147]
本稿では,幾何学的計画と文脈的社会的推論を統合した社会ロボットナビゲーションフレームワークを提案する。
このシステムはまず障害物や人間の力学を抽出し、幾何学的に実現可能な候補経路を生成し、次に細調整された視覚言語モデル(VLM)を利用してこれらの経路を評価する。
4つのソーシャルナビゲーション環境における実験により, 生活空間違反の最小期間, 歩行者面の最小時間, 社会ゾーンの侵入がない場合に, ベストな総合的なパフォーマンスを達成できることが実証された。
論文 参考訳(メタデータ) (2026-02-09T18:46:12Z) - Following the Human Thread in Social Navigation [10.384957135051119]
ソーシャルナビゲーションはロボットの人間の動きへのリアルタイム適応に依存している。
人間軌道は社会航法において重要な手がかりとして現れるが、ロボットの自我中心的な視点から部分的に観察可能である。
本稿では,ロボットの行動履歴に基づく社会ダイナミクス適応モデルを提案し,その社会的ダイナミクスを推算する。
論文 参考訳(メタデータ) (2024-04-17T12:39:48Z) - Principles and Guidelines for Evaluating Social Robot Navigation
Algorithms [44.51586279645062]
社会的ロボットナビゲーションは、動的エージェントとそのロボット行動の適切性に対する認識が関係しているため、評価が難しい。
コントリビューションには、(a)安全性、快適性、妥当性、丁寧さ、社会的能力、エージェント理解、活動性、文脈に対する応答性に関する原則、(b)メトリクスの使用のためのガイドライン、シナリオ、ベンチマーク、データセット、社会ナビゲーションを評価するためのシミュレーター、(c)様々なシミュレーター、ロボット、データセットの結果の比較を容易にするソーシャルナビゲーションメトリクスフレームワークなどが含まれます。
論文 参考訳(メタデータ) (2023-06-29T07:31:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。