論文の概要: CST-WM: A Causally Structured World Model for Embodied Visual Tracking
- arxiv url: http://arxiv.org/abs/2609.06302v1
- Date: Sat, 05 Sep 2026 23:24:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:08:23.76661
- Title: CST-WM: A Causally Structured World Model for Embodied Visual Tracking
- Title(参考訳): CST-WM: 身体的視線追跡のための因果的に構造化された世界モデル
- Abstract要約: 身体的な視覚的追跡には、移動対象の将来の証拠を保存または回収する行動を選択するロボットが必要である。
CST-WMは潜伏状態を標的証拠、ロボット、観察枝に分解する。
1つの計画フレームワークで、安定したフォローと一時的なターゲット再獲得の両方をサポートする。
- 参考スコア(独自算出の注目度): 9.902564083063973
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied visual tracking requires a robot not only to react to the current view, but to choose actions that preserve or recover future evidence of a moving target under ego-motion, occlusion, and distractors. It is therefore a predictive decision problem over future target observability and apparent scale. A central difficulty is a task-specific form of causal hallucination: in action-conditioned prediction, a model can exploit the strong correlation between robot control and target-related observations by hallucinating a direct causal effect from the current action to target evidence, rather than letting action influence that evidence only through robot motion and the resulting observation change. The shortcut yields plausible futures with the wrong semantics for tracking-oriented planning and re-acquisition. We propose CST-WM, a causally structured world model that decomposes the latent state into target-evidence, robot, and observation branches and factorizes the transition so that direct action injection into the target-evidence branch is blocked, while action remains available to robot motion and observation updates. Combined with rollout-based model-predictive control, CST-WM supports both stable following and temporary target re-acquisition in one planning framework. On EVT-Bench and Habitat 3.0, covering standard tracking, target-loss recovery, and cross-dataset transfer, it improves following quality, distance-range control, safety, and re-acquisition over reactive and world-model baselines; offline diagnostics show better multi-step rollout fidelity, stronger planning-value consistency, and substantially reduced direct action leakage. For embodied visual tracking, future prediction alone is not enough: the predictive structure itself must align with how target evidence enters planning.
- Abstract(参考訳): 身体的視線追跡は、現在の視点に反応するだけでなく、移動目標の将来の証拠をエゴモーション、オクルージョン、邪魔者の下で保存または回収する行動を選択する必要がある。
したがって、将来の観測可能性と明らかなスケールに対する予測的な決定問題である。
行動条件付き予測では、モデルは、ロボットの動きと結果として生じる観察変化によってのみ、アクションの影響を与えるのではなく、現在の行動から目的のエビデンスへの直接的な因果効果を幻覚することにより、ロボット制御と目標関連観測との強い相関を利用することができる。
このショートカットは、追跡指向の計画と再取得の間違ったセマンティクスで、妥当な未来をもたらす。
CST-WMは、潜伏状態を目標証拠、ロボット、観察枝に分解し、その遷移を分解し、目標証拠ブランチへの直接的アクション注入がブロックされるようにし、ロボットの動きや観察更新にはアクションが引き続き利用可能となる因果的に構成された世界モデルである。
ロールアウトベースのモデル予測制御と組み合わせて、CST-WMは1つの計画フレームワークで安定した追従と一時的な目標再獲得の両方をサポートする。
EVT-BenchとHabitat 3.0では、標準的なトラッキング、ターゲットロスリカバリ、クロスデータセット転送をカバーし、リアクティブおよびワールドモデルベースラインに対する品質、距離制御、安全性、再獲得を改善している。
視覚的追跡を具現化するためには、将来の予測だけでは不十分である。
関連論文リスト
- Towards Surgical World-Action Modeling: A Preliminary Joint Visual-Trajectory Forecasting for Surgical Motion Planning [37.17021354294023]
本稿では, 将来の視覚状態を同時に予測し, 歴史的外科的観察からトラジェクトリを計測する, 共同視覚軌道世界行動モデルを提案する。
より長い予測地平線上での進行的な視覚劣化と累積軌道誤差を観察する。
論文 参考訳(メタデータ) (2026-08-20T17:18:02Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems [1.9236465591431287]
本稿では,単条件軌道生成問題として参加者予測とロボット計画を扱う共同予測計画拡散フレームワークを提案する。
シナリオグラウンドシミュレーション、自然主義的な歩行者リプレイ、Isaac Simバリデーション、ROS/Orinデプロイメントの実験は、共同サンプリングが尾の安全性と実行効率を改善することを示している。
論文 参考訳(メタデータ) (2026-06-14T11:15:44Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics [25.518388341069492]
CLaDは,行動下での受容的状態と意味的状態の共進化をモデル化するフレームワークである。
CLaDは、EMAターゲットエンコーダと補助的な再構成損失による自己監督目標により、接地された潜伏監視を予測する。
LIBERO-LONGベンチマークでは、CLaDは94.7%の成功率を達成した。
論文 参考訳(メタデータ) (2026-03-31T08:13:45Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Reimagination with Test-time Observation Interventions: Distractor-Robust World Model Predictions for Visual Model Predictive Control [51.14656121641822]
世界モデルは、現在の観測と計画された行動によって、ロボットが将来の観察を「想像」することができる。
新たな視覚的障害は、行動結果の予測を破損させ、ロボットが計画や行動検証のために世界モデルの想像力に依存するとき、下流の障害を引き起こす可能性がある。
本稿では、世界モデルによるより信頼性の高い行動結果の予測を可能にする簡易かつ効果的なテストタイム戦略であるReOI(Reimagination with Observation Intervention)を提案する。
論文 参考訳(メタデータ) (2025-06-19T19:41:29Z) - Self-Supervised Bird's Eye View Motion Prediction with Cross-Modality
Signals [38.20643428486824]
密集した鳥の視線(BEV)の動きを自己監督的に学習することは、ロボット工学と自律運転の新たな研究である。
現在の自己監督法は主に点雲間の点対応に依存する。
マルチモダリティデータを活用することで,これらの問題に効果的に対処する,新たなクロスモダリティ自己教師型トレーニングフレームワークを導入する。
論文 参考訳(メタデータ) (2024-01-21T14:09:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。