論文の概要: KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2607.04652v1
- Date: Mon, 06 Jul 2026 04:17:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.034763
- Title: KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation
- Title(参考訳): KAM-WM:ロボットマニピュレーションのための潜在世界モデルからのキネマティック・アフォーダンスマップ
- Authors: Xinyu Shao, Keru Zhou, Guowei Huang, Yajun Gao, Tongtong Cao, Xiu Li,
- Abstract要約: KAM-WMは,凍結遅延ビデオワールドモデルから粗い方向の相互作用キューを抽出するフレームワークである。
LIBEROとRoboTwin2.0全体で、KAM-WMは平均で90.6%の成功、65.7%、22.4%の成功となっている。
- 参考スコア(独自算出の注目度): 12.364119683882015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning manipulation from few demonstrations requires visual priors that capture not only where to interact, but also how the interaction should begin; static priors such as segmentation masks encode only the former. We present KAM-WM, a framework that extracts a coarse directional interaction cue from a frozen latent video world model without rollout or world-model fine-tuning. KAM-WM queries a Flow Matching image-to-video backbone once and interprets its single-step latent velocity as a Kinematic Affordance Map (KAM), which provides task-conditioned interaction regions and coarse motion structure. A lightweight Perceiver compresses KAM into tokens that condition a diffusion policy together with RGB observations and proprioception. Across LIBERO and RoboTwin2.0, KAM-WM reaches 90.6% average success on LIBERO and achieves 65.7% and 22.4% success rates in the Easy and Hard settings on RoboTwin2.0, respectively. Controlled comparisons against a zero-order mask prior suggest that part of the gains comes from directional information beyond spatial localization alone. These results indicate that, in the evaluated settings, a frozen video model can provide a useful first-order visual prior for control without the test-time cost of future rollout.
- Abstract(参考訳): 少数のデモから操作を学ぶには、対話の場所だけでなく、インタラクションの開始方法もキャプチャする視覚的事前処理が必要である。
KAM-WMは,ロールアウトやワールドモデル微調整を伴わない冷凍潜伏型ビデオワールドモデルから,粗い指向性相互作用キューを抽出するフレームワークである。
KAM-WMはFlow Matchingの画像とビデオのバックボーンを一度クエリし、その1ステップの潜伏速度をKAM(Kinematic Affordance Map)として解釈する。
軽量のPerceiverは、KAMをRGB観察とプロプレセプションと共に拡散ポリシーを条件とするトークンに圧縮する。
LIBEROとRoboTwin2.0の合計で、KAM-WMは平均90.6%をLIBEROで達成し、それぞれ65.7%と22.4%をRoboTwin2.0で達成している。
ゼロオーダーマスクに対する制御された比較は、ゲインの一部は空間的局所化以外の方向情報に由来することを示唆している。
これらの結果から, 凍結映像モデルは, 将来のロールアウトの試験時間コストを伴わずに, 制御に有用な一階目の視覚的優位性を提供することが可能であることが示唆された。
関連論文リスト
- SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution [61.612676324369595]
画像編集モデルがロボット操作のための疎視世界モデルとして機能するかどうかを考察する。
本稿では,一括予測型視覚計画フレームワークSWEETを提案する。
DROIDとRoboMimicの実験では、SWEETは見知らぬシーンの予測を改善している。
論文 参考訳(メタデータ) (2026-05-19T03:54:46Z) - NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models [19.272356473995245]
World Action Models (WAM) は、ロボットアクション生成と将来の観測モデリングを結びつけるポリシーである。
NoiseGateは軽量なゲーティングポリシーネットワークで、遅延時間当たりのインクリメントをデノイング中に出力する。
NoiseGateは多様なRoboTwinランダムシーン操作タスクに対して一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-08T14:31:52Z) - Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation [76.04880323498598]
自己回帰動画追跡モデル(SAM2)から双方向ビデオ拡散モデル(CogVideoX)へ構造保存動作先行情報を抽出するアルゴリズムを提案する。
VBenchと人間の研究ではSAM2VideoXが一貫した利益をもたらすことが示されている。
論文 参考訳(メタデータ) (2025-12-12T18:56:35Z) - Towards Universal Modal Tracking with Online Dense Temporal Token Learning [66.83607018706519]
オンライン高密度時間トークン学習を用いたユニバーサルビデオレベルのモダリティ認識追跡モデルを提案する。
モデルの入力をビデオシーケンスレベルに拡張し、よりリッチなビデオコンテキストを言語に近い視点から見ることを目的としている。
論文 参考訳(メタデータ) (2025-07-27T08:47:42Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - P2P: Part-to-Part Motion Cues Guide a Strong Tracking Framework for LiDAR Point Clouds [11.30412146387686]
外観マッチングに基づく3次元物体追跡法は,LiDAR点雲による外観情報の不十分さに長年悩まされてきた。
連続点雲に対するパート・ツー・パートのモーション・モデリングを提案し,textbfP2Pと呼ばれる新しいトラッキング・フレームワークを提案する。
本稿では,P2P-pointとP2P-voxelモデルについて述べる。
論文 参考訳(メタデータ) (2024-07-07T02:37:24Z) - STMT: A Spatial-Temporal Mesh Transformer for MoCap-Based Action Recognition [50.064502884594376]
本研究では、モーションキャプチャー(MoCap)シーケンスを用いた人間の行動認識の問題点について検討する。
メッシュシーケンスを直接モデル化する新しい時空間メッシュ変換器(STMT)を提案する。
提案手法は,スケルトンベースモデルやポイントクラウドベースモデルと比較して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-03-31T16:19:27Z) - Click to Move: Controlling Video Generation with Sparse Motion [30.437648200928603]
Click to Move (C2M)は、ユーザーがマウスクリックで合成ビデオの動きを制御できるビデオ生成の新しいフレームワークである。
本モデルでは,初期フレーム,対応するセグメンテーションマップ,ユーザが提供する入力を符号化するスパース動作ベクトルを入力として受信する。
与えられたフレームから始まり、ユーザ入力と整合したモーションで、もっともらしいビデオシーケンスを出力する。
論文 参考訳(メタデータ) (2021-08-19T17:33:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。