論文の概要: SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos
- arxiv url: http://arxiv.org/abs/2606.02745v1
- Date: Mon, 01 Jun 2026 18:09:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 22:00:04.52986
- Title: SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos
- Title(参考訳): SeeTraceAct: クロス・エボディメント・デモビデオによる可視性を考慮した潜在計画
- Abstract要約: 本研究では,視覚言語行動モデル(VLA)について検討する。
SeeTraceActは、将来のエンドエフェクタトレースの可視性を考慮した予測を通じて、正確な空間的接地を促進する。
RoboCasa-DCの実験と、Franka Pandaの腕が人間のデモで条件付けられている実世界のベンチマークは、SeeeTraceActがベースラインを上回っていることを示している。
- 参考スコア(独自算出の注目度): 44.63355306601846
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action models (VLAs) are promising general-purpose robot policies, but adapting them to new tasks typically requires costly task-specific teleoperation data. As an alternative, we study one-shot demo-conditioned VLAs, where a robot policy is conditioned on a single demonstration video of an unseen task. We find that existing end-to-end approaches often struggle when successful execution requires precisely localizing small target regions. To address this limitation, we propose SeeTraceAct, a demo-conditioned VLA framework that encourages precise spatial grounding through visibility-aware prediction of future end-effector traces. To enable reproducible evaluation with cross-embodiment demonstrations, we introduce and release RoboCasa-DC, a demo-conditioned extension of RoboCasa with episode-paired humanoid videos. Experiments on RoboCasa-DC and a real-world benchmark, where a Franka Panda arm is conditioned on human demonstrations, show that SeeTraceAct outperforms baselines, achieving the best success rate across all four RoboCasa-DC settings and improving real-world average success by 12.5 percentage points.
- Abstract(参考訳): 視覚言語アクションモデル(VLA)は、汎用ロボットポリシーを約束するが、それらを新しいタスクに適応させるには、通常、タスク固有の遠隔操作データが必要となる。
代替として、ロボットポリシーが未確認タスクの1つのデモビデオで条件付けられているワンショットデモコンディションVLAについて検討する。
実行に成功するためには、小さなターゲット領域を正確にローカライズする必要がある。
この制限に対処するために、将来のエンドエフェクタトレースの可視性を考慮した予測により、正確な空間的接地を促進するデモ条件付きVLAフレームワークであるSeeeTraceActを提案する。
異体間デモによる再現性評価を実現するため,ロボットキャサのデモコンディション拡張であるRoboCasa-DCを,エピソードペア付きヒューマノイドビデオで導入・リリースする。
RoboCasa-DCとFranka Pandaの腕が人間のデモで条件付けされている実世界のベンチマークの実験では、SeeeTraceActはベースラインを上回り、4つのRoboCasa-DC設定で最高の成功率を獲得し、実世界の平均成功率が12.5ポイント向上している。
関連論文リスト
- Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models [120.24139942108405]
ロボットデータのスケーリングは、一般のVision-Language-Action(VLA)モデルを構築する上で重要である。
固定されたロボットデータ予算の下では、継続した事前訓練は限られた軌道を伝達可能な視覚行動知識に変換する必要がある。
本稿では,VLA指向のVLMバックボーンであるVLActを提案する。
論文 参考訳(メタデータ) (2026-08-27T17:59:40Z) - StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models [37.45050514108603]
本稿では,検索した1つのデモを条件付けして,テスト時に適応するフレームワークであるStellaVLAを紹介する。
自動オフラインパイプラインは、各生の軌跡を、例えばタスクプラン、サブゴール記述、言語化された3Dモーションなどの構造化されたデモに変換する。
並列な二重訓練設計は、この推論を共同行動および言語目的を通じて内部化し、推論はアクションエキスパートのみを使用する。
論文 参考訳(メタデータ) (2026-08-12T05:30:53Z) - WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos [38.959415159248046]
WALAは、アクションラベル付きデモとアクションフリービデオの両方から実行可能な潜在アクションを学ぶためのフレームワークである。
WALAはRoboTwin上で高いパフォーマンスを実現し,RoboCasa上での最先端の成果を平均75.2%で実現している。
論文 参考訳(メタデータ) (2026-07-13T11:02:04Z) - RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures [51.85284871989367]
タスク整合型未来を学習し,ロボットポリシーのトレーニングに使用するフレームワークであるRoboTALESを提案する。
提案手法では,(1)複雑なタスクを一連のサブゴールに分割してモデルの想像を導く階層的LCMベースのプランナ,(2)これらの将来性を評価し,モデルの内部表現を目標に集中させるために報酬に基づくフィードバックを利用するVLMベースの批判,という2つの重要なイノベーションを導入する。
論文 参考訳(メタデータ) (2026-07-07T08:58:29Z) - CORE: Common Outcome Regularities from Action-Free Visual Demonstrations for Robot Manipulation [26.48033419994886]
COREは、視覚的なデモンストレーションから共通アウトカム規則を抽出するポリシー学習フレームワークである。
同じタスクで成功した軌道は多種多様であるが、その終端状態はしばしば安定したオブジェクト構成を共有する。
論文 参考訳(メタデータ) (2026-06-28T17:27:23Z) - $τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation [45.040666672458634]
政策学習,映像予測,行動評価を統合した統合ビデオアクション世界モデルを提案する。
このモデルは、実際のロボット遠隔操作で約27,300ドル(約2万2000円)で訓練されている。
論文 参考訳(メタデータ) (2026-05-31T05:35:36Z) - From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps [7.710034405765985]
AIMは、明示的な空間的インターフェースを通じてこのギャップを橋渡しする意図認識の統一世界行動モデルである。
事前訓練されたビデオ生成モデルに基づいて構築されたAIMは、共有変換器アーキテクチャ内の将来の観測と値マップを共同でモデル化する。
RoboTwin 2.0ベンチマークの実験では、AIMは平均94.0%の成功率に達し、以前の統合された世界行動ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-04-13T07:48:58Z) - CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos [73.51386721543135]
本稿では,映像から視覚的潜伏空間をロボット軌道から受容的潜伏空間に整列させるフレームワークであるContrastive Latent Action Pretraining (CLAP)を提案する。
CLAPは、ビデオの遷移を量子化され、物理的に実行可能なコードブックにマッピングする。
本稿では,命令追従やオブジェクトの一般化に優れた自己回帰モデルであるCLAP-NTPと,高頻度かつ高精度な操作のために設計されたRectified FlowベースのポリシーであるCLAP-RFの両方を提供する二重形式VLAフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-07T16:26:33Z) - STORM: Search-Guided Generative World Models for Robotic Manipulation [10.365032830677162]
STORMはロボット操作における時間的推論のためのフレームワークである。
拡散に基づくアクション生成、条件付きビデオ予測、検索ベースの計画を統合する。
ストームは視覚的に計画を立て、解釈可能でフォアサイト駆動の意思決定を可能にする。
論文 参考訳(メタデータ) (2025-12-20T19:40:25Z) - Large Video Planner Enables Generalizable Robot Control [117.49024534548319]
汎用ロボットは、様々なタスクや環境にまたがって一般化する意思決定モデルを必要とする。
最近の研究は、マルチモーダル大言語モデル(LM)をアクション出力で拡張し、視覚-アクション(VLA)システムを構築することで、ロボット基盤モデルを構築している。
本稿では,ロボット基礎モデル構築における主要なモダリティとして,大規模ビデオ事前学習を用いるための代替パラダイムについて検討する。
論文 参考訳(メタデータ) (2025-12-17T18:35:54Z) - ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver [35.25196177784228]
本稿では,暗黙的な基礎パラダイムを持つ再構成型VLAモデルReconVLAを提案する。
拡散変換器は、モデルの視覚出力に基づいて画像の視線領域を再構成する。
このプロセスにより、VLAモデルはきめ細かい表現を学習し、視覚的注意を正確に割り当てる。
論文 参考訳(メタデータ) (2025-08-14T04:20:19Z) - ORV: 4D Occupancy-centric Robot Video Generation [33.360345403049685]
遠隔操作を通じて現実世界のロボットシミュレーションデータを取得することは、時間と労力のかかることで有名だ。
ORVは,4次元のセマンティック・コンカレンシー・シーケンスをきめ細かな表現として利用した,作業中心のロボットビデオ生成フレームワークである。
ORVは、占有率に基づく表現を活用することにより、時間的一貫性と正確な制御性を確保しつつ、シミュレーションデータをフォトリアリスティックなロボットビデオにシームレスに変換することができる。
論文 参考訳(メタデータ) (2025-06-03T17:00:32Z) - CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation [100.25567121604382]
VLA(Vision-Language-Action)モデルは、言語誘導されたタスクの実行と、目に見えないシナリオへの一般化の観点から、ロボット操作を改善した。
VLM(Vision-Language-Models)に基づく新しい高度なVLAアーキテクチャを提案する。
我々のモデルはタスクパフォーマンスにおいて既存のVLAをはるかに上回るだけでなく、新しいロボットへの顕著な適応と、見えないオブジェクトや背景への一般化も示している。
論文 参考訳(メタデータ) (2024-11-29T12:06:03Z) - Latent Action Pretraining from Videos [156.88613023078778]
一般行動モデル(LAPA)のための潜在行動事前訓練について紹介する。
LAPA(英: LAPA)は、VLA(Vision-Language-Action)モデルに接地型ロボットアクションラベルを含まない教師なしの訓練方法である。
本稿では,ロボットアクションラベルを持たないインターネット規模のビデオから学習する手法を提案する。
論文 参考訳(メタデータ) (2024-10-15T16:28:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。