論文の概要: ChronoFlow-Policy: Unifying Past-Current-Future Interaction Flow in Visuomotor Policy Learning
- arxiv url: http://arxiv.org/abs/2606.31493v1
- Date: Tue, 30 Jun 2026 11:12:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.189535
- Title: ChronoFlow-Policy: Unifying Past-Current-Future Interaction Flow in Visuomotor Policy Learning
- Title(参考訳): クロノフロー・ポリティクス:ビジュモータ政策学習における過去-未来相互作用フローの統合
- Authors: Bokai Lin, Yifu Xu, Xinyu Zhan, Hongjie Fang, Jialin Tian, Fu-Cheng Zhang, Yong-Lu Li, Cewu Lu, Lixin Yang,
- Abstract要約: textbfpast, current, and future interaction dynamics through sparse 3D keypoints。
我々は,ChronoFlowとアクションシーケンスを協調学習する拡散型ビズモータポリシである textbfChronoFlow-Policy を提案する。
- 参考スコア(独自算出の注目度): 47.20702983310292
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual signals play a crucial role in policy learning by enabling models to capture object motion and interaction dynamics. Just as humans reason about actions using both past experience and anticipated outcomes, effective policies should integrate past interactions with future predictions. However, existing visuomotor policies typically model either historical context or future dynamics in isolation, lacking a unified temporal representation of interaction dynamics. In this work, we introduce \textbf{ChronoFlow}, a temporally unified representation that captures \textbf{past, current, and future} interaction dynamics through sparse 3D keypoints of both objects and the gripper. Based on this representation, we propose \textbf{ChronoFlow-Policy}, a diffusion-based visuomotor policy that jointly learns ChronoFlow and action sequences through a co-training objective. Experiments on 14 simulated tasks and 5 real-world manipulation tasks demonstrate that ChronoFlow-Policy consistently outperforms strong diffusion-policy baselines and improves robustness in long-horizon and non-Markovian manipulation scenarios.
- Abstract(参考訳): 視覚信号は、モデルがオブジェクトの動きと相互作用のダイナミクスをキャプチャできるようにすることによって、ポリシー学習において重要な役割を果たす。
人間が過去の経験と予測結果の両方を使ってアクションを判断するのと同じように、効果的なポリシーは過去のインタラクションと将来の予測を統合するべきである。
しかし、既存のビジュモータポリシーは、通常、歴史的文脈または未来の力学を単独でモデル化し、相互作用力学の時間的表現を統一していない。
本研究では、オブジェクトとグリップのスパース3Dキーポイントを通して、 \textbf{past, current, and future} の相互作用ダイナミクスをキャプチャする時間的に統一された表現である \textbf{ChronoFlow} を紹介する。
この表現に基づいて,ChronoFlowとアクションシーケンスを協調学習する拡散型ビジュモータポリシであるtextbf{ChronoFlow-Policy}を提案する。
14のシミュレーションタスクと5つの実世界の操作タスクの実験は、ChronoFlow-Policyが強い拡散政治ベースラインを一貫して上回り、長距離および非マルコフ操作シナリオにおける堅牢性を向上させることを示した。
関連論文リスト
- From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - F2F-AP: Flow-to-Future Asynchronous Policy for Real-time Dynamic Manipulation [62.06267255986041]
非同期推論はロボット操作における主要なパラダイムとして現れている。
本稿では,予測対象の流れを利用して将来の観測を合成する新しい枠組みを提案する。
本手法は複雑な動的操作タスクにおける応答性と成功率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-02T17:57:15Z) - FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model [73.03346643967309]
我々は、効果的な共同運動予測モデルには、時間的連続性と視覚的条件による監督的疎結合の両方が必要であると論じる。
FutureVLAは、視覚情報と運動情報を最初に分離することで、関節振動子埋め込みを抽出するように設計されている。
訓練後の段階において、我々は遅延埋め込みアライメント戦略を採用し、様々な下流VLAモデルによりこれらの時間的先行を内部化することができる。
論文 参考訳(メタデータ) (2026-03-11T12:39:55Z) - ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning [52.86018040861575]
本稿では,単一のネットワークに視覚計画と反応力制御を統合した,一貫したエンドツーエンドの視覚力拡散政策を提案する。
本稿では,非同期な視覚と力のトークンを同時に処理するための因果的注意力を利用した構造的スローフォールストラーニングを紹介する。
コンタクトリッチタスクの実験では、ImplicitRDPは視覚のみのベースラインと階層的なベースラインの両方で著しく優れていた。
論文 参考訳(メタデータ) (2025-12-11T18:59:46Z) - FIMP: Future Interaction Modeling for Multi-Agent Motion Prediction [18.10147252674138]
動作予測(FIMP)のための未来のインタラクションモデリングを提案し,その将来的なインタラクションをエンドツーエンドで捉える。
実験により,今後のインタラクションモデリングにより性能が著しく向上し,Argoverseモーション予測ベンチマークの性能が向上することが示された。
論文 参考訳(メタデータ) (2024-01-29T14:41:55Z) - TimeGraphs: Graph-based Temporal Reasoning [64.18083371645956]
TimeGraphsは階層的時間グラフとして動的相互作用を特徴付ける新しいアプローチである。
提案手法は,コンパクトなグラフベース表現を用いて相互作用をモデル化し,多種多様な時間スケールでの適応推論を可能にする。
我々は,サッカーシミュレータ,抵抗ゲーム,MOMA人間活動データセットなど,複雑でダイナミックなエージェントインタラクションを持つ複数のデータセット上でTimeGraphsを評価する。
論文 参考訳(メタデータ) (2024-01-06T06:26:49Z) - Enhancing Asynchronous Time Series Forecasting with Contrastive
Relational Inference [21.51753838306655]
時間点プロセス(TPP)は、そのようなモデリングの標準的な方法である。
既存のTPPモデルは、イベントの相互作用を明示的にモデル化する代わりに、将来のイベントの条件分布に焦点を当てており、イベント予測の課題を示唆している。
本稿では,ニューラル推論(NRI)を利用して,観測データから動的パターンを同時に学習しながら,相互作用を推論するグラフを学習する手法を提案する。
論文 参考訳(メタデータ) (2023-09-06T09:47:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。