論文の概要: SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation
- arxiv url: http://arxiv.org/abs/2607.11027v1
- Date: Mon, 13 Jul 2026 02:48:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.308157
- Title: SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation
- Title(参考訳): SegDiff: 一貫性と適応性を持ったロボットマニピュレーションのためのセグメント軌道拡散
- Authors: Haidong Cao, Wenjun Cao, Quanhao Li, Sicheng Xie, Zhiying Du, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang,
- Abstract要約: 両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
- 参考スコア(独自算出の注目度): 65.81476183180527
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Imitation learning enables robots to acquire manipulation skills from demonstrations by mapping observations to actions. Existing approaches predict either short-horizon continuous action sequences or discrete keyposes. However, continuous prediction methods suffer from compounding errors due to short prediction horizons and struggle with multi-modal action distributions, whereas keypose-based methods necessitate an external planner, constraining real-time applicability. To address these challenges, we introduce SegDiff, a closed-loop visuomotor policy that integrates the strengths of both paradigms. SegDiff decomposes demonstrations into motion segments between keyposes and learns to predict the continuous trajectory from the current state to the next keypose, enabling long-horizon prediction with real-time refinement. Furthermore, we leverage the capability of diffusion models and DDIM inversion to propose a Dynamic Temporal Ensembling mechanism, which allows the policy to efficiently respond to dynamic environments and mitigate discontinuities caused by inconsistent multi-modal sampling. SegDiff demonstrates significant performance gains over existing approaches across various simulated and real-world scenarios, indicating its strong ability to reason over extended temporal dependencies while maintaining real-time adaptability and control stability.
- Abstract(参考訳): 模倣学習により、ロボットは観察を行動にマッピングすることで、デモンストレーションから操作スキルを習得することができる。
既存のアプローチは、短水平連続的なアクションシーケンスまたは離散キーポジションを予測している。
しかし, 連続予測手法は, 短時間の予測地平線やマルチモーダルな動作分布との競合による複合的誤差に悩まされる一方, キーポーズに基づく手法では, 外部プランナが必要であり, リアルタイム適用性に制約がある。
これらの課題に対処するために,両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを導入する。
SegDiffは、デモをキープレイス間で動作セグメントに分解し、現在の状態から次のキープレイスへの連続的な軌道予測を学ぶ。
さらに,拡散モデルとDDIMのインバージョン機能を活用し,ダイナミックな環境に効率的に対応し,不整合なマルチモーダルサンプリングによる不連続性を緩和する動的テンポラルエンセブリング機構を提案する。
SegDiff氏は、さまざまなシミュレートされた実世界のシナリオにおける既存のアプローチよりも大きなパフォーマンス向上を示し、リアルタイム適応性とコントロール安定性を維持しながら、拡張された時間的依存関係を推論する強力な能力を示している。
関連論文リスト
- Learning When to Listen: Gated Affect Fusion for Human Motion Prediction [0.0]
本研究では,感情条件付き予測システムの有用性と時間的制約について検討する。
本稿では,Gated Affect Transformer (GAT)を導入し,モーダル情報の流れを動的に制御する。
以上の結果から, 顔への影響は相補的行動の手がかりとみなす必要があるという実証的証拠が得られた。
論文 参考訳(メタデータ) (2026-07-01T00:47:02Z) - Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation [1.6711881128691604]
本稿では,インスタンス中心のシーンコンテキストとマルチモーダルな提案を前提とした拡散型シナリオ生成フレームワークを提案する。
Open Motionデータセットの実験では、さまざまなインタラクティブなシナリオにおけるリアリズム、安全性、コントロール可能性のバランスが好まれている。
論文 参考訳(メタデータ) (2026-06-25T15:01:31Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - F2F-AP: Flow-to-Future Asynchronous Policy for Real-time Dynamic Manipulation [62.06267255986041]
非同期推論はロボット操作における主要なパラダイムとして現れている。
本稿では,予測対象の流れを利用して将来の観測を合成する新しい枠組みを提案する。
本手法は複雑な動的操作タスクにおける応答性と成功率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-02T17:57:15Z) - STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction [16.465783114087223]
反復デノゲーションは、リアルタイム閉ループシステムにおける制御周波数を制限し、相当な推論遅延をもたらす。
高品質なウォームスタート動作を構築するための軽量時整合予測機構STEPを提案する。
2段階のSTEPは、RoboMimicベンチマークや実世界のタスクでBRIDGERやDDIMよりも平均21.6%、27.5%高い成功率を達成することができる。
論文 参考訳(メタデータ) (2026-02-09T03:50:40Z) - Koopman Autoencoders with Continuous-Time Latent Dynamics for Fluid Dynamics Forecasting [17.98687936773676]
数値積分スキームによる潜伏進化をモデル化する連続時間クープマンフレームワークを導入する。
推論における可変時間ステップを許容することにより、時間分解能に対する堅牢性を示し、訓練体制を超えて一般化する。
従来のCFDベンチマークのアプローチを評価し,精度,安定性,外挿特性について報告する。
論文 参考訳(メタデータ) (2026-02-02T21:33:07Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - A Poisson-Gamma Dynamic Factor Model with Time-Varying Transition Dynamics [51.147876395589925]
非定常PGDSは、基礎となる遷移行列が時間とともに進化できるように提案されている。
後続シミュレーションを行うために, 完全共役かつ効率的なギブスサンプリング装置を開発した。
実験により,提案した非定常PGDSは,関連するモデルと比較して予測性能が向上することを示した。
論文 参考訳(メタデータ) (2024-02-26T04:39:01Z) - Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion [88.45326906116165]
運動不確定性拡散(MID)の逆過程として軌道予測タスクを定式化する新しい枠組みを提案する。
我々は,履歴行動情報と社会的相互作用を状態埋め込みとしてエンコードし,トランジトリの時間的依存性を捉えるためにトランスフォーマーに基づく拡散モデルを考案する。
スタンフォード・ドローンやETH/UCYデータセットなど,人間の軌道予測ベンチマーク実験により,本手法の優位性を実証した。
論文 参考訳(メタデータ) (2022-03-25T16:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。