論文の概要: OmniContact: Chaining Meta-Skills via Contact Flow for Generalizable Humanoid Loco-Manipulation
- arxiv url: http://arxiv.org/abs/2606.26201v1
- Date: Wed, 24 Jun 2026 16:28:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.029288
- Title: OmniContact: Chaining Meta-Skills via Contact Flow for Generalizable Humanoid Loco-Manipulation
- Title(参考訳): OmniContact: 汎用型ヒューマノイドロコマニピュレーションのためのコンタクトフローによるメタスキルの連結
- Abstract要約: 鍵体軌道と時系列二値接触信号からなるコンパクトな表現であるtextbfcontact Flow (CF) を中心にした階層型フレームワークを提案する。
また,Humanoid loco-manipulationのためのMOCapベースのHOIコーパスであるOmniContactデータセットを収集した。
これにより、堅牢な実行、自律的な障害回復、長期タスクのための柔軟なメタスキルの構成が可能になる。
- 参考スコア(独自算出の注目度): 66.98820543497212
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning long-horizon humanoid loco-manipulation poses a dual challenge: it requires not only the robust execution of meta-skills but also their seamless, closed-loop chaining equipped with autonomous recovery. Existing approaches remain limited: explicit humanoid-object interaction representations offer precision but are notoriously difficult for high-level planning, whereas implicit skill embeddings are compact but lack the interpretability required for reliable composition. We propose \ours, a hierarchical framework centered on \textbf{contact flow (CF)}, a compact representation consisting of key body trajectories and time-series binary contact signals. Leveraging this shared interface, our low-level policy \textbf{CF-Track} learns a unified library of loco-manipulation skills, while our high-level module \textbf{CF-Gen} heuristically synthesizes future contact-flow sequences. To support this setting, we additionally collect the OmniContact dataset, a MoCap-based HOI corpus for humanoid loco-manipulation (Appendix~\ref{sec:dataset}). Together, they enable robust execution, autonomous failure recovery, and flexible composition of meta-skills for long-horizon tasks. Experiments show that OmniContact achieves \(98.7\%\) success on \textit{Carry Box} and \(76.5\%\) on \textit{Push-Stack Boxes}, outperforming prior baselines by average margins of \(40.9\%\) in meta-skill and \(66.5\%\) in skill chaining. Besides, our framework naturally integrates with VLMs for semantic task decomposition, enabling complex, semantically grounded loco-manipulation behaviors, such as arranging scattered boxes into a heart shape.
- Abstract(参考訳): メタスキルの堅牢な実行だけでなく、自律的なリカバリを備えたシームレスでクローズドループチェーンも必要です。
明示的なヒューマノイド・オブジェクトの相互作用表現は正確性を提供するが、高いレベルの計画では明らかに難しいが、暗黙のスキル埋め込みはコンパクトであるが、信頼できる構成に必要な解釈性は欠如している。
本稿では,キーボディートラジェクトリと時系列二値接触信号からなるコンパクトな表現である \textbf{contact flow (CF)} を中心にした階層型フレームワークである \ours を提案する。
この共有インターフェースを活用することで、我々の低レベルポリシー \textbf{CF-Track} はロコ操作スキルの統一ライブラリを学習し、高レベルモジュール \textbf{CF-Gen} は将来的なコンタクトフローシーケンスをヒューリスティックに合成する。
この設定をサポートするために、我々は、ヒューマノイドロコ操作のためのMoCapベースのHOIコーパスであるOmniContactデータセット(Appendix~\ref{sec:dataset})も収集する。
これにより、堅牢な実行、自律的な障害回復、長期タスクのための柔軟なメタスキルの構成が可能になる。
実験の結果、OmniContact は \textit{Carry Box} において \(98.7\%\) の成功、および \textit{Push-Stack Boxes} 上で \(76.5\%\) を達成した。
さらに,本フレームワークは,意味的タスク分解のためのVLMと自然に統合され,散布箱を心臓の形に配置するなど,複雑な意味的基盤を持つロコ操作の動作を可能にする。
関連論文リスト
- CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning [3.906714757786654]
CoToGraspは、特定の接触トポロジーに厳格に条件付けられた多様な安定したグリップを合成する新しい生成フレームワークである。
CoToGraspは最先端のパフォーマンスを実現し、既存の分類誘導プランナーを上回っている。
論文 参考訳(メタデータ) (2026-08-20T08:19:44Z) - AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning [52.47988016454267]
VLA(Vision-Language-Action)モデルは、エンドツーエンドのロボット操作において優れているが、アウト・オブ・ディストリビューション(OOD)の一般化に苦慮している。
構成的サブスキルのセマンティクスよりも全体論的軌道パターンに過度に適合するEmphtrajectory overfittingと、世界空間の接地を犠牲にして手首面のテクスチャを過度に強調するEmphperceptual shortcutの2つの相互強化モードを同定する。
textbfAC-VLA, プラグアンドプレイアクション構成学習について紹介する。
論文 参考訳(メタデータ) (2026-07-17T07:51:03Z) - Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy [79.09714980186278]
非構造化環境で永続的なエンボディエージェントを構築するには、異種ツールの統一的なオーケストレーションが必要である。
我々は,多モーダルなセマンティックプランナを統合したフレームワークであるOmniActを紹介した。
すべての複雑性レベルにわたって、エンドツーエンドの成功において一貫した改善が達成されます。
論文 参考訳(メタデータ) (2026-06-25T16:36:35Z) - RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation [15.618446008590409]
RelAfford6は複雑な調音オブジェクトのためのトレーニング不要のフレームワークである。
本システムでは,一次相互作用部分を物理的アンカーにリンクする意味的トポロジを推定する。
我々は満足度問題として下流実行を解析的に定式化する。
論文 参考訳(メタデータ) (2026-06-25T13:42:26Z) - Bridging Semantics and Kinematics: A Modular Framework for Zero-Shot Robotic Manipulation [0.6927055673104934]
このアーキテクチャは、視覚行動パイプラインを視覚認識、意味解釈、タスク実行の3段階に分解することで、高レベルの推論と低レベルの運動学のギャップを埋める。
このフレームワークは、制約のないオープンワールドシーケンシャルな操作と密接なリレーショナルな空間的推論という、2つのゼロショット実験装置で評価される。
論文 参考訳(メタデータ) (2026-06-22T11:01:56Z) - Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph [23.060488218180936]
We present UniManip, a framework based on a Bi-level Agentic Operational Graph (AOG)
タスクオーケストレーションのための高レベルのエージェント層と、動的状態表現のための低レベルのScene Layerを結合することにより、システムは、抽象的な計画と幾何学的制約を継続的に整合させる。
実験では、未確認のオブジェクトやタスクに対するシステムの堅牢なゼロショット能力を評価し、最先端のVLAや階層的なベースラインと比較して22.5%と25.0%の成功率を示した。
論文 参考訳(メタデータ) (2026-02-13T16:47:26Z) - OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows [9.617220633655716]
textbfunderlineOmni-textbfunderlineModality textbfunderlineGeneration Agent (textbfOMG-Agent)について述べる。
論文 参考訳(メタデータ) (2026-02-04T02:25:40Z) - Grounded in Reality: Learning and Deploying Proactive LLM from Offline Logs [72.08224879435762]
textttLearn-to-Askは、プロアクティブな対話エージェントの学習とデプロイのためのシミュレータフリーフレームワークである。
当社のアプローチは,LLMの大規模オンラインAIサービスへの展開を成功に導くものです。
論文 参考訳(メタデータ) (2025-10-29T12:08:07Z) - YOLOv8-SMOT: An Efficient and Robust Framework for Real-Time Small Object Tracking via Slice-Assisted Training and Adaptive Association [5.07987775511372]
本稿では,MVA 2025 "Finding Birds" Small Multi-Object Tracking Challenge (SMOT4SB)におけるチャンピオンシップ獲得ソリューションについて述べる。
トラッキング・バイ・検出のパラダイムを採用し、検出レベルとアソシエーションレベルの両方で目標とするイノベーションを実現している。
本手法はSMOT4SB公開テストセット上での最先端性能を実現し,SO-HOTAスコアの textbf55.205 に達する。
論文 参考訳(メタデータ) (2025-07-16T09:51:19Z) - HOSIG: Full-Body Human-Object-Scene Interaction Generation with Hierarchical Scene Perception [57.37135310143126]
HO SIGは階層的なシーン認識を通じて全体インタラクションを合成するための新しいフレームワークである。
我々のフレームワークは、自己回帰生成による運動長の無制限化をサポートし、手動による介入を最小限に抑える。
この研究は、シーン認識ナビゲーションとデクスタラスオブジェクト操作の間に重要なギャップを埋める。
論文 参考訳(メタデータ) (2025-06-02T12:08:08Z) - ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation [62.58034332427291]
ForceVLAは、新しいエンドツーエンド操作フレームワークである。
外部力センシングは、VLAシステム内の第一級のモダリティとして扱う。
論文 参考訳(メタデータ) (2025-05-28T09:24:25Z) - Exploring Self-supervised Skeleton-based Action Recognition in Occluded Environments [40.322770236718775]
我々は,オクルージョンを扱うためのシンプルで効果的な自己教師型学習フレームワークであるIosPSTLを提案する。
IosPSTLはクラスタに依存しないKNN命令とOccluded partial Spatio-Temporal Learning (OPSTL)戦略を組み合わせる。
OPSTLモジュールは適応空間マスキング (Adaptive Spatial Masking, ASM) を組み込んで、トレーニング中に無傷で高品質な骨格配列をうまく活用する。
論文 参考訳(メタデータ) (2023-09-21T12:51:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。