論文の概要: Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- arxiv url: http://arxiv.org/abs/2607.05377v1
- Date: Mon, 06 Jul 2026 17:55:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.271733
- Title: Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- Title(参考訳): Cortex:ロングホライゾンマニピュレーションのための双方向配向型エージェントフレームワーク
- Authors: Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang,
- Abstract要約: VLA(Vision-Language-Action)モデルは、マルコフの自然が現在の観測にのみ依存するため、長い水平課題に苦しむ。
我々は,高レベルなVLMから低レベルなVLAへ,実行可能かつトラクタブルなサブタスクプランを伝達するフレームワークであるCortexを紹介する。
これにより、4k時間以上のオープンソースビデオデータの自動アノテーションと30時間のシミュレーションデータを生成することができる。
- 参考スコア(独自算出の注目度): 40.0334846364089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While recent Vision-Language-Action (VLA) models show promise toward generalist manipulation policies, they struggle with long-horizon tasks due to their Markovian nature-relying solely on current observations. Hierarchical dual-system methods address this but suffer from a gap between high-level planning semantics and low-level execution kinematics. We introduce Cortex, a bidirectionally aligned embodied agent framework with a customized planning interface that conveys executable and tractable subtask plans from high-level VLM to low-level VLA. Specifically, we standardize manipulation subtasks into 32 canonical skill primitives and inject tractability principles, such as representative object attributes and improved trajectory reachability, into the data generation pipeline. This enables automatic annotation of over 4k hours of open-source video data and generation of 30 hours of simulation data. We further devise an event-balanced sampling strategy to construct training data for fine-tuning the framework to better handle planning ambiguity during subtask transitions, enhanced by carefully designed harness engineering from task contexts to skill constraints during inference. Both open-loop VLM and closed-loop system evaluations demonstrate Cortex's efficacy, e.g., it outperforms monolithic baselines by 3.1% on Libero-long and 4.1% on RoboTwin. Notably, Cortex's generalist VLM enables zero-shot completion of unseen real-world long-horizon tasks, such as multi-stage chemistry experiments, by simply combining with a fine-tuned VLA-a capability infeasible through VLA fine-tuning alone.
- Abstract(参考訳): 近年のVision-Language-Action (VLA) モデルでは、一般的な操作ポリシーへの期待が示されているが、マルコフの自然が現在の観測のみにのみ依存していることから、長期的なタスクに苦慮している。
階層的二重系法はこの問題に対処するが、高レベルの計画意味論と低レベルの実行キネマティクスとのギャップに悩まされる。
我々は、高レベルなVLMから低レベルなVLAへ実行可能なサブタスクプランを伝達する、カスタマイズされた計画インターフェースを備えた双方向整列型エージェントフレームワークであるCortexを紹介する。
具体的には、サブタスクを32種類の標準スキルプリミティブに標準化し、データ生成パイプラインに対象属性や軌道到達性の改善といったトラクタビリティの原則を注入する。
これにより、4k時間以上のオープンソースビデオデータの自動アノテーションと30時間のシミュレーションデータを生成することができる。
さらに、タスクコンテキストから推論時のスキル制約に至るまで、慎重に設計されたハーネスエンジニアリングによって強化され、サブタスク移行時のプランニングのあいまいさをよりよく扱えるように、フレームワークを微調整するためのトレーニングデータを構築するためのイベントバランスサンプリング戦略を考案する。
オープンループVLMとクローズドループシステムの評価は、Cortexの有効性を示している。例えば、リベロロングでは3.1%、ロボトライアンでは4.1%、モノリシックベースラインでは3.1%である。
特に、CortexのジェネラリストであるVLMは、VLA微細調整のみでは不可能な細調整のVLA-a能力と単純に組み合わせることで、多段階化学実験のような目に見えない現実世界の長距離タスクのゼロショット完了を可能にしている。
関連論文リスト
- Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models [9.608633915316252]
VLA(Vision-Language-Action)モデルでは、一般化可能なロボット操作の可能性を示している。
現在のパラダイムは、教師付き微調整中の粗大でハイレベルなタスク命令に依存している。
スケーラブルなオフライン後トレーニングパイプラインと統合された,最初のサブタスク対応VLAフレームワークである方法を提案する。
論文 参考訳(メタデータ) (2026-03-09T15:52:48Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving [44.008287454538596]
視覚言語モデル(VLM)は、クロスモーダルな先行とコモンセンス推論を導入することで、このパラダイムを豊かにする。
現在のVLMベースのプランナは、(i) 個別のテキスト推論と継続的制御のミスマッチ、(ii) 自己回帰的連鎖のデコーディングからの高い遅延、(iii) リアルタイムデプロイメントを制限する非効率または非因果的なプランナである。
テキストから潜在空間へ推論を転送し,それを階層的並列軌道デコーダで結合する統合視覚言語アクションフレームワークColaVLAを提案する。
論文 参考訳(メタデータ) (2025-12-28T14:06:37Z) - VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models [33.143187576673775]
本稿では,3つの軸にまたがる難易度を定量化するための新しい構造化タスク設計フレームワークを提案する。
タスク構造では、VLA-Arenaの170のタスクは、安全性、ディトラクタ、外挿、ロングホライゾンの4つの次元に分けられる。
タスク定義から自動評価までのエンドツーエンドツールチェーンと、微調整のためのVLA-Arena-S/M/Lデータセットを提供する。
論文 参考訳(メタデータ) (2025-12-27T09:40:54Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation [59.9896841079005]
長距離ロボット操作における高レベル推論評価のためのベンチマークであるRoboCerebraを紹介する。
データセットはトップダウンパイプラインを通じて構築され、GPTはタスク命令を生成し、それらをサブタスクシーケンスに分解する。
以前のベンチマークと比較すると、RoboCerebraはアクションシーケンスが大幅に長く、アノテーションがより密度が高い。
論文 参考訳(メタデータ) (2025-06-07T06:15:49Z) - Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation [12.077740860502878]
身体的ロングホライゾン操作では、ロボットシステムが視覚や自然言語などのマルチモーダル入力を処理し、それらを実行可能なアクションに変換する必要がある。
近年,大規模言語モデル (LLM) を自然言語を用いてタスクをサブタスクに分解し,事前訓練した低レベルコントローラを誘導する高レベルプランナとしての利用が検討されている。
我々のフレームワークは,LoHoRavens,CALVIN,Franka Kitchen,および乱雑な現実世界設定をまたいだ,30以上の多様かつ不明瞭なロングホライゾンタスクに対して,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-03-27T20:32:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。