論文の概要: TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation
- arxiv url: http://arxiv.org/abs/2609.23580v2
- Date: Sun, 27 Sep 2026 12:49:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.507064
- Title: TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation
- Title(参考訳): TaskAnchor: 長時間操作のためのリアクティブVLAにおける接地タスク状態
- Abstract要約: TaskAnchorは、VLAのネイティブ入力空間に実行コンテキストを注入することで、タスク状態をグラウンドする軽量アダプタである。
RMBench上のpi0.5とX-VLAのベースラインの平均成功率は約6倍となり、RoboMemArena上でのpi0.5のタスク成功率は2倍になる。
- 参考スコア(独自算出の注目度): 49.02604313942616
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reactive vision-language-action (VLA) policies suffer from task-state aliasing in long-horizon manipulation, where identical multimodal inputs call for distinct, context-dependent actions. Given that pretrained VLAs already possess rich control primitives to express diverse behaviors, we hypothesize that the execution bottleneck lies not in policy capacity, but in input ambiguity. In this paper, we propose TaskAnchor, a lightweight adapter that grounds task state by injecting execution context into the VLA's native input space. During post-training, TaskAnchor learns to represent the semantic execution stage as a milestone-supervised coordinate prepended to the language instruction, while incorporating fine-grained historical evidence via a residual update to the current visual tokens. This formulation avoids generating complex subtask instructions and leaves the backbone architecture unchanged. Across long-horizon benchmarks, TaskAnchor delivers substantial gains, achieving approximately 6 times the average success rate of the pi0.5 and X-VLA baselines on RMBench and more than doubling the task success rate of pi0.5 on RoboMemArena. Real-robot experiments further validate reliable multi-stage execution, with the same policy adapting its subsequent behaviors using earlier human interactions as in-context cues. Our project website is available at taskanchor-iclr.netlify.app.
- Abstract(参考訳): VLA (Reactive Vision-Language-action) ポリシは,マルチモーダル入力が異なるコンテキスト依存的なアクションを要求されるような,長期的操作におけるタスク状態のエイリアスに悩まされる。
事前訓練されたVLAは、多様な振る舞いを表現するための豊富な制御プリミティブを持っているので、実行ボトルネックは政策能力ではなく、入力のあいまいさにあると仮定する。
本稿では,VLAのネイティブ入力空間に実行コンテキストを注入することでタスク状態を基底とする軽量アダプタTaskAnchorを提案する。
トレーニング後、TaskAnchorは、セマンティック実行ステージを、言語命令に先立つマイルストーン管理された座標として表現することを学び、現在のビジュアルトークンの残余の更新を通じて、きめ細かい歴史的証拠を取り入れた。
この定式化は複雑なサブタスク命令の生成を回避し、バックボーンアーキテクチャを変更せずにすむ。
長期的なベンチマークでは、TaskAnchorは、RMBench上でのpi0.5とX-VLAのベースラインの平均成功率の約6倍を達成し、RoboMemArena上でのpi0.5のタスク成功率を2倍にしている。
実ロボット実験は、より信頼性の高い多段階実行を検証する。
プロジェクトのWebサイトは Taskanchor-iclr.netlify.app で公開されている。
関連論文リスト
- EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents [56.25120535601186]
視覚言語アクション(VLA)モデルは、視覚観察と言語指示を直接ロボットアクションにマッピングする。
本稿では,各スキル決定を実行提案として扱うフレームワークであるEmbodiedSkillsを提案する。
共有可能スキルインタフェースは、ハイレベルスキル選択、バウンドローレベルVLA実行、ポストアクション検証を接続する。
論文 参考訳(メタデータ) (2026-09-01T14:14:47Z) - TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation [14.84720789511593]
本稿では,物理的基盤の時間的監督を通じて,コンパクトな実行履歴を学習するTemporalFlow-VLAを提案する。
LIBERO Longでは96.60+/-0.87%、RoboTwin 12タスクで85.5%/84.2%のクリーン/ランダム化成功を含む、TemporalFlow-VLAが平均97.63+/-0.26%のLIBEROで平均的な成功を達成していることを示す。
論文 参考訳(メタデータ) (2026-08-27T09:00:56Z) - A Task-State Representation for Long-Horizon Mobile GUI Agents [53.359524744953575]
Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
論文 参考訳(メタデータ) (2026-07-01T06:37:21Z) - S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation [34.73337776403718]
VLA(Vision-Language-Action)モデルは、ロボット操作において強力な能力を示しているが、その性能は長距離作業では著しく低下している。
本稿では,SSGAA(State-Space Guided Adaptive Attention)機構を導入するフレームワークであるS$2$-VLAを提案する。
S$2$-VLAは、より大きな7Bスケールモデルより一貫して優れており、ロングホライゾンのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-26T09:13:16Z) - WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation [32.02573096393062]
VLA(Vision-Language-Action)ポリシーは、目覚ましいシングルステップ操作を実現しているが、各ステージが完了した時点では、正確には不安定である。
WeaveLAは、各セグメントを遅延トークンに圧縮するクロスサブタスクメモリインタフェースである。
論文 参考訳(メタデータ) (2026-06-16T03:25:34Z) - RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models [13.691036198349465]
VLA(Vision-Language-Action)モデルは一般的なロボット操作を約束するが、通常は短期水平政策として訓練され展開される。
信頼性の高い長距離操作を可能にする階層型フレームワークであるCodeGraphを提案する。
論文 参考訳(メタデータ) (2026-04-24T05:27:27Z) - Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining [56.62125584296097]
Keyframe-Chaining VLAは、キー履歴フレームを抽出し、長い水平依存関係をモデル化するフレームワークである。
本研究では,現在の実行フェーズに対する時間的関連性に基づいて,動的に履歴フレームを検索する進捗対応機構を設計する。
タスク成功率を測定するために,ManiSkillシミュレータ上に構築された4つの非マルコフ操作タスクスイートを紹介する。
論文 参考訳(メタデータ) (2026-03-02T05:26:29Z) - PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation [27.791908160098625]
PALMは、インタラクション中心のアベイランス推論とサブタスクプログレスキューに関するポリシー学習を構築する。
Palmはシミュレーションや実世界の実験において、一貫してベースラインを上回っている。
論文 参考訳(メタデータ) (2026-01-11T21:00:58Z) - Generalizable Long-Horizon Manipulations with Large Language Models [91.740084601715]
本研究は,Large Language Models (LLMs) の機能を活用して,汎用可能な長距離操作のための原始的なタスク条件を生成するフレームワークを導入する。
我々は,Pybulletに基づくロボット操作タスクスイートを作成し,長期作業評価を行う。
論文 参考訳(メタデータ) (2023-10-03T17:59:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。