論文の概要: Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory
- arxiv url: http://arxiv.org/abs/2608.16889v1
- Date: Mon, 17 Aug 2026 17:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.836619
- Title: Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory
- Title(参考訳): バトンを落とさない:エージェントサブタスク探索とトランジッション・アウェアメモリによる長距離ロボット操作
- Abstract要約: ビジョン・アヘッドアクションのモデルは個々のスキルを習得する傾向にあるが、チェーンはまだ失敗している。
有望なレシピはVLAを凍結させ、LSMエージェントを担当させる。
トランジッション・アウェア・メモリで探索を行うBATONについて述べる。
ロングホライゾンベンチマークのRoboMemArenaでは、タスクの成功率が11.6%向上し、SoTAよりも14.9%向上した。
- 参考スコア(独自算出の注目度): 23.158521324110392
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon robot manipulation chains many contact-rich skills into one multi-stage task. Vision-language-action (VLA) models increasingly master the individual skills, yet the chain still fails: errors compound beyond the policy's ability to correct, and one subtask silently constrains the next. A promising recipe freezes the VLA and puts an LLM agent in charge: it plans in language, moves in free space with analytic primitives, invokes the VLA only for contact-rich segments, and writes adaptation into language memory. Applied to long horizons, it breaks twice. (1) Competence comes from whole-task exploration at test time, whose cost is multiplicative in stages: if one stage needs T episodes, a K-stage task needs about T^K, and a failure does not reveal which stage caused it. (2) It has no representation of transitions: the VLA primitive carries an exit but no entry condition, so a subtask can succeed in a form its successor cannot use. We present BATON. Against (1), BATON makes the subtask the unit of exploration: each is explored in the cheap short-horizon regime and its solution stored in memory; a long-horizon trajectory is then composed from these solutions rather than discovered whole. Cost becomes additive (T*K) and every failure is attributed to a single stage. Against (2), BATON equips exploration with a transition-aware memory. Within a subtask, a verifier agent governs the invocation transition: the VLA is called only after the wrist view confirms the scene is ready. Across subtasks, a handoff transition restores an entry state disturbed by the predecessor's residue, and a lookahead transition selects the strategy whose outcome the successor can inherit. No parameters are updated. On the long-horizon benchmark RoboMemArena, BATON improves task success by 11.6% and cumulative success by 14.9% over the SoTA.
- Abstract(参考訳): ロングホライズンロボットは、多くのコンタクトリッチなスキルを1つのマルチステージタスクにチェーンする。
視覚言語アクション(VLA)モデルは個々のスキルを習得する傾向にあるが、連鎖は依然として失敗している。
言語で計画し、分析的プリミティブで自由空間に移動し、接触豊富なセグメントのみにVLAを起動し、言語メモリに適応を書き込む。
長い地平線に当てはまると、二度壊れる。
1) テスト時の全タスク探索の能力は,1ステージにTエピソードが必要な場合,KステージタスクがT^Kについて必要であり,どのステージが原因かは明らかにされていない。
2) 遷移の表現はなく、VLAプリミティブは出口を持つがエントリー条件は持たないため、サブタスクはその後継が使用できない形で成功する。
バトンを紹介します。
1) に対して、BATON はサブタスクを探索の単位とし、それぞれが安価な短水平法で探索され、その解は記憶に蓄えられ、長い水平軌道は発見全体ではなくこれらの解から構成される。
コストは加法 (T*K) となり、すべての失敗は1つのステージに帰属する。
2)に対して、BATONはトランジッション対応メモリで探索を行う。
サブタスク内では、検証エージェントが呼び出し遷移を制御し、手首ビューがシーンの準備が整ったことを確認した後のみVLAが呼び出される。
サブタスク全体で、ハンドオフ遷移は前者の残余によって妨げられたエントリー状態を復元し、ルックアヘッド遷移は後継が継承できる戦略を選択する。
パラメータは更新されない。
ロングホライゾンベンチマークのRoboMemArenaでは、タスクの成功率が11.6%向上し、SoTAよりも14.9%向上した。
関連論文リスト
- 2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation [6.040186174770221]
ロングホライズンロボットの操作はメモリを必要とするが、必ずしもアクションポリシーの範囲内ではない。
2AMは、マルチモーダルエージェントをタスクメモリの唯一のホルダーとし、単一のRGBベースの、エピソード的にステートレスなアクションモデルをタスク関連モーションの唯一のエグゼキュータにする。
LIBERO-Memでは、深さ、オンライン幾何、またはプランナーに基づく物体の動きが76.3%に達し、最強のベースラインである14.8%を61.5ポイント改善し、63.0%の緩和と11.8%の厳密な成功を達成している。
論文 参考訳(メタデータ) (2026-09-10T09:35:56Z) - Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents [50.85250898062218]
大規模言語モデル(LLM)エージェントは、通常、ReActスタイルのプロトコルに従う。
自然な方法は、エージェントが可変長のアクションチャンクを出力することです。
しかし、こうした政策を標準的な強化学習で素直に訓練することは失敗する。
論文 参考訳(メタデータ) (2026-09-02T03:17:11Z) - When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation [51.05516457377339]
ロングホライズンロボットの操作には、ロボットが個々のスキルを確実に実行し、拡張されたタスクに対してそれらを一貫性を持ってシーケンスする必要がある。
計算スケーリング可能な推論問題として高レベルサブタスク生成を定式化する階層型ロボット基盤モデルである$_0$-VLAを導入する。
低レベルポリシーは、生成されたサブタスクを複数のロボットエンボディメントにわたって実行する。
論文 参考訳(メタデータ) (2026-08-17T17:59:11Z) - Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models [32.14222486099161]
VLA(Vision-Language-Action)ポリシーは、強力な汎用的な操作先を提供するが、厳密で接触に富んだアセンブリでは失敗することが多い。
凍結VLA基本方針に対する残留強化学習において,この障害モードを示す。
本稿では,各サブタスクのスパース成功報酬をオフライン推定フォレスト値で加算することにより,ハンドオフ品質を最適化するResidual RLを提案する。
論文 参考訳(メタデータ) (2026-07-17T21:00:28Z) - Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition [10.276503485743111]
ロングホライゾンの家庭作業は、多くの言語条件のスキルを構成するロボットを必要とする。
スキルは、ロボットを次のスキルが確実に開始できない状態に置きながら、自身のポストコンディションを満たすことができる。
BEHAVIOR-1Kにおけるこのセマンティックハンドオフ問題について,エージェントオーケストレートな視覚言語-アクション実行ハーネスを用いて検討する。
論文 参考訳(メタデータ) (2026-07-07T13:24:37Z) - Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations [53.931465193216155]
我々は、HSL(Hindsight Supervised Learning)を導入し、補助的なLLMが各完了軌跡をレビューし、エージェントが実際に達成したすべての自然言語目標をラベル付けする。
HSLは軌道をその延長された目標と組み合わせ、これらのペアを追加の微調整に使用する。
実験の結果,HSLは既存のポストトレーニングパイプラインと柔軟で互換性があることがわかった。
論文 参考訳(メタデータ) (2026-07-05T11:21:26Z) - WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation [32.02573096393062]
VLA(Vision-Language-Action)ポリシーは、目覚ましいシングルステップ操作を実現しているが、各ステージが完了した時点では、正確には不安定である。
WeaveLAは、各セグメントを遅延トークンに圧縮するクロスサブタスクメモリインタフェースである。
論文 参考訳(メタデータ) (2026-06-16T03:25:34Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay [14.181844060152367]
99%の成功率と99%のトークン削減を実現するシステムである LOOP SKILL ENGINE を提案する。
決定論的実行計画は、時間依存変数と結果依存変数をパラメータ化しながら、タスクの機能的意図をキャプチャする。
周期的エージェントタスクのベンチマークが5分から24時間に及ぶ間、Loop Skill Engineは毎月のトークン消費を93.3%--99.98%削減し、実行遅延を8.7倍削減し、出力非決定性を排除している。
論文 参考訳(メタデータ) (2026-05-14T01:05:35Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation [27.791908160098625]
PALMは、インタラクション中心のアベイランス推論とサブタスクプログレスキューに関するポリシー学習を構築する。
Palmはシミュレーションや実世界の実験において、一貫してベースラインを上回っている。
論文 参考訳(メタデータ) (2026-01-11T21:00:58Z) - Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks [50.27313829438866]
Plan-Seq-Learn (PSL) は、抽象言語と学習した低レベル制御の間のギャップを埋めるためにモーションプランニングを使用するモジュラーアプローチである。
PSLは85%以上の成功率、言語ベース、古典的、エンドツーエンドのアプローチを達成している。
論文 参考訳(メタデータ) (2024-05-02T17:59:31Z) - Plan, Eliminate, and Track -- Language Models are Good Teachers for
Embodied Agents [99.17668730578586]
事前訓練された大言語モデル(LLM)は、世界に関する手続き的な知識をキャプチャする。
Plan, Eliminate, and Track (PET)フレームワークはタスク記述をハイレベルなサブタスクのリストに変換する。
PETフレームワークは、人間の目標仕様への一般化のために、SOTAよりも15%改善されている。
論文 参考訳(メタデータ) (2023-05-03T20:11:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。