論文の概要: Long-Term Memory for VLA-based Agents in Open-World Task Execution
- arxiv url: http://arxiv.org/abs/2604.15671v1
- Date: Fri, 17 Apr 2026 03:49:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.728991
- Title: Long-Term Memory for VLA-based Agents in Open-World Task Execution
- Title(参考訳): オープンワールドタスク実行におけるVLAエージェントの長期記憶
- Authors: Xu Huang, Weixin Mao, Yinhao Li, Hua Chen, Jiabao Zhao,
- Abstract要約: VLA(Vision-Language-Action)モデルは、具体的意思決定に重要な可能性を示している。
既存のフレームワークは、計画と実行を分離されたプロセスとして扱う。
ChemBotは、自律的なAIエージェントと、階層的なタスクの分解と実行のための進捗対応VLAモデルを統合する。
- 参考スコア(独自算出の注目度): 12.869726287795693
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have demonstrated significant potential for embodied decision-making; however, their application in complex chemical laboratory automation remains restricted by limited long-horizon reasoning and the absence of persistent experience accumulation. Existing frameworks typically treat planning and execution as decoupled processes, often failing to consolidate successful strategies, which results in inefficient trial-and-error in multi-stage protocols. In this paper, we propose ChemBot, a dual-layer, closed-loop framework that integrates an autonomous AI agent with a progress-aware VLA model (Skill-VLA) for hierarchical task decomposition and execution. ChemBot utilizes a dual-layer memory architecture to consolidate successful trajectories into retrievable assets, while a Model Context Protocol (MCP) server facilitates efficient sub-agent and tool orchestration. To address the inherent limitations of VLA models, we further implement a future-state-based asynchronous inference mechanism to mitigate trajectory discontinuities. Extensive experiments on collaborative robots demonstrate that ChemBot achieves superior operational safety, precision, and task success rates compared to existing VLA baselines in complex, long-horizon chemical experimentation.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、決定を具現化するための重要な可能性を示しているが、複雑な化学実験室の自動化への応用は、長い時間軸推論と持続的な経験蓄積の欠如によって制限されている。
既存のフレームワークは通常、計画と実行を分離されたプロセスとして扱い、多くの場合、成功戦略の統合に失敗する。
本稿では,自律型AIエージェントとプログレッシブ対応VLAモデル(スキル-VLA)を統合し,階層的なタスクの分解と実行を行う2層クローズドループフレームワークであるChemBotを提案する。
ChemBotは二重層メモリアーキテクチャを使用して、成功したトラジェクトリを検索可能なアセットに統合し、モデルコンテキストプロトコル(MCP)サーバは効率的なサブエージェントとツールオーケストレーションを容易にする。
VLAモデルの本質的な制約に対処するために、トラジェクトリの不連続を緩和する将来の状態に基づく非同期推論機構をさらに実装する。
協調ロボットに関する大規模な実験により、ChemBotは複雑な長期の化学実験において、既存のVLAベースラインと比較して、運用上の安全性、精度、タスク成功率に優れることを示した。
関連論文リスト
- Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection [15.30405243180468]
長い水平な操作タスクには、永続的なメモリ、適応的なタスクの分解、実行障害からの明示的な回復が必要である。
本フレームワークは,低レベルモータ実行から高レベルセマンティック推論を明示的に分離する。
VLMベースのエージェントモジュールとして実装された高レベルプランナは、構造化されたタスクメモリを維持している。
低レベルエグゼキュータは、VLAベースのビジュモータコントローラとしてインスタンス化され、各サブタスクを実行する。
論文 参考訳(メタデータ) (2026-04-15T14:53:09Z) - ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration [9.434833852972353]
ROSClawは、統一視覚言語モデル(VLM)コントローラにポリシー学習とタスク実行を統合する異種ロボットのためのエージェントフレームワークである。
自律的なクローズループフレームワークを確立することにより、ROSClawはロボット固有の開発への依存を最小限に抑える。
論文 参考訳(メタデータ) (2026-04-06T13:16:24Z) - Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA [62.16042475700567]
本稿では,遠隔操作データ収集を簡易化する共有自律型アシスタントIMCopilotを紹介する。
我々は、不均一な力と触覚モーダルを予め訓練されたVLAバックボーンにシームレスに統合するアーキテクチャであるMoDE-VLAを提案する。
我々は,複雑度を増大させる4つの課題に対するアプローチの有効性を検証し,厳密な接触量の多い課題におけるベースラインよりも2倍の成功率の向上を実証した。
論文 参考訳(メタデータ) (2026-03-09T09:02:30Z) - Mozi: Governed Autonomy for Drug Discovery LLM Agents [21.429647382651677]
依存度の高い医薬品パイプラインでは、自律的なエージェントがしばしば再現不可能な軌道へと漂流する。
我々は、生成AIの柔軟性と計算生物学の決定論的厳密さを橋渡しする二重層アーキテクチャであるMoziを紹介する。
モジの大規模化学空間をナビゲートし、強い毒性フィルターを強制し、シリカ候補において高い競争力を発揮する能力を示す。
論文 参考訳(メタデータ) (2026-03-04T02:22:21Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments [49.02509634515056]
最近のビジョン言語アクションモデルは、ロボット研究所にとって有望な基盤を提供する。
実験は通常、複数の原子タスクからなる長い水平タスクを含む。
科学的なタスクのために微調整されたVLAモデルは、原子実験的なアクションを確実に実行することができるが、これらの既知の原子のアクションを再順序付けして構成することによって形成される複合的なタスクの実行に失敗することが多い。
論文 参考訳(メタデータ) (2026-02-10T05:50:19Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization [61.10456021136654]
本稿では,効率的で汎用的なロボット学習のための統合フレームワークであるFASTerを紹介する。
FASTerVQは、アクションチャンクをシングルチャネルイメージとしてエンコードし、高い圧縮比を維持しながら、グローバルな時間的依存関係をキャプチャする。
FASTerVLAはブロックワイドの自動回帰デコーディングと軽量アクションエキスパートを備えたトークンライザ上に構築されており、推論の高速化とタスクパフォーマンスの向上を実現している。
論文 参考訳(メタデータ) (2025-12-04T16:21:38Z) - Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation [12.077740860502878]
身体的ロングホライゾン操作では、ロボットシステムが視覚や自然言語などのマルチモーダル入力を処理し、それらを実行可能なアクションに変換する必要がある。
近年,大規模言語モデル (LLM) を自然言語を用いてタスクをサブタスクに分解し,事前訓練した低レベルコントローラを誘導する高レベルプランナとしての利用が検討されている。
我々のフレームワークは,LoHoRavens,CALVIN,Franka Kitchen,および乱雑な現実世界設定をまたいだ,30以上の多様かつ不明瞭なロングホライゾンタスクに対して,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-03-27T20:32:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。