論文の概要: HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control
- arxiv url: http://arxiv.org/abs/2607.03449v1
- Date: Fri, 03 Jul 2026 16:06:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.621847
- Title: HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control
- Title(参考訳): HiMe: 長距離ビジョンランゲージ動作制御のための階層型エンボディードメモリ
- Abstract要約: 現在のビジョン・ランゲージ・アクション(VLA)モデルはロボット操作に優れているが、長期記憶と推論を必要とする非マルコフ的なタスクにしばしば苦労する。
我々は,インテリジェンスを高周波実行器に分解する階層型エンボディードメモリフレームワークであるHiMeを提案する。
クロスモーダルなセマンティックスキーマとアクティブな管理機構に基づく動的知識システムも導入する。
- 参考スコア(独自算出の注目度): 44.615731727091166
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current Vision-Language-Action (VLA) models excel at robotic manipulation but often struggle with non-Markovian tasks requiring long-term memory and reasoning due to their reliance on immediate observations. Existing solutions face a ''frequency-competence paradox,'' where stronger reasoning models are too slow for real-time control, while faster models lack sufficient reasoning capabilities. To resolve this architectural misalignment, we propose HiMe, a Hierarchical Embodied Memory framework that decouples embodied intelligence into a high-frequency Executor for execution, a Sentry for working memory, and a Planner for long-term strategy. We also introduce a dynamic knowledge system based on cross-modal semantic schemas and active management mechanisms, allowing robots to maintain memory plasticity through ''Add, Update, and Delete'' operations. This hierarchical design effectively balances the conflict between real-time execution and slow thinking planning, significantly improving success rates in long-horizon tasks. Experiments demonstrate that this approach not only outperforms flat memory baselines but also exhibits the novel ability to self-correct its internal knowledge based on human preferences.
- Abstract(参考訳): 現行のビジョン・ランゲージ・アクション(VLA)モデルはロボット操作に優れるが、即時観測に依存するため、長期記憶と推論を必要とする非マルコフ的タスクにしばしば苦労する。
既存のソリューションは、より強力な推論モデルはリアルタイム制御には遅すぎるが、高速なモデルには十分な推論能力がない''周波数コンピテンスパラドックス'に直面する。
このアーキテクチャのミスアライメントを解決するために,インテリジェンスを高頻度で実行するための実行装置,ワーキングメモリのためのSentry,長期戦略のためのプランナーに分離する階層型エンボダイドメモリフレームワークであるHiMeを提案する。
また,クロスモーダルなセマンティックスキーマとアクティブな管理機構に基づく動的知識システムを導入し,ロボットによる「Add, Update, Delete」操作による記憶の可塑性の維持を可能にする。
この階層的設計は、リアルタイム実行と遅い思考計画の矛盾を効果的にバランスさせ、長期作業の成功率を大幅に向上させる。
実験により、このアプローチはフラットメモリのベースラインを上回るだけでなく、人間の好みに基づいて内部知識を自己修正する新たな能力も示している。
関連論文リスト
- MemoryWAM: Efficient World Action Modeling with Persistent Memory [80.90899269062128]
本稿では,効率的な永続メモリを持つ世界アクションモデルであるMemoryWAMを紹介する。
調整された注意機構は、詳細な短期コンテキストと圧縮された長期コンテキストの両方の検索を可能にする。
MemoryWAMは、シミュレーションと実世界の両方において、強力な視覚言語アクション(VLA)とWAMベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-18T17:59:51Z) - ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning [46.225019133047965]
メモリは、大規模言語モデル(LLM)エージェントが長距離推論タスクを処理できるようにするために必須である。
コア推論プロセスからエージェントメモリを分離するフレームワークであるActiveMemを提案する。
BrowseComp-PlusとGAIAの実験では、ActiveMemはオーバーヘッドを大幅に削減して最先端の精度を実現している。
論文 参考訳(メタデータ) (2026-06-09T08:03:38Z) - HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation [12.167895321305464]
動作中心の潜伏動作、ハイレベルなスキル潜伏動作、境界トリガーによるメモリ更新を統合した階層型メモリゲート型WAMであるHiMem-WAMを提案する。
具体的には,低レベル動作と高レベルスキル潜伏者を協調的に学習する階層型潜伏行動フレームワークを開発する。
境界対応メモリゲートは、予測されたスキル遷移時にコンパクトなタスク状態を書き、将来のビデオや光フロー推定をテスト時間生成することなく因果推論を可能にする。
論文 参考訳(メタデータ) (2026-06-09T03:22:34Z) - MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models [80.70528162709276]
効果的な制御は過去の相互作用の記憶と将来の状態の想像を必要とするため、ロボット操作には時間モデリングが不可欠である。
本稿では,VLAモデルにメモリと想像力を付与し,ロボット操作のためのフル時間モデリングフレームワークであるMemoryVLA++を提案する。
提案手法は,Libero,SimplerEnv,Mikasa-Robo,Calvin,Libero-Plus,多種多様な実ロボットタスクにまたがって高い性能を実現する。
論文 参考訳(メタデータ) (2026-06-08T17:59:53Z) - AdMem: Advanced Memory for Task-solving Agents [13.611633561917513]
大規模言語モデル(LLM)はツール使用エージェントとしての約束を示すが、知識の記憶、整理、再利用を必要とする長期的タスクには制限がある。
本稿では,短期記憶と長期記憶を組み合わせた2段階設計において,セマンティック,エピソード,手続き記憶を統合した統合的・自動記憶フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-05T00:11:57Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents [3.9396865837159822]
HiMemは、長距離対話のための階層的長期記憶フレームワークである。
メモリ構築、検索、持続的なインタラクション中の動的更新をサポートする。
その結果、HiMemは、精度、一貫性、長期的な推論において、代表的ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-10T01:26:01Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z) - FindingDory: A Benchmark to Evaluate Memory in Embodied Agents [49.18498389833308]
本研究では,Habitatシミュレータに長距離エンボディタスクのための新しいベンチマークを導入する。
このベンチマークは、持続的なエンゲージメントとコンテキスト認識を必要とする60タスクにわたるメモリベースの機能を評価する。
論文 参考訳(メタデータ) (2025-06-18T17:06:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。