論文の概要: MIKASA-Robo-VLA: Benchmarking Memory in VLA Models for Long-Horizon Manipulation
- arxiv url: http://arxiv.org/abs/2610.00604v1
- Date: Wed, 30 Sep 2026 19:10:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.726048
- Title: MIKASA-Robo-VLA: Benchmarking Memory in VLA Models for Long-Horizon Manipulation
- Title(参考訳): MIKASA-Robo-VLA:長期操作のためのVLAモデルのベンチマークメモリ
- Abstract要約: MIKASA-Robo-VLAは90の言語条件の操作タスクのベンチマークである。
各タスクは命令を提供するが、メモリ依存タスクはタスク関連キューを隠す。
RLDSとLeRobotDataset v3の10種類のメモリにまたがる22,500のオラクルトラジェクトリをリリースします。
- 参考スコア(独自算出の注目度): 45.14305118993196
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action policies often see only one or a few recent frames, which makes it difficult to evaluate how they use information that disappears during a task. We introduce MIKASA-Robo-VLA, a benchmark of 90 language-conditioned manipulation tasks. All but 10 hide the cue an action depends on. Those 10 are reactive controls. MIKASA-Robo, the suite it rebuilds, has 32 tasks and uses language only in a representative VLA subset. Here every task provides an instruction, while memory-dependent tasks hide a task-relevant cue and reactive controls keep it available. For 70 tasks, environment phase timings specify an information gap, and for 28 of them the gap exceeds the 16-frame window of the widest fixed-context VLA we survey. The gap counts only the interval the cue is provably absent, not the full duration a policy must retain it, so every memory-dependent task still requires memory by construction, including the ones whose measured gap is short. We release 22,500 oracle trajectories across 10 memory types in RLDS and LeRobotDataset v3. A reference $π_{0.5}$ baseline with current images and proprioception, but no observation history or explicit memory module, is fine-tuned on 14 tasks and achieves 0.211 $\pm$ 0.044 mean task success. Its lower success on the evaluated Long-split tasks is confounded by open-loop chunking and the memory types represented in that subset. Project page: https://mikasarobo.github.io/
- Abstract(参考訳): 視覚言語アクションポリシーは、しばしば1つまたは数つの最近のフレームしか見えないため、タスク中に消える情報をどのように利用するかを評価することは困難である。
我々は90の言語条件による操作タスクのベンチマークであるMIKASA-Robo-VLAを紹介する。
10人以外はすべて、アクションが依存するキューを隠します。
これらの10は反応制御である。
MIKASA-Roboは32のタスクを持ち、代表的なVLAサブセットでのみ言語を使用する。
ここでは、すべてのタスクが命令を提供し、メモリ依存のタスクがタスク関連キューを隠蔽し、リアクティブコントロールが利用可能である。
70のタスクでは、環境相のタイミングが情報ギャップを指定し、28のタスクでは、最も広範に固定されたVLAの16フレームのウィンドウを超えたギャップを探索する。
このギャップは、キューが確実に欠落している間隔のみをカウントし、ポリシーが保持しなければならない全期間をカウントしないため、測定されたギャップが短いものを含む全てのメモリ依存タスクは、構成によってメモリを必要とする。
RLDSとLeRobotDataset v3の10種類のメモリにまたがる22,500のオラクルトラジェクトリをリリースします。
参照$π_{0.5}$baseline with current image and proprioception, but no observed history and explicit memory module, are fine-tuned on 14 task, and achieve 0.211 $\pm$ 0.044 mean task success。
評価されたLong-splitタスクでの低い成功は、オープンループチャンキングと、そのサブセットで表されるメモリタイプによって構築される。
プロジェクトページ: https://mikasarobo.github.io/
関連論文リスト
- ECoMEM: Explicit Concept Memory for Memory-Dependent Robot Control [16.592888860803914]
現在の視覚言語アクション(VLA)ポリシーは、アクションに必要な情報が現在の観察から消えると、しばしば失敗する。
既存のアプローチは通常、長い歴史を提供するか、観察行動軌跡から暗黙の記憶を学ぶ。
私たちは、過去の証拠を根拠とした説明を、その行動の学習から切り離しています。
論文 参考訳(メタデータ) (2026-09-30T22:54:28Z) - EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies [68.812675280427]
EventVLAは、疎視的エビデンスメモリの概念に基づいて開発されたエンドツーエンドフレームワークである。
KEMは、VLAの潜伏した埋め込みから将来の確率を直接予測し、スパースでタスククリティカルな視覚イベントを自律的にキャプチャして保存する。
対話型視覚的エビデンスで非マルコフ操作タスクを評価するための診断ベンチマークであるRoboTwin-MeMを提案する。
論文 参考訳(メタデータ) (2026-06-18T11:11:37Z) - RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark [49.16825786282095]
記憶はロボットインテリジェンスにとって重要な要素であり、ロボットは長期のタスクを達成するために過去の観察と行動に頼る必要がある。
既存のロボットメモリベンチマークには、メモリ形成のためのマルチモーダルアノテーションがなく、タスクカバレッジと構造的複雑さが制限されており、実際の評価なしにシミュレーションに制限されている。
このギャップに対処するため、26タスクの大規模ベンチマークであるRoboMemArenaでは、タスク毎の平均軌道長が1,000ステップを超え、サブタスクの68.9%がメモリ依存である。
論文 参考訳(メタデータ) (2026-05-11T17:54:49Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks [9.55115186979077]
言語スクラッチパッドを組み込むことにより,空間記憶と時間記憶の両方を視覚言語アクション(VLA)モデルに付与する方法を示す。
本手法は,ClevrSkills環境からのメモリ依存タスクの分割,MemoryBench上でのメモリ依存タスク,そして実世界のピック・アンド・プレイスタスクにおいて評価する。
論文 参考訳(メタデータ) (2026-02-24T15:30:55Z) - ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL [48.214881182054164]
本研究では,外部メモリを構造化したトランスアーキテクチャであるEMMURを提案する。
ELMURは、注意窓の向こうに10万倍の有効地平線を拡大する。
最大100万歩の廊下を持つ合成T-Mazeタスクで100%の成功率を達成する。
論文 参考訳(メタデータ) (2025-10-08T15:50:34Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。