論文の概要: Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering
- arxiv url: http://arxiv.org/abs/2607.21571v1
- Date: Thu, 23 Jul 2026 17:50:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.511104
- Title: Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering
- Title(参考訳): エピソード評価を超えて:シークエンシャルな質問回答における記憶構造ボツネック
- Authors: Zikui Cai, Kaushal Janga, Tan Dat Dao, Seungjae Lee, Shivin Dass, Mingyo Seo, Kaiyu Yue, Mintong Kang, Nandhu Pillai, Monte Hoover, Aadi Palnitkar, Ruchit Rawal, Ruijie Zheng, Bo Li, Yuke Zhu, Roberto Martín-Martín, Tom Goldstein, Furong Huang,
- Abstract要約: EQA(Embodied Question answering)は、伝統的にエピソードの定式化の下で評価され、エージェントは各タスクを独立して解決し、エピソード間の内部状態をリセットする。
EQAエージェントを逐次評価する際に異なるメモリアーキテクチャがどのように振る舞うかを検討する。
既存のメモリを単純に保存することは、しばしば不十分である。
連続したシーン表現の視覚的意味的証拠を3次元幾何学にマッピングするアーキテクチャについて, 構造的, 空間的基盤的記憶の必要性を強調した。
- 参考スコア(独自算出の注目度): 93.80043825360514
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied question answering (EQA) is traditionally evaluated under an episodic formulation, where agents solve each task independently and reset internal state between episodes. However, real-world robots operate continuously and must accumulate, retain, and selectively reuse information acquired from prior interactions. Despite this practical requirement, the architectural mechanisms needed to support sequential memory in EQA remain underexplored. In this work, we investigate how different memory architectures behave when EQA agents are evaluated sequentially, with multiple questions answered in the same scene while memory is carried forward across queries. We find that simply preserving existing memory is often insufficient. Agents that retain only traversability information, such as 2D occupancy maps, remember where the robot has explored but not the visual-semantic evidence needed for later questions. Agents trained on short-horizon episodic data face a different challenge: when exposed to continuous, multi-query histories, their inherited context suffers from severe temporal mismatch, rather than forming a reusable scene representation. To overcome this architectural bottleneck, we highlight the necessity of structured, spatially grounded memory: architectures that map persistent visual observations onto metric 3D geometry preserve visual-semantic evidence in a coherent scene representation. Extensive experiments in simulated environments reveal that this form of memory breaks the accuracy-efficiency tradeoff in sequential settings, simultaneously achieving higher answer accuracy and lower navigation costs. We further validate these findings on a real-world mobile robot, demonstrating that spatially grounded visual memory is critical for enabling continuous, intelligent operation in physical environments.
- Abstract(参考訳): EQA(Embodied Question answering)は、伝統的にエピソードの定式化の下で評価され、エージェントは各タスクを独立して解決し、エピソード間の内部状態をリセットする。
しかし、現実のロボットは継続的に動作し、事前のインタラクションから取得した情報を蓄積し、保持し、選択的に再利用する必要がある。
この実践的な要件にもかかわらず、EQAのシーケンシャルメモリをサポートするのに必要なアーキテクチャメカニズムは未解明のままである。
本研究では,EQAエージェントを逐次評価する際に異なるメモリアーキテクチャがどのように振る舞うかを検討する。
既存のメモリを単純に保存することは、しばしば不十分である。
2D占有マップのような移動可能性情報のみを保持するエージェントは、ロボットがどの場所を探索したかを記憶するが、後の質問に必要な視覚的意味的な証拠は記憶しない。
短水平のエピソードデータで訓練されたエージェントは異なる課題に直面している: 連続したマルチクエリ履歴に曝されると、その遺伝状況は、再利用可能なシーン表現を形成するのではなく、深刻な時間的ミスマッチに悩まされる。
このアーキテクチャのボトルネックを克服するために、構造化された空間的に基底付けられたメモリの必要性を強調した: 永続的な視覚的観察をメートル法にマッピングするアーキテクチャは、コヒーレントなシーン表現における視覚的意味的証拠を保存する。
シミュレーション環境での大規模な実験により、この形態のメモリはシーケンシャルな設定で精度と効率のトレードオフを破り、高い応答精度とナビゲーションコストを同時に達成することが明らかとなった。
実世界の移動ロボット上でのこれらの知見をさらに検証し、空間的に接地された視覚記憶が物理的環境における連続的インテリジェントな操作を実現する上で重要であることを示す。
関連論文リスト
- SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory [14.96864764261795]
SuperMemory-VQAは、実用的な長期記憶タスクでAIアシスタントを評価するデータセットである。
これには、同期RGBビデオ、音声の書き起こし、視線、IMU、SLAMトラジェクトリなど、AIメガネで記録された日常的な活動の52.9時間が含まれている。
対象と位置記憶,意図的リコール,視覚的シーンリコール,タイムライン再構築,会話記憶,コンテキスト内検索にまたがる4,853の質問応答対を構築した。
論文 参考訳(メタデータ) (2026-05-30T17:53:10Z) - MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems [69.06764269022925]
本研究では,現在の記憶増強剤が現実的,干渉重大,長期的設定において果たす役割について検討する。
MINTEvalは、頻繁に更新される情報を備えた、長く高度に相互接続されたコンテキストを特徴とするベンチマークである。
MINTEvalは128.8kのトークンを平均で1インスタンスあたり1.8Mのトークンに拡張し、15.6kの質問応答ペアを持つ。
論文 参考訳(メタデータ) (2026-05-18T15:43:35Z) - MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios [33.8882826707344]
MemGroundは、リッチでゲーミフィケーションされたインタラクティブシナリオを基盤とした、厳格な長期メモリベンチマークである。
メモリ利用と行動軌跡の両方を包括的に定量化するために,多次元計量スイートを提案する。
論文 参考訳(メタデータ) (2026-03-23T02:57:39Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers [0.42061757959666934]
大きな言語モデル(LLM)エージェントは、単一のコンテキストウィンドウが小さすぎて何が起きているのかをキャプチャできないような環境で、ますます運用される。
メモリはステートレステキストジェネレータを真に適応的なエージェントに変える。
この調査は、メモリがどのように設計され、実装され、現代のLCMベースのエージェントで評価されるかという構造化された説明を提供する。
論文 参考訳(メタデータ) (2026-03-08T15:08:01Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Enter the Mind Palace: Reasoning and Planning for Long-term Active Embodied Question Answering [27.218583831470212]
LA-EQA(Long-term Active Question Answering)は、ロボットが過去の経験を思い出し、その環境を積極的に探究して、複雑な時間的な質問に答えなければならない、という新しいタスクである。
大規模なモデルに基づく標準的なEQAアプローチは、コンテキストウインドウの制限、永続メモリの欠如、メモリリコールとアクティブな探索を組み合わせられないため、この設定で苦労している。
本稿では,認知科学のマインド・パレス法にヒントを得た,ロボットのための構造化メモリシステムを提案する。
論文 参考訳(メタデータ) (2025-07-17T07:11:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。