論文の概要: When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
- arxiv url: http://arxiv.org/abs/2608.04574v1
- Date: Wed, 05 Aug 2026 08:04:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.783809
- Title: When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
- Title(参考訳): 記憶の在り方:VLMエージェントにおける空間記憶の安定性に関する実証的研究
- Authors: Yushi Sun, Yanjie Zhang,
- Abstract要約: 記憶を増強したVLMエージェントは、永続的な空間的知識に作用するが、その知識は環境の変化とともに静かに機能する。
エージェントが信頼性のあるメモリクレームを矛盾した観察で調整しなければならない場合や、現在のモデルが安全関連ミスになる前に競合をキャッチできるかどうかを問う。
- 参考スコア(独自算出の注目度): 1.095093532533584
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Memory-augmented VLM agents act on persistent spatial knowledge, yet that knowledge silently goes stale as the environment changes. We ask what happens when an agent must reconcile a confident memory claim with a contradicting observation, and whether current models can catch the conflict before it becomes a safety-relevant mistake. Using a dynamic FrozenLake testbed, we pair a staleness-detection task with a downstream navigation task across three closed-source models and three open-weight VLMs under both text and image inputs (1,800 detection runs, and 12,000 text-mode navigation episodes over four LLM navigators at a shared 50-seed scale). Three findings emerge. First, text solvability does not imply visual grounding: models that flag stale entries reliably from text nonetheless span vision F1 from 0.887 down to 0.067 on the identical grids, and the weakest keeps making fluent, confident decisions that ignore the image. Second, consuming stale memory without an audit is a safety liability: in our primary GPT-4o setting, an agent that trusts raw memory dies more than twice as often as the same agent given no memory at all. Third, auditing helps but does not close the gap: a transparent read-time filter removes much of the safety cost in text mode, yet even oracle stale labels bring no further significant gain on the current grid size, and when visual auditing is unreliable, filtering yields no consistent benefit. Together these results frame spatial-memory staleness as a safety failure mode and isolate reliable visual grounding and action selection under memory--observation conflict as the central open challenges for memory-augmented agents.
- Abstract(参考訳): 記憶を増強したVLMエージェントは、永続的な空間的知識に作用するが、その知識は環境の変化とともに静かに機能する。
エージェントが信頼性のあるメモリクレームを矛盾する観察と整合しなければならない場合や、現在のモデルが安全関連ミスになる前に競合をキャッチできるかどうかを問う。
動的FrozenLakeテストベッドを用いて、3つのクローズドソースモデルと3つのオープンウェイトなVLMをまたいだダウンストリームナビゲーションタスクをテキスト入力とイメージ入力の両方で組み合わせる(4つのLLMナビゲータ上で1,800回の検出実行と12,000回のテキストモードナビゲーション)。
3つの発見がある。
まず、テキストの可解性は視覚的な根拠を示さない: しかし、同じグリッド上の0.887から0.067までのビジョンF1に、テキストから安定なエントリを確実にフラグ付けするモデルは、画像を無視した流動的で確実な決定をし続ける。
第一のGPT-4o設定では、生のメモリを信頼するエージェントは、メモリを全く与えないエージェントの2倍の頻度で死亡する。
透過的な読み取り時フィルタはテキストモードの安全コストの大部分を除去するが、オラクルの古いラベルでさえ、現在のグリッドサイズにさらに大きな利益をもたらすことはなく、視覚的な監査が信頼できない場合、フィルタリングは一貫性のある利益をもたらすことはない。
これらの結果は、空間記憶の安定性を安全障害モードとして捉え、メモリ拡張エージェントに対する中心的なオープン課題として、信頼性の高い視覚的接地と行動選択をメモリ保存競合下で分離する。
関連論文リスト
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - Beyond Similarity: Trustworthy Memory Search for Personal AI Agents [25.265839311088516]
個人AIエージェントにおける信頼境界としてのメモリ探索について検討する。
MemGateは、信頼性の高いメモリ検索のための軽量でデプロイ可能なメモリプラグインである。
論文 参考訳(メタデータ) (2026-06-04T11:54:29Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents [0.0]
コーディングエージェントは、以前の経験、トレースの修復、リポジトリローカルな運用知識を再利用するために、ますます外部メモリに依存している。
本稿では、純トップk検索問題ではなく、選択的かつリスクに敏感な制御問題として、イシューメモリの使用を再検討する。
リスクに敏感なコンテキスト帯域メモリコントローラであるRSCB-MCを導入し,メモリ使用の有無を判断し,トップレゾリューションを注入し,複数の候補を要約し,高精度または高速リコール検索,停止,あるいはフィードバックを求める。
論文 参考訳(メタデータ) (2026-04-30T00:32:53Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers [0.42061757959666934]
大きな言語モデル(LLM)エージェントは、単一のコンテキストウィンドウが小さすぎて何が起きているのかをキャプチャできないような環境で、ますます運用される。
メモリはステートレステキストジェネレータを真に適応的なエージェントに変える。
この調査は、メモリがどのように設計され、実装され、現代のLCMベースのエージェントで評価されるかという構造化された説明を提供する。
論文 参考訳(メタデータ) (2026-03-08T15:08:01Z) - EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents [52.567469286881426]
本稿では,対話型ゲームによるエージェントの長期記憶評価のためのプログラムベンチマークEMemBenchを紹介する。
固定された質問セットを使う代わりに、EMemBenchは各エージェント自身の軌道から質問を生成する。
各テンプレートは、下層のゲーム信号から検証済みの真理を計算する。
論文 参考訳(メタデータ) (2026-01-23T12:09:59Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。