論文の概要: OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
- arxiv url: http://arxiv.org/abs/2604.26622v1
- Date: Wed, 29 Apr 2026 12:49:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.400844
- Title: OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
- Title(参考訳): OCRメモリ:長距離エージェントメモリのための光コンテキスト検索
- Authors: Jinze Li, Yang Zhang, Xin Yang, Jiayi Qu, Jinfeng Xu, Shuo Yang, Junhua Ding, Edith Cheuk-Han Ngai,
- Abstract要約: OCR-Memoryは、エージェント体験の高密度表現として視覚的モダリティを活用するメモリフレームワークである。
OCR-Memoryは、Emphlocate-and-transcribeパラダイムを通じて格納されたエクスペリエンスを検索し、視覚アンカーを通じて関連する領域を選択し、対応する動詞のテキストを検索する。
- 参考スコア(独自算出の注目度): 12.240259398680259
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous LLM agents increasingly operate in long-horizon, interactive settings where success depends on reusing experience accumulated over extended histories. However, existing agent memory systems are fundamentally constrained by text-context budgets: storing or revisiting raw trajectories is prohibitively token-expensive, while summarization and text-only retrieval trade token savings for information loss and fragmented evidence. To address this limitation, we propose Optical Context Retrieval Memory (OCR-Memory), a memory framework that leverages the visual modality as a high-density representation of agent experience, enabling retention of arbitrarily long histories with minimal prompt overhead at retrieval time. Specifically, OCR-Memory renders historical trajectories into images annotated with unique visual identifiers. OCR-Memory retrieves stored experience via a \emph{locate-and-transcribe} paradigm that selects relevant regions through visual anchors and retrieves the corresponding verbatim text, avoiding free-form generation and reducing hallucination. Experiments on long-horizon agent benchmarks show consistent gains under strict context limits, demonstrating that optical encoding increases effective memory capacity while preserving faithful evidence recovery.
- Abstract(参考訳): 自律的なLLMエージェントは、長い水平な対話的な環境でますます運用され、成功は、拡張履歴の上に蓄積された再利用経験に依存する。
しかし、既存のエージェントメモリシステムは、テキストコンテキストの予算によって基本的に制限されている: 生のトラジェクトリの保存または再検討は禁じられているが、要約とテキストのみの検索取引トークンは、情報損失と断片化された証拠のために保存される。
この制限に対処するために,エージェント体験の高密度表現として視覚的モダリティを活用するメモリフレームワークであるOCRメモリを提案する。
具体的には、OCRメモリは歴史的軌跡をユニークな視覚的識別子を付加した画像に描画する。
OCR-Memory は \emph{locate-and-transcribe} パラダイムを通じて格納されたエクスペリエンスを検索し、視覚的アンカーを通じて関連する領域を選択し、対応する動詞のテキストを検索し、フリーフォームの生成を避け、幻覚を減少させる。
長距離エージェントベンチマークの実験では、厳密な文脈制限の下で一貫した利得を示し、光符号化が忠実な証拠回復を保ちながら、効果的なメモリ容量を増大させることを示した。
関連論文リスト
- All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution [20.68235182577703]
All-Memは明示的で非破壊的な統合を通じて構造化されたメモリバンクを維持している。
LLM診断器は定期的にオフラインで、SPLIT、MERGE、UPDATEの3つの演算子で実行される信頼性スコアトポロジ編集を提案する。
クエリ時には、タイプドリンクはホップバウンドで、アクティブアンカーから必要に応じてアーカイブされたエビデンスへの予算付き拡張を可能にする。
論文 参考訳(メタデータ) (2026-03-20T03:14:40Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning [36.52465672754168]
本稿では,コンテキスト予算の厳しい長期推論を改善するマルチモーダルメモリエージェントであるMemOCRを紹介する。
MemOCRは、視覚的レイアウトを通じて適応的な情報密度でメモリ空間を割り当てる。
我々は,多種多様な圧縮レベルにエージェントを露出する予算対応目標の下で,強化学習でMemOCRを訓練する。
論文 参考訳(メタデータ) (2026-01-29T09:47:17Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents [33.617262543252494]
本稿では、メモリ履歴全体からの選択的検索を可能にするコールバック強化メモリを備えたメモリ拡張エージェントReMemR1を提案する。
また,RLMLR(Reinforcement Learning with Multi-Level Rewards)を提案する。
論文 参考訳(メタデータ) (2025-09-27T01:36:46Z) - In Prospect and Retrospect: Reflective Memory Management for Long-term Personalized Dialogue Agents [70.12342024019044]
大規模言語モデル(LLM)は、オープンエンド対話において大きな進歩を遂げているが、関連する情報の保持と取得ができないため、その有効性は制限されている。
本稿では,長期対話エージェントのための新しいメカニズムであるリフレクティブメモリ管理(RMM)を提案する。
RMMは、LongMemEvalデータセットのメモリ管理なしでベースラインよりも10%以上精度が向上している。
論文 参考訳(メタデータ) (2025-03-11T04:15:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。