論文の概要: When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents
- arxiv url: http://arxiv.org/abs/2608.29897v2
- Date: Tue, 01 Sep 2026 03:14:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 14:14:25.985412
- Title: When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents
- Title(参考訳): 歴史がマルチモーダルであるとき - 長距離エージェントのコンテキスト管理を再考する
- Authors: Jiaqi Su, Cong Pang, Jiawei Hong, Tiankuo Yao, Zixuan Chen, Xin Lou, Lewei Lu,
- Abstract要約: ロングホライゾンエージェントは、増大する相互作用履歴を境界付けられた作業コンテキストに圧縮するためにコンテキストマネージャを必要とする。
視覚レンダリング(VR)は、表現型コンテキストマネージャとして導入された。
そこで本研究では,メモリ操作を伴わない決定的レンダリングに基づく学習自由コンテキストマネージャVERAを提案する。
- 参考スコア(独自算出の注目度): 33.60688117631484
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon agents need a context manager to compress growing interaction histories into a bounded working context, via passive strategies or active strategies that decide how memory is accessed and reorganized. Meanwhile, prior optical-memory work mainly treats pixels as a dense codec for textualized histories, often presupposing that rendering context into optical memory incurs a significant performance drop relative to text, thus coupling this representation with SFT, self-distillation, or reinforcement learning to close this gap, leaving unresolved (i) how visual rendering performs as a context manager under a fair, controlled comparison, and (ii) whether this carrier offers a native advantage when history is inherently multimodal. In this paper, we formulate context management as a budget-constrained history transformation and introduce Visual Rendering (VR) as a representational context manager. Under a shared harness, policy model, trigger, and task domain, we evaluate VR on four text-centric and three multimodal benchmarks against four baselines (No Compression, Discard-All, Sliding Window, Summarization), finding visual memory is a natural carrier of native visual evidence. Building on this finding, we propose VERA (Visual Evidence-Retaining strategy for long-horizon Agents), a training-free context manager built on deterministic rendering with no exposed memory operations: on text-centric benchmarks it renders textual history as VR does, while on multimodal benchmarks it retains native visual observations instead of translating them into text. Across nearly all benchmarks, VERA cuts cumulative non-cache tokens by 31.5%-63.1% versus No Compression, matches existing managers on text-centric tasks, and achieves the highest accuracy among all baselines on multimodal tasks, supporting a modality-preserving view of long-horizon context management.
- Abstract(参考訳): ロングホライゾンエージェントは、メモリへのアクセスと再編成の方法を決定するパッシブ戦略やアクティブ戦略を通じて、増大するインタラクション履歴を境界付けられた作業コンテキストに圧縮するコンテキストマネージャを必要とする。
一方、以前の光メモリの研究は、主にテキスト化された履歴の密度の高いコーデックとしてピクセルを扱い、しばしば、光メモリのレンダリングコンテキストがテキストに対して顕著なパフォーマンス低下を引き起こすことを前提に、この表現をSFT、自己蒸留、強化学習と結合してこのギャップを埋め、未解決のまま残す。
一 公正で制御された比較において、視覚的レンダリングがコンテキストマネージャとしてどのように機能するか、及び
(ii)歴史が本質的にマルチモーダルである場合に、このキャリアがネイティブな利点を提供するかどうか。
本稿では、予算制約付き履歴変換としてコンテキスト管理を定式化し、表現型コンテキストマネージャとして視覚レンダリング(VR)を導入する。
共有ハーネス,ポリシーモデル,トリガー,タスクドメインの下で,4つのベースライン(No Compression, Discard-All, Sliding Window, Summarization)に対して,4つのテキスト中心および3つのマルチモーダルベンチマークでVRを評価し,視覚的メモリを見つけることは,ネイティブな視覚的証拠の自然な担い手である。
テキスト中心のベンチマークでは、テキスト中心のベンチマークでは、VRと同じようにテキスト履歴を描画する一方で、マルチモーダルのベンチマークでは、テキストに変換するのではなく、ネイティブな視覚的観察を保持する。
ほとんど全てのベンチマークにおいて、VERAは累積的な非キャッシュトークンを31.5%-63.1%削減し、テキスト中心のタスクで既存のマネージャと照合し、マルチモーダルタスクのベースラインの中で最高の精度を達成し、長期水平コンテキスト管理のモダリティ保存ビューをサポートする。
関連論文リスト
- ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL [30.70875568757697]
ロングホライゾンのエージェントタスクは、多ターンインタラクションをまたいだ分散情報を反復的に取得、統合、維持するために大きな言語モデルを必要とする。
近年のプロアクティブなコンテキスト管理手法では、モデルが独自の作業コンテキストを特別なツールで編集できるようになっている。
本稿では,長期エージェント推論のための能動的コンテキスト管理フレームワークであるContextPilotを紹介する。
論文 参考訳(メタデータ) (2026-08-28T16:01:08Z) - MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents [14.296334759650918]
ロングホライゾンエージェントは、経験を再利用するためにメモリに依存しているが、既存のメモリシステムは、エビデンスを固定表現によって直接消費できると仮定している。
MemPrismはタスク条件付きリレーショナルメモリフレームワークで、永続的なエクスペリエンスストレージと意思決定時のワーキングメモリを分離する。
MemPrismは、特にトラジェクトリが長くなり、メモリトークンの消費が減少するにつれて、タスクパフォーマンスを継続的に改善する。
論文 参考訳(メタデータ) (2026-08-07T03:13:43Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Mem-W: Latent Memory-Native GUI Agents [50.87647372904382]
本稿では,メモリをエージェントの連続的コンテキストの一部として扱う,潜在メモリネイティブなGUIエージェントであるMem-Wを紹介する。
4つのWebおよびモバイルナビゲーションベンチマークで、Mem-Wはさまざまなバックボーンとメモリ拡張ベースラインを一貫して改善している。
論文 参考訳(メタデータ) (2026-05-10T04:31:23Z) - OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory [12.240259398680259]
OCR-Memoryは、エージェント体験の高密度表現として視覚的モダリティを活用するメモリフレームワークである。
OCR-Memoryは、Emphlocate-and-transcribeパラダイムを通じて格納されたエクスペリエンスを検索し、視覚アンカーを通じて関連する領域を選択し、対応する動詞のテキストを検索する。
論文 参考訳(メタデータ) (2026-04-29T12:49:30Z) - VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph [42.348770377488094]
VimRAGは、テキスト、画像、ビデオにまたがるマルチモーダル検索拡張推論に適したフレームワークである。
軌道レベルの報酬から段階的妥当性を分離するグラフガイド型ポリシー最適化手法を提案する。
実験により、VimRAGは様々なマルチモーダルRAGベンチマークにおける最先端のパフォーマンスを一貫して達成していることが示された。
論文 参考訳(メタデータ) (2026-02-13T09:05:09Z) - FindingDory: A Benchmark to Evaluate Memory in Embodied Agents [49.18498389833308]
本研究では,Habitatシミュレータに長距離エンボディタスクのための新しいベンチマークを導入する。
このベンチマークは、持続的なエンゲージメントとコンテキスト認識を必要とする60タスクにわたるメモリベースの機能を評価する。
論文 参考訳(メタデータ) (2025-06-18T17:06:28Z) - Story Visualization by Online Text Augmentation with Context Memory [64.86944645907771]
オンラインテキスト拡張による双方向トランスフォーマーフレームワークのための新しいメモリアーキテクチャを提案する。
提案手法は, FID, キャラクタF1, フレーム精度, BLEU-2/3, R精度など, 様々な指標において, 芸術の状態を著しく上回っている。
論文 参考訳(メタデータ) (2023-08-15T05:08:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。