論文の概要: MM-ContextFold: Context Folding for Multimodal Agentic Retrieval
- arxiv url: http://arxiv.org/abs/2609.23121v1
- Date: Sat, 19 Sep 2026 16:45:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.684007
- Title: MM-ContextFold: Context Folding for Multimodal Agentic Retrieval
- Title(参考訳): MM-ContextFold:マルチモーダルエージェント検索のためのコンテキストフォールディング
- Abstract要約: MAR(Multimodal Agentic Retrieval)は、エージェントが外部ツールを反復的に呼び出すことで複雑な情報検索タスクを解決する必要がある。
MM-ContextFoldは、必要に応じてのみ生画像を読み込む、トレーニング不要のフレームワークである。
- 参考スコア(独自算出の注目度): 73.11459588489326
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Agentic Retrieval (MAR) requires agents to solve complex information-seeking tasks by iteratively invoking external tools. Typical frameworks such as ReAct maintain raw multimodal inputs and the accumulating interaction history in a single, ever-growing context, leading to the context explosion problem. While existing methods alleviate this issue by compressing redundant text, effective strategies for managing token-intensive visual content remain largely underexplored. To address this gap, we first conduct a systematic empirical study of approximately 10,000 trajectories. The results show that as visual cues are progressively extracted through external tools and textualized into the context, raw images become increasingly redundant. Continued image retention is associated with higher output entropy and can even degrade task accuracy. Motivated by these findings, we propose MM-ContextFold, a training-free framework that loads raw images only when needed. It maintains a persistent, text-only main context for high-level planning and spawns ephemeral branch contexts for image-dependent subtasks. Within each branch, the agent loads the relevant images, completes the subtask, and folds the result back into the main context as a concise textual summary; the images and branch trace are then discarded. Experiments on seven MAR benchmarks across five backbone models show that MM-ContextFold improves average accuracy by 6.3 percentage points over ReAct while reducing the working context length by 27.5\%.
- Abstract(参考訳): MAR(Multimodal Agentic Retrieval)は、エージェントが外部ツールを反復的に呼び出すことで複雑な情報検索タスクを解決する必要がある。
ReActのような典型的なフレームワークは、生のマルチモーダル入力と、成長を続ける単一のコンテキストにおける相互作用履歴を蓄積し、コンテキストの爆発問題を引き起こす。
既存の方法では冗長テキストを圧縮することでこの問題を緩和するが、トークン集約型ビジュアルコンテンツを管理する効果的な戦略はほとんど探索されていない。
このギャップに対処するため、我々はまず約10,000の軌道の系統的な実験を行った。
その結果、視覚的手がかりが外部ツールを通じて徐々に抽出され、コンテキストにテキスト化されるにつれて、生画像はますます冗長になることがわかった。
連続した画像保持は高い出力エントロピーと関連付けられ、タスクの精度を低下させる。
これらの知見に触発されたMM-ContextFoldは,必要時にのみ生画像を読み込む,トレーニング不要のフレームワークである。
高レベルの計画のための永続的でテキストのみのメインコンテキストを維持し、画像依存サブタスクのための一時的なブランチコンテキストを生成する。
各ブランチ内で、エージェントは関連するイメージをロードし、サブタスクを完了し、その結果を簡潔なテキストの要約としてメインコンテキストに折り返し、イメージとブランチトレースは破棄される。
5つのバックボーンモデルにわたる7つのMARベンチマークの実験では、MM-ContextFoldは、作業コンテキストの長さを27.5\%削減しながら、ReAct上で平均精度を6.3ポイント改善している。
関連論文リスト
- Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment [57.41731607488101]
TIC-Benchは、テキストイメージの手がかりを統合し、深くインターリーブされたコンテキストの中で真実の事実を復元するモデルの能力を評価するように設計されている。
また,10種類のMLLMを評価し,人的専門家と比較してかなりの性能差が認められた。
論文 参考訳(メタデータ) (2026-09-02T13:19:51Z) - WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents [53.426679066400844]
WeAgent-Harnessは、ネイティブテキストビジョンインタラクションと実行時リカバリをサポートするマルチモーダルエージェントハーネスである。
WeAgent-MMSearchは,データ構築,エージェントポストトレーニング,マルチモーダルロールアウトにまたがる統合システムである。
また、150タスクの人間認証ベンチマークであるVisTarget-Benchを紹介します。
論文 参考訳(メタデータ) (2026-08-28T08:28:43Z) - COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts [34.97838652946461]
COHERENCEは、MLLMがインターリーブされたコンテキストにおける微細な画像テキスト対応を回復する能力を評価するために設計されたベンチマークである。
我々は、6種類の誤り解析を行い、インターリーブ画像テキスト理解における失敗の微粒化を可能とした。
論文 参考訳(メタデータ) (2026-04-30T03:59:22Z) - When Vision Meets Texts in Listwise Reranking [1.2691047660244335]
Rank-Nexusは、画像とテキストの両方を組み込んだ検索リスト上で、リストワイズで定性的な再ランクを行うマルチモーダルな画像テキスト文書再ランカである。
私たちはまず、大量のテキストを再ランク付けしたデータを活用して、知識をテキストブランチに抽出する、という、モダリティを個別にトレーニングします。
データが少ない画像に対しては,画像検索ベンチマーク上で,マルチモーダル大言語モデル(MLLM)キャプションから蒸留ペアを構築する。
論文 参考訳(メタデータ) (2026-01-28T13:57:14Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。