論文の概要: WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents
- arxiv url: http://arxiv.org/abs/2608.28062v2
- Date: Mon, 31 Aug 2026 01:30:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.389096
- Title: WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents
- Title(参考訳): WeAgent-MMSearch:マルチモーダル検索エージェントのためのネイティブテキストビジョンインタラクション
- Abstract要約: WeAgent-Harnessは、ネイティブテキストビジョンインタラクションと実行時リカバリをサポートするマルチモーダルエージェントハーネスである。
WeAgent-MMSearchは,データ構築,エージェントポストトレーニング,マルチモーダルロールアウトにまたがる統合システムである。
また、150タスクの人間認証ベンチマークであるVisTarget-Benchを紹介します。
- 参考スコア(独自算出の注目度): 53.426679066400844
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal search agents extend parametric knowledge with newly emerging and long-tail evidence from the open web. Yet many existing agentic search environments often expose retrieved evidence only as text and omit tool-returned images from subsequent context, reducing visually grounded trajectories to text-only reasoning. Long-horizon interaction also compounds tool-call, response-length, timeout, and budget failures, which can discard salvageable trajectories, waste rollout computation, and disturb policy updates. To address these issues, we introduce WeAgent-Harness, a multimodal agentic harness that supports native text-vision interaction and runtime recovery. Retrieved images receive persistent disk references, allowing the model to inspect, process, and cite them throughout the trajectory. Based on this harness, we develop WeAgent-MMSearch, an integrated system spanning data construction, agentic post-training, and multimodal rollout. For data construction, a strong MLLM uses WeAgent-Harness to discover, synthesize, and verify MMSearch-style tasks and collect expert trajectories. During post-training, our Failure-Aware GSPO (FA-GSPO) recovers salvageable abnormal rollouts and filters invalid ones to improve bounded multimodal planning and search. We also introduce VisTarget-Bench, a 150-task human-verified benchmark that pairs each question with a held-out target image, distinguishing image-retrieval failures from visual-perception failures. Evaluation on VisTarget-Bench and seven public benchmarks shows that agentic post-training improves the average score by 19.22 points, enabling our model to outperform similarly sized open-source models and rival models with roughly ten times its parameter count.
- Abstract(参考訳): マルチモーダル検索エージェントは、オープンウェブから新たに出現した長い尾の証拠でパラメトリック知識を拡張する。
しかし、既存のエージェント検索環境は、しばしばテキストとしてのみ検索された証拠を公開し、後続の文脈からツールが返却した画像だけを削除し、視覚的に接地された軌跡をテキストのみの推論に還元する。
長い水平相互作用はツールコール、応答長、タイムアウト、予算の失敗を兼ね備えており、救難可能なトラジェクトリ、ムダロールアウト計算、ポリシー更新を破棄することができる。
これらの問題に対処するために,ネイティブテキストビジョンインタラクションと実行時リカバリをサポートするマルチモーダルエージェントハーネスWeAgent-Harnessを紹介する。
取得されたイメージは永続的なディスク参照を受け取り、モデルを検査し、処理し、軌跡全体にわたって引用することができる。
このハーネスに基づいて,データ構築,エージェントポストトレーニング,マルチモーダルロールアウトにまたがる統合システムWeAgent-MMSearchを開発した。
データ構築には、強力なMLLMがWeAgent-Harnessを使用してMMSearchスタイルのタスクを発見し、合成し、検証し、専門家の軌跡を収集する。
トレーニング後,FA-GSPO(Failure-Aware GSPO)は異常なロールアウトを回復し,無効なロールアウトをフィルタし,バウンドマルチモーダル計画と探索を改善する。
また、150タスクの人間認証ベンチマークであるVisTarget-Benchを導入し、各質問をホールドアウトターゲットイメージと組み合わせ、画像検索の失敗と視覚知覚の失敗を区別する。
VisTarget-Benchと7つの公開ベンチマークから,エージェントによるポストトレーニングにより平均スコアが19.22ポイント向上し,同様のサイズのオープンソースモデルや競合モデルの約10倍のパラメータ数で性能が向上することが示された。
関連論文リスト
- WeAgent-MMGenEdit: A Full-Stack Recipe for Multimodal Agentic Image Generation and Editing [51.8784267764917]
WeAgent-MMGenEditはマルチモーダルハーネス、スケーラブルなデータ構築パイプライン、包括的なベンチマーク、エージェントポリシーとイメージバックエンドのためのポストトレーニングメソッドを含むフルスタックのレシピである。
最初にWeAgent-Harnessを紹介した。これは、永続的なエビデンス管理と、検索したマルチモーダルエビデンスを高密度キャリアにまとめる専用の検証と統合ツールである。これを用いて、高速な合成とエージェント軌道収集のためのスケーラブルなパイプラインを開発し、23Kの教師付きトラジェクトリと14.7KのRLタスクを3層検証チェックリストで生成する。
論文 参考訳(メタデータ) (2026-09-04T14:12:03Z) - SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration [77.28003194268977]
SearchOSは、脆弱で暗黙的な検索進捗を明示的で永続的で共有状態に変換するシステムレベルのマルチエージェントフレームワークである。
SOCM上に構築されたSearchOSは、サブエージェントの実行を重複させるパイプライン並列スケジューリングメカニズムを適用している。
SearchOSは評価されたシングルエージェントとマルチエージェントのベースラインの中で、すべてのメトリクスをリードする。
論文 参考訳(メタデータ) (2026-07-16T17:51:23Z) - Towards Long-horizon Agentic Multimodal Search [109.0092257657625]
本稿では,LMM-Searcher という,ファイルベースの視覚的表現機構を中心とした新しい多モード深層検索フレームワークを提案する。
エージェントに調整されたフェッチ・イメージ・ツールを装備し、能動的知覚のためのプログレッシブでオンデマンドなビジュアル・ローディング・ストラテジーを実現する。
提案手法は,100ターンの探索地平線へのスケールアップに成功し,オープンソースモデル間の最先端性能を実現した。
論文 参考訳(メタデータ) (2026-04-14T15:40:28Z) - DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories [52.57197752244638]
本稿では,画像検索を自律探索タスクとして再構成する新しいエージェントパラダイムであるDeepImageSearchを紹介する。
モデルは、暗黙の文脈的手がかりに基づいてターゲットを特定するために、生の視覚履歴に対して多段階の推論を計画し実行しなければならない。
DisBenchは、相互接続された視覚データ上に構築された、挑戦的なベンチマークである。
論文 参考訳(メタデータ) (2026-02-11T12:51:10Z) - ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation [49.01601313084479]
ImAgentは、推論、生成、自己評価を統合するトレーニングフリーの統一マルチモーダルエージェントである。
画像生成と編集タスクの実験は、ImAgentがバックボーンよりも一貫して改善していることを示している。
論文 参考訳(メタデータ) (2025-11-14T17:00:29Z) - MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents [44.63565009665076]
マルチモーダル理解を強制する311タスクのベンチマークであるMMSearch-Plusを紹介する。
標準ブラウジングツールとset-of-mark(SoM)モジュールを備えたモデルに依存しないエージェントフレームワークを提供する。
SoMは、プロファイナンス対応のズーム・アンド・リトリーブを可能にし、マルチステップ推論におけるロバスト性を改善する。
論文 参考訳(メタデータ) (2025-08-29T09:58:27Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。