論文の概要: OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
- arxiv url: http://arxiv.org/abs/2605.05185v1
- Date: Wed, 06 May 2026 17:50:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.9749
- Title: OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
- Title(参考訳): OpenSearch-VL: よりフロンティアなマルチモーダル検索エージェントのためのオープンレシピ
- Authors: Shuang Chen, Kaituo Feng, Hangting Chen, Wenxuan Huang, Dasen Dai, Quanxin Shou, Yunlong Lin, Xiangyu Yue, Shenghua Gao, Tianyu Pang,
- Abstract要約: エージェント強化学習を用いたフロンティアマルチモーダルディープサーチエージェントの完全オープンソースレシピであるOpenSearch-VLを紹介した。
まず、ウィキペディアパスのサンプリング、ファジィエンティティの書き換え、ソース・アンカーの視覚的グラウンドリングを通じて、高品質なトレーニングデータを構築するための専用パイプラインをキュレートした。
さらに,テキスト検索,画像検索,OCR,収穫,研削,超解像,視点補正を統一する多様なツール環境を設計する。
- 参考スコア(独自算出の注目度): 50.79529228477821
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep search has become a crucial capability for frontier multimodal agents, enabling models to solve complex questions through active search, evidence verification, and multi-step reasoning. Despite rapid progress, top-tier multimodal search agents remain difficult to reproduce, largely due to the absence of open high-quality training data, transparent trajectory synthesis pipelines, or detailed training recipes. To this end, we introduce OpenSearch-VL, a fully open-source recipe for training frontier multimodal deep search agents with agentic reinforcement learning. First, we curated a dedicated pipeline to construct high-quality training data through Wikipedia path sampling, fuzzy entity rewriting, and source-anchor visual grounding, which jointly reduce shortcuts and one-step retrieval collapse. Based on this pipeline, we curate two training datasets, SearchVL-SFT-36k for SFT and SearchVL-RL-8k for RL. Besides, we design a diverse tool environment that unifies text search, image search, OCR, cropping, sharpening, super-resolution, and perspective correction, enabling agents to combine active perception with external knowledge acquisition. Finally, we propose a multi-turn fatal-aware GRPO training algorithm that handles cascading tool failures by masking post-failure tokens while preserving useful pre-failure reasoning through one-sided advantage clamping. Built on this recipe, OpenSearch-VL delivers substantial performance gains, with over 10-point average improvements across seven benchmarks, and achieves results comparable to proprietary commercial models on several tasks. We will release all data, code, and models to support open research on multimodal deep search agents.
- Abstract(参考訳): ディープサーチはフロンティアのマルチモーダルエージェントにとって重要な機能となり、モデルがアクティブサーチ、エビデンス検証、マルチステップ推論を通じて複雑な問題を解くことができるようになった。
急速な進歩にもかかわらず、トップレベルのマルチモーダル検索エージェントは、オープンな高品質なトレーニングデータ、透明な軌道合成パイプライン、詳細なトレーニングレシピがないため、再現が難しいままである。
この目的のために,エージェント強化学習を用いたフロンティアマルチモーダルディープサーチエージェントの完全オープンソースレシピであるOpenSearch-VLを紹介した。
まず、ウィキペディアパスのサンプリング、ファジィエンティティの書き換え、ソースアンカーの視覚的グラウンドティングを通じて高品質なトレーニングデータを構築するための専用パイプラインを作成し、ショートカットとワンステップの検索崩壊を共同で削減した。
このパイプラインに基づいて、SFTのSearchVL-SFT-36kとRLのSearchVL-RL-8kという2つのトレーニングデータセットをキュレートする。
さらに,テキスト検索,画像検索,OCR,収穫,研削,超解像,視点補正などの多様なツール環境を設計し,エージェントがアクティブな知覚と外部知識の獲得を組み合わせられるようにした。
最後に,障害後のトークンをマスキングし,一方のアドバンテージクラッピングによる有用な障害前推論を保ちながら,カスケードツール障害を処理するマルチターン致命的GRPOトレーニングアルゴリズムを提案する。
このレシピに基づいて構築されたOpenSearch-VLは、パフォーマンスが大幅に向上し、7つのベンチマークで平均10ポイント以上の改善が行われ、いくつかのタスクでプロプライエタリな商用モデルに匹敵する結果が得られる。
マルチモーダルディープサーチエージェントのオープンな研究を支援するために、すべてのデータ、コード、モデルをリリースします。
関連論文リスト
- Towards Long-horizon Agentic Multimodal Search [109.0092257657625]
本稿では,LMM-Searcher という,ファイルベースの視覚的表現機構を中心とした新しい多モード深層検索フレームワークを提案する。
エージェントに調整されたフェッチ・イメージ・ツールを装備し、能動的知覚のためのプログレッシブでオンデマンドなビジュアル・ローディング・ストラテジーを実現する。
提案手法は,100ターンの探索地平線へのスケールアップに成功し,オープンソースモデル間の最先端性能を実現した。
論文 参考訳(メタデータ) (2026-04-14T15:40:28Z) - MTA-Agent: An Open Recipe for Multimodal Deep Search Agents [51.180338423927985]
MLLM(Multi-hop large language model)は、視覚的理解において強力な能力を示しているが、複雑な多段階推論において制限されている。
証拠ベースQA合成のためのマルチホップツール拡張エージェント(MTA-Agent)を提案する。
MTA-Agentは、視覚的およびテキストソースから証拠を検索し、検証するためのツールとそのパラメータを自動的に選択する。
論文 参考訳(メタデータ) (2026-04-07T19:01:45Z) - DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL [60.47878242100153]
我々は、ディープサーチエージェントを進化させるためにDeepDiveを提示する。
オープンな知識グラフから複雑で難解な質問を自動的に合成する戦略を提案する。
深層探索によるLLMの長距離推論を強化するために, エンドツーエンドのマルチターン強化学習を適用した。
論文 参考訳(メタデータ) (2025-09-12T17:52:35Z) - MMSearch-R1: Incentivizing LMMs to Search [49.889749277236376]
MMSearch-R1は,実世界のインターネット環境において,オンデマンドでマルチターン検索が可能な,初のエンドツーエンド強化学習フレームワークである。
本フレームワークは画像検索とテキスト検索の両方を統合し,検索ペナルティによる結果に基づく報酬によって,モデルがいつ,どのように呼び出すかの判断を可能にする。
論文 参考訳(メタデータ) (2025-06-25T17:59:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。