論文の概要: SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search
- arxiv url: http://arxiv.org/abs/2606.31504v1
- Date: Tue, 30 Jun 2026 11:22:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.192741
- Title: SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search
- Title(参考訳): SimpleSearch-VL:マルチモーダルエージェントディープサーチのためのシンプルなレシピ
- Authors: Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen,
- Abstract要約: マルチモーダルエージェント検索のための,効率的で信頼性が高く,実用的なフレームワークであるSimpleSearch-VLを提案する。
SimpleSearch-VLは、データやツール、補助モデルコンポーネントをスケールするのではなく、エージェント自身の検索と検証プロセスを改善する。
- 参考スコア(独自算出の注目度): 60.29041788383166
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present SimpleSearch-VL, an efficient, reliable, and practical framework for multimodal agentic search. Its core idea is to improve the agent's own search-and-verification process rather than scaling data, tools, or auxiliary model components. For efficiency, Factorized Adaptive Rollout (FAR) improves sampling efficiency by forming more informative training groups while using redundant samples to mitigate long-tail latency and expose hard samples. For reliability, SimpleSearch-VL performs evidence-verified reasoning, explicitly using chain-of-thought verification to assess the relevance of retrieved visual and textual cues to the original context. For practicality, SimpleSearch-VL keeps a lightweight tool interface and performs webpage self-summary within the agent, requiring no additional external dependencies. With only 5K supervised tool-interleaved trajectories and 2K RL data, SimpleSearch-VL improves Qwen3-VL agentic baselines by 15.8 and 16.0 average points for the 8B and 30B-A3B variants, respectively. The SimpleSearch-VL-30B-A3B model further achieves performance competitive with agentic Gemini-3-Pro.
- Abstract(参考訳): マルチモーダルエージェント検索のための,効率的で信頼性が高く,実用的なフレームワークであるSimpleSearch-VLを提案する。
その中核となる考え方は、データやツール、補助モデルコンポーネントをスケールするのではなく、エージェント自身の検索と検証プロセスを改善することである。
FAR(Factized Adaptive Rollout)は、冗長なサンプルを使用して長期遅延を緩和し、ハードサンプルを公開することで、より情報的なトレーニンググループを形成することでサンプリング効率を向上させる。
信頼性のためにSimpleSearch-VLはエビデンスを検証した推論を実行する。
実用面では、SimpleSearch-VLは軽量なツールインターフェースを保持し、エージェント内でWebページのセルフサマリーを実行するため、追加の外部依存関係は不要である。
教師付きツールインターリーブの軌跡と2K RLのデータだけで、SimpleSearch-VLはQwen3-VLのエージェントベースラインを8Bと30B-A3Bのそれぞれ平均点15.8と16.0に改善した。
SimpleSearch-VL-30B-A3BモデルはエージェントのGemini-3-Proと競合するパフォーマンスを実現する。
関連論文リスト
- HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents [6.536862833942476]
視覚的接地と検索を1つのアトミックアクションに融合させる並列マルチモーダル検索エージェントHyperEyesを提案する。
6つのベンチマークで、HyperEyes-30Bは最上位のオープンソースエージェントを9.9%上回り、平均5.3倍のツールコールラウンドを減らした。
論文 参考訳(メタデータ) (2026-05-08T03:16:08Z) - OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents [50.79529228477821]
エージェント強化学習を用いたフロンティアマルチモーダルディープサーチエージェントの完全オープンソースレシピであるOpenSearch-VLを紹介した。
まず、ウィキペディアパスのサンプリング、ファジィエンティティの書き換え、ソース・アンカーの視覚的グラウンドリングを通じて、高品質なトレーニングデータを構築するための専用パイプラインをキュレートした。
さらに,テキスト検索,画像検索,OCR,収穫,研削,超解像,視点補正を統一する多様なツール環境を設計する。
論文 参考訳(メタデータ) (2026-05-06T17:50:38Z) - $S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data [2.003941363902692]
S3-R1 (Synthetic data and stabilized Search R1) は、より高密度な学習信号とデータ中心のアプローチを結合するフレームワークである。
まず、既存の文書から多様なマルチホップ質問を導き出す合成生成とパイプラインを開発する。
次に、この拡張トレーニングセットを、中間探索品質と正解度の両方を評価する報奨構造と組み合わせる。
論文 参考訳(メタデータ) (2026-05-02T05:01:05Z) - AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play [45.02121903138421]
AceSearcherは1つの大きな言語モデル(LLM)をトレーニングし、複雑なクエリを分解するデコンポスタと、検索したコンテキストを統合して回答生成するソルバという2つの役割を交互に行う。
10データセットにわたる3つの推論集約タスクの実験は、AceSearcherが最先端のベースラインを上回り、平均的な正確なマッチング改善を7.6%達成していることを示している。
論文 参考訳(メタデータ) (2025-09-29T02:14:30Z) - MMSearch-R1: Incentivizing LMMs to Search [49.889749277236376]
MMSearch-R1は,実世界のインターネット環境において,オンデマンドでマルチターン検索が可能な,初のエンドツーエンド強化学習フレームワークである。
本フレームワークは画像検索とテキスト検索の両方を統合し,検索ペナルティによる結果に基づく報酬によって,モデルがいつ,どのように呼び出すかの判断を可能にする。
論文 参考訳(メタデータ) (2025-06-25T17:59:42Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search [58.98450205734779]
大規模言語モデル(LLM)エージェントは、多様なドメインにまたがる強力な機能を示している。
既存のエージェントサーチ手法には3つの大きな制限がある。
これらの課題に対処するための包括的なフレームワークを導入します。
論文 参考訳(メタデータ) (2025-06-06T12:07:23Z) - EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models [64.18350535770357]
マルチモーダル推論の効率を高めるために,大規模視覚言語モデルの自動プルーニング手法を提案する。
提案手法では,所望のプルーニングポリシーを探索するために,少数のサンプルのみを活用する。
視覚的質問応答のためのScienceQA, Vizwiz, MM-vet, LLaVA-Benchデータセットについて広範な実験を行った。
論文 参考訳(メタデータ) (2025-03-19T16:07:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。