論文の概要: SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
- arxiv url: http://arxiv.org/abs/2607.05943v1
- Date: Tue, 07 Jul 2026 07:43:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.435084
- Title: SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
- Title(参考訳): SearchEyes:サーチワールドシミュレーションによるよりフロンティアなマルチモーダルディープサーチインテリジェンスを目指して
- Authors: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue,
- Abstract要約: 模擬検索世界のバックボーンとして型付き知識グラフを用いたtextbfSearchEyes を提案する。
Wikidata5Mの視覚的知識交差点上の制約付きマルチホップパスをサンプリングするために,textbfPerception-Knowledge Chains (PKC)を提案する。
6つのマルチモーダルな知識集約型ベンチマーク実験により,SearchEyesはオープンソースのマルチモーダル検索エージェントの最先端性能を実現することが示された。
- 参考スコア(独自算出の注目度): 26.8807904319691
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training multimodal search agents to perform multi-hop reasoning remains challenging due to a fundamental structural disconnect: existing pipelines construct training data, search environments, and reward signals independently, causing synthesized structural metadata to be discarded, environments to rely on irreproducible external engines, and RL rewards to remain sparse at the trajectory level. We present \textbf{SearchEyes}, which uses a typed knowledge graph as the backbone of a \emph{simulated search world} that unifies all three components. We propose \textbf{Perception-Knowledge Chains (PKC)} to sample constrained multi-hop paths over the visual-knowledge intersection of Wikidata5M, retaining hop-level entity metadata that simultaneously defines a self-contained search world and step-level reward anchors. We further propose \textbf{Hop-Anchored Policy Optimization (HaPO)}, which reuses these anchors for step-level credit assignment without a separately trained process reward model. Experiments on six multimodal knowledge-intensive benchmarks show that SearchEyes achieves state-of-the-art performance among open-source multimodal search agents, with SearchEyes-27B improving over the strongest open-source baseline by 6.2 points on average.%
- Abstract(参考訳): 既存のパイプラインは、トレーニングデータ、検索環境、報酬信号を独立して構築し、合成された構造メタデータを破棄し、環境は非生産可能な外部エンジンに依存し、RL報酬は軌道レベルでスパースのままである。
入力された知識グラフを,3つのコンポーネントを統一した \emph{simulated search world} のバックボーンとして使用した \textbf{SearchEyes} を提案する。
本稿では,Wikidata5Mの視覚知識交差点上の制約付きマルチホップパスのサンプルとして,自己完結型検索世界とステップレベルの報酬アンカーを同時に定義したホップレベルのエンティティメタデータを保持するために,PKC(textbf{Perception-Knowledge Chains)を提案する。
さらに,個別に訓練されたプロセス報酬モデルを使わずに,ステップレベルのクレジット代入にこれらのアンカーを再利用する,‘textbf{Hop-Anchored Policy Optimization(HaPO)’を提案する。
6つのマルチモーダルな知識集約ベンチマークの実験により、SearchEyesはオープンソースのマルチモーダル検索エージェントの最先端のパフォーマンスを達成し、SearchEyes-27Bは最強のオープンソースベースラインを平均6.2ポイント改善した。
%であった。
関連論文リスト
- OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents [50.79529228477821]
エージェント強化学習を用いたフロンティアマルチモーダルディープサーチエージェントの完全オープンソースレシピであるOpenSearch-VLを紹介した。
まず、ウィキペディアパスのサンプリング、ファジィエンティティの書き換え、ソース・アンカーの視覚的グラウンドリングを通じて、高品質なトレーニングデータを構築するための専用パイプラインをキュレートした。
さらに,テキスト検索,画像検索,OCR,収穫,研削,超解像,視点補正を統一する多様なツール環境を設計する。
論文 参考訳(メタデータ) (2026-05-06T17:50:38Z) - Towards Long-horizon Agentic Multimodal Search [109.0092257657625]
本稿では,LMM-Searcher という,ファイルベースの視覚的表現機構を中心とした新しい多モード深層検索フレームワークを提案する。
エージェントに調整されたフェッチ・イメージ・ツールを装備し、能動的知覚のためのプログレッシブでオンデマンドなビジュアル・ローディング・ストラテジーを実現する。
提案手法は,100ターンの探索地平線へのスケールアップに成功し,オープンソースモデル間の最先端性能を実現した。
論文 参考訳(メタデータ) (2026-04-14T15:40:28Z) - MTA-Agent: An Open Recipe for Multimodal Deep Search Agents [51.180338423927985]
MLLM(Multi-hop large language model)は、視覚的理解において強力な能力を示しているが、複雑な多段階推論において制限されている。
証拠ベースQA合成のためのマルチホップツール拡張エージェント(MTA-Agent)を提案する。
MTA-Agentは、視覚的およびテキストソースから証拠を検索し、検証するためのツールとそのパラメータを自動的に選択する。
論文 参考訳(メタデータ) (2026-04-07T19:01:45Z) - Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs [7.3517692707289415]
本稿では2つの特殊モデルからなるエージェントシステムであるFathom-DeepResearchを紹介する。
ひとつは、ライブWeb検索とターゲットWebページクエリによるエビデンスベースの調査に最適化された、DeepSearchモデルであるFathom-Search-4Bである。
2つ目は、Qwen3-4Bから訓練されたFathom-Synthesizer-4Bである。
論文 参考訳(メタデータ) (2025-09-28T22:58:11Z) - MMSearch-R1: Incentivizing LMMs to Search [49.889749277236376]
MMSearch-R1は,実世界のインターネット環境において,オンデマンドでマルチターン検索が可能な,初のエンドツーエンド強化学習フレームワークである。
本フレームワークは画像検索とテキスト検索の両方を統合し,検索ペナルティによる結果に基づく報酬によって,モデルがいつ,どのように呼び出すかの判断を可能にする。
論文 参考訳(メタデータ) (2025-06-25T17:59:42Z) - SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis [94.33978856270268]
Retrieval-augmented Generation (RAG) システムは複雑なディープ検索シナリオにおいて高度な大規模言語モデル(LLM)を持つ。
既存のアプローチでは、高品質なトレーニングトラジェクトリが欠如し、分散ミスマッチに苦しむ、重要な制限に直面しています。
本稿では,複雑なトレーニングパラダイムではなく,戦略的データエンジニアリングによるギャップを埋めるフレームワークであるSimpleDeepSearcherを紹介する。
論文 参考訳(メタデータ) (2025-05-22T16:05:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。