論文の概要: Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning
- arxiv url: http://arxiv.org/abs/2606.15231v1
- Date: Sat, 13 Jun 2026 10:07:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.140364
- Title: Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning
- Title(参考訳): Visual-Seeker:Active Visual ReasoningによるビジュアルNative Multimodal Agentic Searchを目指して
- Authors: Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan,
- Abstract要約: 能動視覚推論による視覚ネイティブなマルチモーダルディープサーチエージェントであるVisual-Seekerを提案する。
我々のエージェントは精細な視覚的詳細に積極的に参加し、探索過程を通して動的に視覚的証拠を収集する。
実験は、5つの挑戦的マルチモーダル検索ベンチマークにおける最先端のパフォーマンスを示す。
- 参考スコア(独自算出の注目度): 28.70926573516569
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) have demonstrated impressive capabilities in many visual tasks, but they often struggle with factual grounding when confronted with complex, open-world scenarios. While recent multimodal deep search agents attempt to address this issue by utilizing external tools, the visual-native search paradigm remains underexplored. Existing methods primarily rely on simple images with explicit semantics and text-only evidence trajectories, limiting the agent's ability to perform multi-hop, cross-modal reasoning and search. To address these limitations, we propose Visual-Seeker, a visual-native multimodal deep search agent via active visual reasoning. Rather than treating vision as a static input, our agent actively attends to fine-grained visual details, dynamically harvests visual evidence throughout the search process. To unlock its visual-native potential, we design an active visual reasoning data pipeline and synthesize 5K high-quality multimodal trajectories for model training. Extensive experiments demonstrate the state-of-the-art performance across five challenging multimodal search benchmarks, even surpassing several proprietary models, validating robust visual-native reasoning and search in real-world web environments. The code and data can be accessed at: https://github.com/ZhengboZhang/Visual-Seeker.
- Abstract(参考訳): MLLM(Multimodal large language model)は多くの視覚的タスクにおいて印象的な能力を示してきたが、複雑なオープンワールドのシナリオに直面すると、現実的な基盤に悩まされることが多い。
最近のマルチモーダルディープサーチエージェントは、外部ツールを活用してこの問題に対処しようとしているが、ビジュアルネイティブサーチパラダイムはいまだに未検討である。
既存の手法は主に、明示的な意味論とテキストのみのエビデンス軌跡を持つ単純なイメージに依存しており、エージェントがマルチホップ、クロスモーダルな推論と探索を行う能力を制限している。
これらの制約に対処するため,視覚ネイティブなマルチモーダルディープサーチエージェントであるVisual-Seekerを提案する。
視覚を静的な入力として扱うのではなく、エージェントは精細な視覚的詳細に積極的に参加し、探索プロセス全体を通して視覚的証拠を動的に収集する。
その視覚ネイティブなポテンシャルを解放するために、アクティブな視覚推論データパイプラインを設計し、5Kの高品質なマルチモーダル軌道をモデルトレーニングのために合成する。
大規模な実験は、5つの挑戦的なマルチモーダル検索ベンチマークにおける最先端のパフォーマンスを実証し、いくつかのプロプライエタリなモデルを超え、実世界のWeb環境で堅牢なビジュアルネイティブ推論と検索を検証する。
コードとデータは、https://github.com/ZhengboZhang/Visual-Seeker.comでアクセスできる。
関連論文リスト
- POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch [84.73366911912512]
エージェント・シーディング(Agenic Seeding)は,エージェント行動の抽出に必要な前駆体を織り込むための専用フェーズである。
本稿では、最近の対話を高忠実に保ちながら、歴史的コンテキストをレンダリングを介して視覚空間に折り畳みながら、適応的履歴認識圧縮方式であるV-Foldを提案する。
我々は,最新のマルチモーダルエージェントサーチモデルであるPOINTS-Seeker-8Bを開発した。
論文 参考訳(メタデータ) (2026-04-15T16:09:37Z) - Towards Long-horizon Agentic Multimodal Search [109.0092257657625]
本稿では,LMM-Searcher という,ファイルベースの視覚的表現機構を中心とした新しい多モード深層検索フレームワークを提案する。
エージェントに調整されたフェッチ・イメージ・ツールを装備し、能動的知覚のためのプログレッシブでオンデマンドなビジュアル・ローディング・ストラテジーを実現する。
提案手法は,100ターンの探索地平線へのスケールアップに成功し,オープンソースモデル間の最先端性能を実現した。
論文 参考訳(メタデータ) (2026-04-14T15:40:28Z) - VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning [22.27364585438247]
VSearcherは、マルチモーダル検索エージェントで、現実世界のWeb環境での長時間のマルチターンツールの使用を可能にする。
大規模で複雑なマルチモーダルQA質問を生成するために、反復射出データ合成パイプラインを導入する。
次に、SFT-then-RLトレーニングパイプラインを用いて、ベースマルチモーダルモデルを現実世界のWeb環境におけるマルチターンツール呼び出しが可能なエージェントに変換する。
論文 参考訳(メタデータ) (2026-03-03T09:33:22Z) - BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents [30.849897676091327]
マルチモーダル大規模言語モデル(MLLM)は、オープンワールド環境でマルチモーダルWebブラウジングとディープ検索を行う自律エージェントへと進化している。
我々はBrowseComp-$V3$という,300の慎重にキュレートされた,さまざまなドメインにまたがる挑戦的な質問からなる,新しいベンチマークを紹介した。
この結果から,現在のモデル機能と実環境における堅牢なマルチモーダルディープサーチとの根本的なギャップが浮き彫りになった。
論文 参考訳(メタデータ) (2026-02-13T12:25:13Z) - Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models [79.77807330964576]
Vision-DeepResearchシステムは複雑なビジュアルテキストのファクトフィンディングに検索エンジンを使用する。
既存のベンチマークはビジュアル検索中心ではない。
2,000のVQAインスタンスからなるVision-DeepResearchベンチマーク(VDR-Bench)を構築した。
論文 参考訳(メタデータ) (2026-02-02T14:53:11Z) - Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models [87.99592946216137]
Vision-DeepResearchは、数十の推論ステップと数百のエンジンインタラクションをサポートしている。
私たちのVision-DeepResearchは、数十の推論ステップと数百のエンジンインタラクションをサポートします。
論文 参考訳(メタデータ) (2026-01-29T17:58:40Z) - Contextual Object Detection with Multimodal Large Language Models [66.15566719178327]
本稿では,コンテキストオブジェクト検出の新たな研究課題について紹介する。
言語クローゼテスト,視覚キャプション,質問応答の3つの代表的なシナリオについて検討した。
本稿では、視覚的コンテキストのエンドツーエンドの微分可能なモデリングが可能な統合マルチモーダルモデルContextDETを提案する。
論文 参考訳(メタデータ) (2023-05-29T17:50:33Z) - OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models [122.27878464009181]
テキスト関連視覚タスクにおいて, GPT4V や Gemini などの大規模マルチモーダルモデルの包括的評価を行った。
OCRBenchには29のデータセットがあり、最も包括的なOCR評価ベンチマークが利用できる。
論文 参考訳(メタデータ) (2023-05-13T11:28:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。