論文の概要: Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom
- arxiv url: http://arxiv.org/abs/2609.37002v2
- Date: Wed, 30 Sep 2026 11:24:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.209733
- Title: Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom
- Title(参考訳): ビジュアル並列探索:並列タイル検査と適応ズームによる高分解能画像の探索
- Abstract要約: マルチモーダルモデルでは、質問に答えるために必要な小さな空間的局所的な証拠が得られないので、高解像度の視覚的質問応答は失敗することが多い。
本稿では、まずメインエージェントがグリッド_searchを起動し、疑問条件付きサブエージェントと並行して画像タイルを検査し、それから正確な領域またはマージされた領域でZoom_inを適応的に呼び出す、視覚並列検索フレームワークVPSを紹介する。
5つのベンチマークスプリットと3つのモデルサイズで、VPSは15の同モデル比較のうち14のズームオンリー検索よりも平均精度を向上し、最大8.0ポイントまで向上し、特に小型モデルでは強力な改善がなされている。
- 参考スコア(独自算出の注目度): 44.061643947739604
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-resolution visual question answering often fails because a multimodal model does not acquire the small, spatially localized evidence needed to answer a question. Sequential zooming can recover detail, but it asks the main model to choose a region before obtaining a reliable overview. We introduce VPS, a visual parallel-search framework in which a main agent first invokes grid_search to inspect image tiles in parallel with question-conditioned sub-agents, and then adaptively invokes zoom_in on a precise or merged region. The same interface supports both training-free inference and post-training of the main and sub-agents. Across five benchmark splits and three model sizes, VPS improves mean accuracy over dedicated zoom-only search in 14 of 15 same-model comparisons, with gains up to 8.0 points and especially strong improvements for smaller main models. ZoomBench retains an approximately 3.2-point gain at every tested size. We further develop a supervision pipeline with hint-free verification and a paired role-specific GRPO surrogate for learning the controller and tile-reader roles. SFT improves observed accuracy on all five benchmark splits, including a 4.17-point gain on HR-Bench 4K. Role-specific RL further reshapes search behavior: main-only RL reduces mean tool use from 2.65 to 2.11 with similar pass@1 in an internal four-response evaluation, while external accuracy changes are mixed. Joint training reveals an asymmetry between local evidence reading and global search control. Together, these results support VPS as an effective inference-time scaffold and a trainable decomposition for visual evidence acquisition.
- Abstract(参考訳): マルチモーダルモデルでは、質問に答えるために必要な小さな空間的局所的な証拠が得られないので、高解像度の視覚的質問応答は失敗することが多い。
逐次ズームは詳細を回復するが、信頼性の高い概要を得る前に、メインモデルに領域の選択を依頼する。
本稿では、まずメインエージェントがグリッド_searchを起動し、疑問条件付きサブエージェントと並行して画像タイルを検査し、それから正確な領域またはマージされた領域でZoom_inを適応的に呼び出す、視覚並列検索フレームワークVPSを紹介する。
同じインターフェースは、トレーニング不要の推論とメインエージェントとサブエージェントのポストトレーニングの両方をサポートする。
5つのベンチマークスプリットと3つのモデルサイズで、VPSは15の同モデル比較のうち14のズームオンリー検索よりも平均精度を向上し、最大8.0ポイントまで向上し、特に小型モデルでは強力な改善がなされている。
ZoomBenchはテストされた各サイズで約3.2ポイントのゲインを保持する。
さらに、ヒントのない検証機能を備えた監視パイプラインと、コントローラとタイルリーダーの役割を学習するためのペア化されたロール固有のGRPOサロゲートを開発する。
SFTはHR-Bench 4Kの4.17ポイントゲインを含む5つのベンチマークスプリットの観測精度を改善した。
メインオンリーのRLは平均ツール使用量を2.65から2.11に減らし、内部の4応答評価では同様のpass@1を、外部の精度変化は混合する。
共同トレーニングでは,局所的なエビデンス読解とグローバル検索制御の非対称性が明らかにされている。
これらの結果は、VPSを効果的な推論時足場としてサポートし、視覚的エビデンス獲得のためのトレーニング可能な分解を支援する。
関連論文リスト
- Query-Conditioned Spherical Centroid Aggregation for Multimodal Retrieval [5.4018351446007875]
マルチモーダル検索は、ビデオ、オーディオ、字幕、テキストを統合する。
最近の幾何学的アグリゲータは、すべてのモダリティを対称に扱う。
SCALARはクエリ条件付きアグリゲータで、各利用可能なモダリティに関連性ベースの重みを割り当てる。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search [60.29041788383166]
マルチモーダルエージェント検索のための,効率的で信頼性が高く,実用的なフレームワークであるSimpleSearch-VLを提案する。
SimpleSearch-VLは、データやツール、補助モデルコンポーネントをスケールするのではなく、エージェント自身の検索と検証プロセスを改善する。
論文 参考訳(メタデータ) (2026-06-30T11:22:24Z) - GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery [69.05066425853326]
シンキング・ウィズ・イメージ」パラダイムは、マルチモーダルな大規模言語モデル(MLLM)がズームインツールを使って視覚的なシーンを積極的に探索することを可能にする。
これは超高分解能(UHR)リモートセンシングVQAにおいて必須であり、タスク関連キューは疎小である。
筆者らは,(1)冷間開始型SFTデータセット, UHR-CoZ(UHR-CoZ)を多種多様なズームレジームをカバーするトレーニングフレームワークであるGeoEyes,(2)エージェント強化学習手法であるAdaZoom-GRPOを提案する。
論文 参考訳(メタデータ) (2026-02-15T15:50:55Z) - Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models [58.46663983451155]
PixSearchは、地域レベルの認識と検索強化推論を統合する、エンドツーエンドのLMM(Large Multimodal Model)である。
エンコーディング中、PixSearchは検索をトリガーする検索>トークンを出力し、クエリのモダリティ(テキスト、画像、リージョン)を選択し、ビジュアルクエリとして直接機能するピクセルレベルのマスクを生成する。
エゴセントリックでエンティティ中心のVQAベンチマークでは、PixSearchは事実整合性と一般化を大幅に改善する。
論文 参考訳(メタデータ) (2026-01-27T00:46:08Z) - VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval [56.12310817934239]
クロスモーダルな埋め込みは概念の袋として振る舞うが、ポーズや視点のような構造的な視覚的関係が不足している。
この制限を緩和するT2I検索のための新しいパラダイムであるVisualize-then-Retrieve (VisRet)を提案する。
VisRetは、T2I検索をテキスト間類似性マッチングとして再キャストする、モーダル間の類似性マッチングとベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2025-05-26T17:59:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。