論文の概要: Towards High-Resolution Visual Perception via Hierarchical Entity Exploration
- arxiv url: http://arxiv.org/abs/2607.00816v1
- Date: Wed, 01 Jul 2026 11:41:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.875886
- Title: Towards High-Resolution Visual Perception via Hierarchical Entity Exploration
- Title(参考訳): 階層型エンティティ探索による高分解能視覚知覚に向けて
- Abstract要約: 階層型エンティティ探索は静的イメージ理解をクエリ誘導エンティティ探索に変換する。
HEEはトレーニング不要でモデルに依存しないフレームワークで、静的画像理解を動的にクエリ誘導されたエンティティ探索に変換する。
- 参考スコア(独自算出の注目度): 36.649153640650496
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-resolution (HR) image perception remains a key challenge in multimodal large language models (MLLMs), as fine-grained details are often lost when the image is processed as a whole. Existing methods either require training to teach models where to look or heuristically divide the image into fixed regions, both of which struggle to generalize in complex HR scenes. In this work, we propose Hierarchical Entity Exploration (HEE), a training-free and model-agnostic framework that transforms static image understanding into dynamic, query-guided entity exploration. HEE first evaluates each region using a dual scoring mechanism to determine whether it already contains sufficient evidence to answer the question. If not, it applies object detection within the most promising region to extract fine-grained entities, clusters them into coherent subregions, and organizes them into a multi-level semantic hierarchy for deeper exploration. When deeper regions still fail to yield confident answers, a confidence-guided backtracking mechanism revisits alternative paths to ensure adaptive perception. Extensive results show that HEE outperforms training-free methods like ZoomEye and RAP in both accuracy and efficiency on two complex HR benchmarks (Visual Probe and HR-Bench), across different MLLMs such as Qwen2.5-VL and LLaVA-OneVision. Moreover, HEE demonstrates generalization on the MME-RealWorld benchmark.
- Abstract(参考訳): 高解像度(HR)画像認識は、画像全体を処理する際に細粒度が失われるため、マルチモーダル大言語モデル(MLLM)において依然として重要な課題である。
既存の手法では、複雑なHRシーンで画像を一般化するのに苦労する固定された領域に画像を見るか、ヒューリスティックに分割するかをモデルに教える訓練が必要である。
本研究では,静的画像理解を動的でクエリ誘導的なエンティティ探索に変換するトレーニングフリーでモデルに依存しないフレームワークである階層型エンティティ探索(HEE)を提案する。
HEEはまず2つのスコアリングメカニズムを使用して各リージョンを評価し、その質問に答える十分な証拠をすでに持っているかどうかを判断する。
もしそうでなければ、オブジェクト検出を最も有望な領域で適用して、きめ細かいエンティティを抽出し、それらを一貫性のあるサブリージョンに集約し、より深い探索のために複数のレベルのセマンティック階層に整理する。
より深い領域が依然として自信のある回答を得られない場合、自信に導かれたバックトラック機構は、適応的な知覚を確保するために代替経路を再考する。
HEEは2つの複雑なHRベンチマーク(Visual ProbeとHR-Bench)において、Qwen2.5-VLやLLaVA-OneVisionのような異なるMLLMに対して、ZoomEyeやRAPのようなトレーニング不要の手法よりも精度と効率が優れていることを示す。
さらに、HEEはMME-RealWorldベンチマークで一般化を実証している。
関連論文リスト
- EgoHieraLoc: A Cortically Inspired Hierarchical Segmentation-Guided Framework for Egocentric Visual Query Localization [9.547789251222838]
ビジュアルクエリローカライゼーション(VQL)は、エゴセントリックなビデオでクエリ対象を検索し、再ローカライズすることを目的としている。
人間の視覚は階層的なプロセスを通じてあいまいさを扱う。
我々は,VQL-2DとVQL-3Dの統一フレームワークである textbfEgoHieraLoc を提案する。
論文 参考訳(メタデータ) (2026-08-10T14:31:01Z) - Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation [71.92541392470103]
MLLM(Multimodal Large Language Models)は、細かな視覚的理解に苦慮している。
地域間自己蒸留フレームワークであるビジョンOPD(Vision On-Policy Distillation)を提案する。
Vision-OPDは同じMLLMから2つの条件ポリシーをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-18T17:57:04Z) - Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs [58.32326205291745]
MLLMは画像トリミングツールを自律的に利用し、質問応答のための関心領域を分析する。
我々は,このモデルが大域的な入力に強く依存していることと,収穫領域の細部への弱い依存を実証する。
監視を必要としない新しい2段階強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-29T03:18:57Z) - Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning [61.753025885751036]
本稿では,3つのタスクにまたがる異種視点を融合する視覚言語モデルの能力を評価するEgo-to-Worldベンチマークを提案する。
我々は,2段階のフレームワークであるCoRLを提案し,チェイン・オブ・ソート(Chain-of-Thought)を教師付き微調整と強化学習を組み合わせた。
我々は、CoRLが、推論と知覚グラウンドのメトリクスの両方において、強力なプロプライエタリおよびオープンソースベースラインを一貫して超越していることを示します。
論文 参考訳(メタデータ) (2026-03-16T04:27:53Z) - TikArt: Aperture-Guided Observation for Fine-Grained Visual Reasoning via Reinforcement Learning [6.656456191281567]
本稿では,関心領域の意思決定プロセスとして視覚言語推論を取り入れた開口誘導エージェントTikArtを紹介する。
TikArtはThink-Aperture-Observeループに従っており、言語生成と2つのアパーチャアクションの交互に行われる。
すべてのアクションの後、モデルは明示的な観察を生成し、局所的な視覚的手がかりを永続的な言語記憶に変換する必要がある。
論文 参考訳(メタデータ) (2026-02-16T05:46:47Z) - DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification [37.61695934257133]
微粒な識別的詳細とグローバルな意味的特徴は、人物の再識別の課題の解決に寄与する。
視覚基礎モデルは局所的なテクスチャのマイニングに優れており、視覚言語モデルは強いグローバルな意味の違いを捉えている。
我々は,textbfDual-textbfRegularized Bidirectional textbfTransformerを用いて,その強みを相乗化するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T06:59:53Z) - Revisiting Multi-Task Visual Representation Learning [52.93947931352643]
本稿では,マルチタスク・ビジュアル事前学習フレームワークであるMTVを紹介する。
我々は、高容量の「エキスパート」モデルを利用して、高密度で構造化された擬似ラベルを大規模に合成する。
以上の結果から,MTV が "Best-of-both-worlds" のパフォーマンスを達成できることが示唆された。
論文 参考訳(メタデータ) (2026-01-20T11:59:19Z) - FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning [62.11389260206383]
textscFineRSは、非常に小さなオブジェクトをセグメント化するための2段階のMLLMベースの強化学習フレームワークである。
textscFineRS-4kは,属性レベルの推論に基づくMLLMの評価と,微妙で小規模なターゲットに対する画素レベルのセグメンテーションのための新しいデータセットである。
論文 参考訳(メタデータ) (2025-10-24T10:14:17Z) - ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning [62.61187785810336]
ImageScopeは、トレーニング不要で3段階のフレームワークで、言語誘導の画像検索タスクを統合する。
最初の段階では,様々な意味的粒度のレベルにまたがって探索意図を合成することにより,フレームワークの堅牢性を向上させる。
第2段階と第3段階において、述語命題を局所的に検証し、一括評価を行うことにより、検索結果を反映する。
論文 参考訳(メタデータ) (2025-03-13T08:43:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。