論文の概要: Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.21762v2
- Date: Sat, 29 Aug 2026 06:58:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 13:34:07.455622
- Title: Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models
- Title(参考訳): 再び見るための学習:視覚言語モデルにおける自由形クロップルーティングのための損失ギャップスーパービジョン
- Abstract要約: 視覚言語モデル(VLM)は、具体的な理由から多くの詳細中心の質問に失敗する。
より視覚的なトークンをクエリ毎に割り当てることによって、OCRやドキュメントケースが改善されるが、非差別的に費やされ、グローバルなコンテキストに依存するタスクを邪魔する可能性がある。
本稿では,視覚的再読解学習のためのフレームワークであるGapSightを提案する。
- 参考スコア(独自算出の注目度): 9.530053392873178
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) fail many detail-centric questions for a concrete reason: the answer is visible in the image, yet lost after the image is compressed into a low-resolution global view. Allocating more visual tokens to every query improves some OCR and document cases, but it spends computation indiscriminately and can disturb tasks that rely on global context. We propose GapSight, a framework for learning visual re-reading: a VLM first takes a global glance, then selectively returns to a free-form region when the question calls for local evidence. The supervision comes from the target model's own failure signal. Offline, we compare answer loss or multiple-choice option margin under a global-only view and candidate crop-augmented views; crops that improve the target answer become model-specific review labels. A lightweight free-form crop router distills these labels into a one-shot inference policy that predicts whether to review, expected utility, and a continuous crop box from the global state. Across LLaVA-1.5-7B, InternVL2.5-8B, and Qwen2-VL-2B-Instruct, GapSight improves the Base no-zoom baseline on six benchmarks spanning OCR, documents, charts, infographics, VStarBench, and MME-RealWorld-Lite. On InternVL2.5-8B, GapSight raises the six-benchmark average from 52.25 to 64.29, above CropVLM (57.16), ViCrop (55.84), and ZoomRefine (54.43). Mechanism analyses show that the router rescues concrete wrong answers, adapts its action rate by task, and forms a favorable token-performance profile. These results position loss-gap supervision as a practical route to teaching VLMs when and where to look again.
- Abstract(参考訳): 視覚言語モデル(VLM)は、具体的な理由から多くの詳細中心の質問に失敗する: 答えは画像の中に見えますが、画像が低解像度のグローバルビューに圧縮された後に失われます。
よりビジュアルなトークンをクエリ毎に割り当てることによって、OCRやドキュメントケースが改善されるが、計算に無差別に費やし、グローバルなコンテキストに依存するタスクを邪魔する可能性がある。
本稿では,視覚的再読出学習のためのフレームワークであるGapSightを提案する。まず,VLMがグローバルな視線を捉え,質問が局所的な証拠を求めると,選択的に自由形式の領域に戻る。
監視は、ターゲットモデル自身の障害信号から行われる。
オフラインでは、グローバルのみの視点で回答の損失や複数選択の選択肢マージンを比較し、対象の回答を改善する作物は、モデル固有のレビューラベルとなる。
軽量なフリーフォームのキュウリルーターは、これらのラベルを1ショットの推論ポリシーに蒸留し、グローバルステートからのレビュー、期待されたユーティリティ、連続的なクロップボックスを予測します。
LLaVA-1.5-7B、InternVL2.5-8B、Qwen2-VL-2B-Instructでは、GapSightはOCR、ドキュメント、チャート、インフォグラフィック、VStarBench、MME-RealWorld-Liteにまたがる6つのベンチマークでベースノゾムベースラインを改善している。
InternVL2.5-8Bでは、GapSightはCropVLM (57.16)、ViCrop (55.84)、ZoomRefine (54.43)の6ベンチマーク平均を52.25から64.29に引き上げている。
メカニズム解析により、ルータは具体的な間違った回答を回収し、タスクごとにアクションレートを調整し、好ましいトークンパフォーマンスプロファイルを形成する。
これらの結果から, VLMをいつ, どこで見直すかを教えるための実践的ルートとして, 損失ギャップ管理が位置づけられた。
関連論文リスト
- When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning [73.56343820592399]
本稿では,視覚的タスクセマンティックス(VTS, Visualized Task Semantics)について紹介する。
6つのMLLMと4つのベンチマークで、24のモデルとタスクのペアの精度は平均17.8ポイント低下した。
本稿では,質問領域を型付きセマンティクスと整合させ,そのクリーンな表現をマスクビューから復元するプロンプト領域グラウンドを提案する。
論文 参考訳(メタデータ) (2026-08-05T11:46:15Z) - ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making [30.869819258358405]
視覚言語モデル(VLM)は、視覚知覚を急速に進歩させ、画像に依存する現実的なタスクをますますサポートしている。
39のドメインにインスパイアされた視覚世界と29のカテゴリーにわたる390のタスクのベンチマークであるCompleXITYWORLDを紹介する。
論文 参考訳(メタデータ) (2026-08-05T10:05:41Z) - Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization [59.164665622252016]
CMVF(Cross-Modal Visual Feedback)を紹介する。
CMVFは,(1)より強力なVLMが予測やラベルにアクセスせずに各失敗画像を検査する視覚診断段階と,(2)これらの観察結果を再利用可能なタスクレベルの視覚盲点パターンに圧縮する誤り認識集約段階とを包含する。
CMVFは、各目標において最強のベースラインを平均2.4ポイント改善し、各ベンチマークで最大6.5ポイント向上している。
論文 参考訳(メタデータ) (2026-07-27T12:31:58Z) - Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition [0.0]
本研究では、ナイジェリアのナンバープレート認識のための統合ゼロショット学習ソリューションとして、ビジョン・ランゲージ・モデル(VLM)の可能性を探る。
Gemini 2.0 Flash Exp (Google DeepMind), Qwen2.5-VL-7B-Instruct (Alibaba), GPT-4o (OpenAI), Claude 4 Sonnet (Anthropic), Llama 3.2 Vision 90b (Meta)の5つの選択されたVLMを評価した。
キャラクタエラーレート (CER) に基づく結果から,Gemini と Qwen は,難解な画像シナリオにおいて,精度とロバスト性の両方で他のモデルよりも大幅に優れていたことが判明した。
論文 参考訳(メタデータ) (2026-07-02T10:55:24Z) - Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap [6.097306160389619]
ReVisITは、検索した画像とラベルのペアを視覚的思考の単位として扱う、トレインフリーのフレームワークである。
VL-ICL Bench Fast Open MiniImageNetでは、ReVisITのQwen3-VL-30B-A3Bは4ショットで98.5%に達し、約1/2.4のパラメータで、72B LLaVA-VisionOne SOTA (98.7%)と統計的に区別できない。
論文 参考訳(メタデータ) (2026-07-01T08:31:09Z) - Visual-ERM: Reward Modeling for Visual Equivalence [59.317480168347664]
Visual Equivalence Reward Model (Visual-ERM)は、細粒度、解釈可能、タスクに依存しないフィードバックを提供するマルチモーダル生成報酬モデルである。
Visual-ERM は Qwen3-VL-8B-Instruct を 8.4 で改善し、テーブルとSVGのパースで一貫したゲインを得る。
VisualCritic-RewardBench(VC-RewardBench)は、構造化された視覚データに対して微細な画像と画像の相違を判定するためのベンチマークである。
論文 参考訳(メタデータ) (2026-03-13T17:58:14Z) - Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing [76.2602505940467]
既存のモデルは、しばしば視覚的に密集したチャートに苦しむため、データの欠落、修正ミス、幻覚などのエラーにつながる。
複雑なチャートを読む際の精度を確保するために指を視覚アンカーとして使うという人間の戦略に触発され、視覚自己認識(VSR)と呼ばれる新しいパラダイムを提案する。
VSRの中核となる考え方は、モデルがピクセルレベルのローカライゼーション出力を生成し、それらを視覚化し、それらの視覚化を自身にフィードバックし、直感的にその潜在的な視覚的認識エラーを検査し修正できるようにすることである。
論文 参考訳(メタデータ) (2026-02-18T13:40:53Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - GLEAM: Learning to Match and Explain in Cross-View Geo-Localization [66.11208984986813]
CVGL(Cross-View Geo-Localization)は、同じ地理的位置の異なる視点から撮影された画像間の対応を識別することに焦点を当てている。
GLEAM-Cは、UAV画像、ストリートマップ、パノラマ画像、地上写真を含む複数のビューとモダリティを衛星画像のみに合わせる基本CVGLモデルである。
従来のCVGL手法では解釈可能性の欠如に対処するため,クロスビュー対応予測と説明可能な推論を組み合わせたGLEAM-Xを提案する。
論文 参考訳(メタデータ) (2025-09-09T07:14:31Z) - RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness [2.9979091009694088]
現実世界のデプロイメントは、しばしば、最新のオブジェクト認識モデルをドメインシフトに公開し、精度を著しく低下させる。
この劣化を軽減するため、我々はRT-VLM(Re-Thinking Vision Language Model)フレームワークを導入する。
論文 参考訳(メタデータ) (2025-09-01T02:13:00Z) - Benchmark Granularity and Model Robustness for Image-Text Retrieval [44.045767657945895]
データセットの粒度とクエリの摂動が検索性能とロバスト性にどのように影響するかを示す。
よりリッチなキャプションは、特にテキスト・ツー・イメージタスクにおいて、検索を継続的に強化することを示す。
本研究は, モデル頑健性の変化とキャプション粒度と感度摂動のデータセット依存的関係に着目した。
論文 参考訳(メタデータ) (2024-07-21T18:08:44Z) - Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models [59.05769810380928]
Rephrase, Augment and Reason (RepARe) は勾配のないフレームワークで、基礎となる視覚言語モデルを用いて画像に関する詳細な情報を抽出する。
その結果、VQAv2では3.85%(絶対)、A-OKVQAでは6.41%、VizWizでは7.94%の増加が見られた。
論文 参考訳(メタデータ) (2023-10-09T16:57:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。