論文の概要: The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
- arxiv url: http://arxiv.org/abs/2605.01345v3
- Date: Sat, 09 May 2026 06:29:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 19:24:01.132604
- Title: The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
- Title(参考訳): 視覚言語モデルにおける知覚バンド幅ボツネック:シークエンシャルな実験設計によるアクティブビジュアル推論
- Abstract要約: 高解像度の視覚的推論は、意味的推論だけでなく、知覚帯域幅の制限下でのタスク関連エビデンス獲得でもある。
我々はこの過程を逐次ベイズ最適実験設計(S-BOED)として定式化する。
高解像度ベンチマークの実験では、直接およびReActスタイルのベースラインよりも一貫した利得を示している。
- 参考スコア(独自算出の注目度): 15.20939188156227
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual perception in modern Vision-Language Models (VLMs) is constrained by a perceptual bandwidth bottleneck: a broad field of view preserves global context but sacrifices the fine-grained details required for complex reasoning. We argue that high-resolution visual reasoning is therefore not only semantic reasoning but also task-relevant evidence acquisition under limited perceptual bandwidth. Inspired by active vision and information foraging, we formalise this process as sequential Bayesian optimal experimental design (S-BOED), where an agent decides which visual evidence to acquire before answering. Since exact Bayesian inference is intractable in continuous gigapixel spaces, we derive a tractable coverage--resolution objective as a proxy for task-relevant information gain. We instantiate this framework with FOVEA, a training-free procedure that refines VLM crop proposals through evidence-oriented probing. Experiments on high-resolution benchmarks show consistent gains over direct and ReAct-style baselines, with particularly strong improvements in search-dominated remote-sensing settings.
- Abstract(参考訳): 現代の視覚言語モデル(VLM)における視覚的知覚は、知覚的帯域幅のボトルネックによって制約される: 広い視野はグローバルな文脈を保存するが、複雑な推論に必要な細かな詳細を犠牲にする。
したがって、高解像度の視覚的推論は意味論的推論だけでなく、知覚帯域幅に制限されたタスク関連エビデンス獲得でもある。
アクティブな視覚と情報収集にインスパイアされたこのプロセスは、エージェントがどの視覚的証拠を取得するかを決定するためのシーケンシャルなベイズ最適実験設計(S-BOED)として定式化される。
連続したギガピクセル空間では正確なベイズ推定が難解であるため、タスク関連情報ゲインのプロキシとして、抽出可能なカバレッジ解決の目的を導出する。
我々は,この枠組みを,エビデンス指向の探索を通じてVLM作物提案を洗練させる訓練不要の手順であるFOVEAでインスタンス化する。
高解像度ベンチマークの実験では、直接およびReActスタイルのベースラインよりも一貫した利得が示され、特に検索優先のリモートセンシング設定が大幅に改善された。
関連論文リスト
- ViQ: Text-Aligned Visual Quantized Representations at Any Resolution [91.46185855575789]
本稿では,視覚的量子化表現フレームワークViQについて紹介する。
我々のアプローチは、量子化学習をテキスト整列事前学習と特徴分別という2つの段階に構成する。
マルチモーダル・タスクの実験では、ViQは最先端のマルチモーダル・ビジョン・エンコーダに比べて競争性能が高いことを示した。
論文 参考訳(メタデータ) (2026-06-25T17:29:27Z) - CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning [13.024838183478858]
視覚的推論のための視覚的エビデンスのためのCredit Assignment (CAVE)を提案する。
CAVEは3つの相補的推論プロセス信号を介して、アクションレベルでの中間ステップの寄与を評価する。
TRACER-Benchは4つの非局所的かつ意味論的に不確定な推論次元を包含する。
論文 参考訳(メタデータ) (2026-05-13T16:50:24Z) - Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models [74.05545957865228]
視覚言語モデル(VLM)における高解像度画像とビデオフレームの処理による2次計算成長を効果的に緩和する視覚トークンプルーニング法
パレート構成最適化問題として視覚トークンプルーニングを定式化して最適構成を自動的に識別する新しいフレームワークを提案する。
提案手法では, Augmented Lagrangian 法を用いて, 勾配に基づく探索を可能にするために, 連続緩和とストレートスルー推定を用いる。
論文 参考訳(メタデータ) (2026-04-16T16:21:05Z) - Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects [26.144665202231014]
LVLM(Large Vision-Language Models)は、画像やビデオに対する洗練された推論を可能にするが、その推論は視覚トークン支配として知られるシステム的効率障壁によって妨げられる。
提案手法は,符号化,プリフィル,デコードからなる推論ライフサイクルを中心に構築された効率技術に関する系統分類である。
論文 参考訳(メタデータ) (2026-04-07T07:44:11Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - Function-Space Empirical Bayes Regularisation with Large Vision-Language Model Priors [12.285161219785294]
VLM-FS-EBは、新しい関数空間経験的ベイズ正規化フレームワークである。
提案手法は予測性能を継続的に改善し,信頼性の高い不確実性推定値が得られることを示す。
論文 参考訳(メタデータ) (2026-02-03T05:24:11Z) - Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations [12.366757123129402]
我々は、条件付きガイダンスを固定点反復として再設定する統一的な視点を提案する。
本稿では,早期拡散段階における長期サブプロブレムの解決を優先するForesight Guidance(FSG)を紹介する。
我々の研究は、条件付きガイダンスのための新しい視点を提供し、適応設計の可能性を解き放つ。
論文 参考訳(メタデータ) (2025-10-24T14:39:07Z) - Infusing fine-grained visual knowledge to Vision-Language Models [5.487134463783365]
大規模コントラスト学習による視覚・言語モデル(VLM)の作成
本稿では,VLMの広義マルチモーダル知識の細粒度ドメイン適応と保持の最適バランスを実現するための微調整手法を提案する。
特に微調整時にテキストデータや元のテキストエンコーダを使わずに、視覚的テキストアライメントを維持する。
論文 参考訳(メタデータ) (2025-08-16T19:12:09Z) - Interpretable Reward Modeling with Active Concept Bottlenecks [54.00085739303773]
本稿では,解釈可能な嗜好学習を可能にする報酬モデリングフレームワークであるConcept Bottleneck Reward Models (CB-RM)を紹介する。
不透明報酬関数に依存する標準的なRLHF法とは異なり、CB-RMは報酬予測を人間の解釈可能な概念に分解する。
我々は,最も情報性の高い概念ラベルを動的に取得する能動的学習戦略を定式化する。
論文 参考訳(メタデータ) (2025-07-07T06:26:04Z) - Branch, or Layer? Zeroth-Order Optimization for Continual Learning of Vision-Language Models [44.27801276966812]
本稿では、視覚言語連続学習(VLCL)のためのゼロ次最適化(ZO)の体系的探索を開拓する。
まず,VLCLにおけるNuive full-ZO導入の不適合性について検討した。
我々は、浅層と深層表現の不均一な学習力学を活かして、ZOとFOをネットワーク層にインターリーブする階層最適化パラダイムを開発した。
論文 参考訳(メタデータ) (2025-06-14T08:59:19Z) - Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning [70.57180215148125]
ビジュアルインストラクションチューニングは、大きな言語モデルで視覚世界を理解できるようにすることを目的としている。
既存の手法は、精度と効率の間の難解なトレードオフに悩まされることが多い。
LLaVA-Meteorは,コア情報を妥協することなく,視覚トークンを戦略的に圧縮する手法である。
論文 参考訳(メタデータ) (2025-05-17T10:22:29Z) - LSSInst: Improving Geometric Modeling in LSS-Based BEV Perception with Instance Representation [10.434754671492723]
本稿では,BEVおよびインスタンス表現をタンデムに組み込んだ2段階物体検出器であるLSSInstを提案する。
提案した検出器は、既存のLSSベースのBEVネットワークに柔軟に統合可能な、きめ細かいピクセルレベルの特徴を利用する。
提案するフレームワークは,高性能な一般化能力と性能を備え,ベルやホイッスルを使わずに,現代のLSSベースのBEV認識手法の性能を向上させる。
論文 参考訳(メタデータ) (2024-11-09T13:03:54Z) - Towards Robust and Accurate Visual Prompting [11.918195429308035]
本研究では,ロバストモデルから派生した視覚的プロンプトが,一般化性能の低下に悩まされながら,ロバスト性を継承できるかどうかを検討する。
本稿では,PBL(Prompt Boundary Loose)と呼ばれる新しい手法を提案する。
本研究は普遍的であり,提案手法の意義を実証するものである。
論文 参考訳(メタデータ) (2023-11-18T07:00:56Z) - Vision-Enhanced Semantic Entity Recognition in Document Images via
Visually-Asymmetric Consistency Learning [19.28860833813788]
既存のモデルでは、視覚的エンコーダを弱いモード間監視信号で訓練することが一般的である。
そこで本稿では,textbfVisually-textbfAsymmetric cotextbfNsistentextbfCy textbfLearning (textscVancl) アプローチを提案する。
論文 参考訳(メタデータ) (2023-10-23T10:37:22Z) - Planning with Diffusion for Flexible Behavior Synthesis [125.24438991142573]
我々は、できるだけ多くの軌道最適化パイプラインをモデリング問題に折り畳むことがどう見えるか検討する。
我々の技術的アプローチの核心は、軌道を反復的にデノベーションすることで計画する拡散確率モデルにある。
論文 参考訳(メタデータ) (2022-05-20T07:02:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。