論文の概要: The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
- arxiv url: http://arxiv.org/abs/2605.01345v2
- Date: Wed, 06 May 2026 08:19:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 15:17:35.733341
- Title: The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
- Title(参考訳): 視覚言語モデルにおける知覚バンド幅ボツネック:シークエンシャルな実験設計によるアクティブビジュアル推論
- Authors: Anjie Liu, Ziqin Gong, Yan Song, Yuxiang Chen, Xiaolong Liu, Hengtong Lu, Kaike Zhang, Chen Wei, Jun Wang,
- Abstract要約: 高解像度の視覚的推論は、意味的推論だけでなく、知覚帯域幅の制限下でのタスク関連エビデンス獲得でもある。
我々はこの過程を逐次ベイズ最適実験設計(S-BOED)として定式化する。
高解像度ベンチマークの実験では、直接およびReActスタイルのベースラインよりも一貫した利得を示している。
- 参考スコア(独自算出の注目度): 15.20939188156227
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual perception in modern Vision-Language Models (VLMs) is constrained by a perceptual bandwidth bottleneck: a broad field of view preserves global context but sacrifices the fine-grained details required for complex reasoning. We argue that high-resolution visual reasoning is therefore not only semantic reasoning but also task-relevant evidence acquisition under limited perceptual bandwidth. Inspired by active vision and information foraging, we formalise this process as sequential Bayesian optimal experimental design (S-BOED), where an agent decides which visual evidence to acquire before answering. Since exact Bayesian inference is intractable in continuous gigapixel spaces, we derive a tractable coverage--resolution objective as a proxy for task-relevant information gain. We instantiate this framework with FOVEA, a training-free procedure that refines VLM crop proposals through evidence-oriented probing. Experiments on high-resolution benchmarks show consistent gains over direct and ReAct-style baselines, with particularly strong improvements in search-dominated remote-sensing settings.
- Abstract(参考訳): 現代の視覚言語モデル(VLM)における視覚的知覚は、知覚的帯域幅のボトルネックによって制約される: 広い視野はグローバルな文脈を保存するが、複雑な推論に必要な細かな詳細を犠牲にする。
したがって、高解像度の視覚的推論は意味論的推論だけでなく、知覚帯域幅に制限されたタスク関連エビデンス獲得でもある。
アクティブな視覚と情報収集にインスパイアされたこのプロセスは、エージェントがどの視覚的証拠を取得するかを決定するためのシーケンシャルなベイズ最適実験設計(S-BOED)として定式化される。
連続したギガピクセル空間では正確なベイズ推定が難解であるため、タスク関連情報ゲインのプロキシとして、抽出可能なカバレッジ解決の目的を導出する。
我々は,この枠組みを,エビデンス指向の探索を通じてVLM作物提案を洗練させる訓練不要の手順であるFOVEAでインスタンス化する。
高解像度ベンチマークの実験では、直接およびReActスタイルのベースラインよりも一貫した利得が示され、特に検索優先のリモートセンシング設定が大幅に改善された。
関連論文リスト
- VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models [74.05545957865228]
視覚言語モデル(VLM)における高解像度画像とビデオフレームの処理による2次計算成長を効果的に緩和する視覚トークンプルーニング法
パレート構成最適化問題として視覚トークンプルーニングを定式化して最適構成を自動的に識別する新しいフレームワークを提案する。
提案手法では, Augmented Lagrangian 法を用いて, 勾配に基づく探索を可能にするために, 連続緩和とストレートスルー推定を用いる。
論文 参考訳(メタデータ) (2026-04-16T16:21:05Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - Function-Space Empirical Bayes Regularisation with Large Vision-Language Model Priors [12.285161219785294]
VLM-FS-EBは、新しい関数空間経験的ベイズ正規化フレームワークである。
提案手法は予測性能を継続的に改善し,信頼性の高い不確実性推定値が得られることを示す。
論文 参考訳(メタデータ) (2026-02-03T05:24:11Z) - Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations [12.366757123129402]
我々は、条件付きガイダンスを固定点反復として再設定する統一的な視点を提案する。
本稿では,早期拡散段階における長期サブプロブレムの解決を優先するForesight Guidance(FSG)を紹介する。
我々の研究は、条件付きガイダンスのための新しい視点を提供し、適応設計の可能性を解き放つ。
論文 参考訳(メタデータ) (2025-10-24T14:39:07Z) - Infusing fine-grained visual knowledge to Vision-Language Models [5.487134463783365]
大規模コントラスト学習による視覚・言語モデル(VLM)の作成
本稿では,VLMの広義マルチモーダル知識の細粒度ドメイン適応と保持の最適バランスを実現するための微調整手法を提案する。
特に微調整時にテキストデータや元のテキストエンコーダを使わずに、視覚的テキストアライメントを維持する。
論文 参考訳(メタデータ) (2025-08-16T19:12:09Z) - Interpretable Reward Modeling with Active Concept Bottlenecks [54.00085739303773]
本稿では,解釈可能な嗜好学習を可能にする報酬モデリングフレームワークであるConcept Bottleneck Reward Models (CB-RM)を紹介する。
不透明報酬関数に依存する標準的なRLHF法とは異なり、CB-RMは報酬予測を人間の解釈可能な概念に分解する。
我々は,最も情報性の高い概念ラベルを動的に取得する能動的学習戦略を定式化する。
論文 参考訳(メタデータ) (2025-07-07T06:26:04Z) - Branch, or Layer? Zeroth-Order Optimization for Continual Learning of Vision-Language Models [44.27801276966812]
本稿では、視覚言語連続学習(VLCL)のためのゼロ次最適化(ZO)の体系的探索を開拓する。
まず,VLCLにおけるNuive full-ZO導入の不適合性について検討した。
我々は、浅層と深層表現の不均一な学習力学を活かして、ZOとFOをネットワーク層にインターリーブする階層最適化パラダイムを開発した。
論文 参考訳(メタデータ) (2025-06-14T08:59:19Z) - Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning [70.57180215148125]
ビジュアルインストラクションチューニングは、大きな言語モデルで視覚世界を理解できるようにすることを目的としている。
既存の手法は、精度と効率の間の難解なトレードオフに悩まされることが多い。
LLaVA-Meteorは,コア情報を妥協することなく,視覚トークンを戦略的に圧縮する手法である。
論文 参考訳(メタデータ) (2025-05-17T10:22:29Z) - LSSInst: Improving Geometric Modeling in LSS-Based BEV Perception with Instance Representation [10.434754671492723]
本稿では,BEVおよびインスタンス表現をタンデムに組み込んだ2段階物体検出器であるLSSInstを提案する。
提案した検出器は、既存のLSSベースのBEVネットワークに柔軟に統合可能な、きめ細かいピクセルレベルの特徴を利用する。
提案するフレームワークは,高性能な一般化能力と性能を備え,ベルやホイッスルを使わずに,現代のLSSベースのBEV認識手法の性能を向上させる。
論文 参考訳(メタデータ) (2024-11-09T13:03:54Z) - Planning with Diffusion for Flexible Behavior Synthesis [125.24438991142573]
我々は、できるだけ多くの軌道最適化パイプラインをモデリング問題に折り畳むことがどう見えるか検討する。
我々の技術的アプローチの核心は、軌道を反復的にデノベーションすることで計画する拡散確率モデルにある。
論文 参考訳(メタデータ) (2022-05-20T07:02:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。