論文の概要: Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
- arxiv url: http://arxiv.org/abs/2605.18603v1
- Date: Mon, 18 May 2026 16:13:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:50.006023
- Title: Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
- Title(参考訳): Starve to Perceptive: 制限された視覚帯域を持つVLMにおける遅延知覚のテーピング
- Authors: Yuhuan Wu, Cong Wei, Fangzhen Lin, Wenhu Chen, Haozhe Wang,
- Abstract要約: 視覚言語モデル(VLM)は、高解像度の視覚環境において位置決めエージェントとして展開されるため、アクティブな知覚を必要とする。
現在の訓練パラダイムは、それらの出力に依存することなく、そのような操作の表面形式を模倣するモデルを生成する。
Starve to Perceiveという、視覚的な帯域幅を制限するトレーニングパラダイムを紹介します。
- 参考スコア(独自算出の注目度): 48.33329034186283
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) deployed as situated agents in high-resolution visual environments require active perception -- the ability to dynamically decide where to look through operations like zooming, cropping, and panning. However, current training paradigms produce models that mimic the surface form of such operations without functionally depending on their outputs, a phenomenon we term lazy perception. We trace this to a fundamental learning asymmetry: when coarse global views combined with language priors suffice for moderate accuracy, the model has no incentive to learn harder multi-step visual search. If a model can succeed without actively looking, it will never learn to look. This motivates Starve to Perceive, a training paradigm that constrains visual bandwidth -- restricting each observation to a tight token budget so that no single view suffices for task completion, making active perception the only viable strategy. Despite requiring no auxiliary losses, reward shaping, or architectural changes -- serving as a minimal, plug-in modification to standard post-training pipelines -- models trained under perceptual starvation achieve substantial gains of 5% average relative improvement across diverse benchmarks.
- Abstract(参考訳): 高解像度の視覚環境に位置決めエージェントとして配置される視覚言語モデル(VLM)は、アクティブな知覚を必要とする。
しかし、現在の訓練パラダイムは、出力に依存することなく、そのような操作の表面形状を模倣するモデルを作成しており、これは遅延知覚と呼ばれる現象である。
粗いグローバルビューと言語先行ビューを組み合わせることで、適度な精度が得られれば、より複雑な多段階視覚探索を学習するインセンティブは得られない。
積極的に探さずにモデルが成功するなら、見ることは決して学ばないでしょう。
視覚的帯域幅を制限するトレーニングパラダイムであるStarve to Perceiveは、各観察を厳格なトークン予算に制限することで、タスク完了に満足できないようにし、アクティブな認識を唯一の実行可能な戦略とする。補助的損失や報酬形成、アーキテクチャ上の変更は必要とせず、標準的なトレーニング後のパイプラインへのプラグイン修正を最小限にし、知覚的飢餓でトレーニングされたモデルは、さまざまなベンチマークで平均5%の大幅な改善を実現している。
関連論文リスト
- ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Learning to Act Robustly with View-Invariant Latent Actions [8.446887947386559]
視覚に基づくロボットポリシーは、視界不変の視覚表現の必要性を強調し、小さな視点の変化に苦しむことが多い。
本研究では,ビュー不変遅延行動 (VILA) を提案する。これは,物理力学に基づくビュー不変表現を学習するために,トラジェクトリ間で遷移パターンをキャプチャする潜在動作をモデル化する。
シミュレーションと実世界の双方の実験から、VILAベースのポリシーは見当たらない視点に効果的に一般化し、新しいタスクにうまく移行することが示された。
論文 参考訳(メタデータ) (2026-01-06T13:14:01Z) - Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models [63.69856480318313]
AGILEは、対話的なプロセスとしてジグソー解決を定式化し、モデルが環境に徐々に関与できるようにする。
我々は AGILE がジグソータスクの性能を大幅に向上させることを示す。
また、9つの一般的な視覚タスクに対して強力な一般化を示し、平均3.1%の改善を実現した。
論文 参考訳(メタデータ) (2025-10-01T17:58:05Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - Data-efficient Large Vision Models through Sequential Autoregression [58.26179273091461]
限られたデータセットに基づいて,効率的な自己回帰に基づく視覚モデルを構築する。
このモデルは,高レベル・低レベルのセマンティック理解の両方にまたがる視覚的タスクにおいて,その習熟度をいかに達成するかを実証する。
我々の経験的評価は、モデルが様々なタスクに適応する際の機敏さを強調し、パラメータフットプリントの大幅な削減を図った。
論文 参考訳(メタデータ) (2024-02-07T13:41:53Z) - VIBR: Learning View-Invariant Value Functions for Robust Visual Control [3.2307366446033945]
VIBR (View-Invariant Bellman Residuals) は、マルチビュートレーニングと不変予測を組み合わせて、RLベースのビジュモータ制御における分配ギャップを削減する手法である。
視覚摂動の高い複雑なビジュオモータ制御環境において,VIBRは既存の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-06-14T14:37:34Z) - Continual Visual Reinforcement Learning with A Life-Long World Model [55.05017177980985]
視覚力学モデリングのための新しい連続学習手法を提案する。
まず,タスク固有の潜在ダイナミクスを学習する長寿命世界モデルを紹介する。
そして,探索・保守的行動学習手法を用いて,過去の課題に対する価値推定問題に対処する。
論文 参考訳(メタデータ) (2023-03-12T05:08:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。