論文の概要: ConvCue: Complementary Visual Inductive Biases for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.34196v1
- Date: Mon, 28 Sep 2026 03:09:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 23:00:20.970309
- Title: ConvCue: Complementary Visual Inductive Biases for Vision-Language Models
- Title(参考訳): ConvCue:視覚言語モデルのための補足型ビジュアルインダクティブビアーゼ
- Abstract要約: 本稿では,事前学習したVLMのネイティブな視覚表現を,並列凍結したCNNから最終段階の機能で拡張するCONVCUEを紹介する。
学習可能なアダプタは、畳み込みした特徴をネイティブな視覚的特徴次元にマッピングする。
視覚的質問応答,文書およびチャート理解,マルチモーダル推論を対象とする13のマルチモーダルベンチマークのCONVCUEを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern vision-language models (VLMs) achieve strong performance across a broad range of multimodal tasks, yet still struggle with visual questions that require fine-grained discrimination and spatial understanding. These limitations motivate investigating whether supplementary visual representations can improve existing VLMs without replacing their native visual encoders. Pretrained convolutional networks offer a candidate feature source, motivated by their local connectivity and spatial weight sharing. We introduce CONVCUE, which augments the native visual representations of a pretrained VLM with final-stage features from a parallel, frozen pretrained CNN. A learnable adapter maps convolutional features to the native visual feature dimension, while gated cross-attention allows the original visual tokens to retrieve information from the CNN features. The enhanced tokens are passed through the original visual-to-language projector, and the model is adapted through a two-stage training procedure. We evaluate CONVCUE on Qwen3-VL-2B, Qwen3-VL-4B, and LLaVA-OneVision-7B across 13 multimodal benchmarks covering visual question answering, document and chart understanding, and multimodal reasoning. CONVCUE improves average benchmark performance over both the original models and matched two-stage fine-tuning controls on all three backbones. On Qwen3-VL-4B, it improves over the original model on all 13 benchmarks and raises the average score from 75.00 to 78.82 relative to the matched fine-tuning control. These results show that pretrained convolutional representations, when integrated through learned adaptation and fusion, can improve the visual understanding of existing VLMs without replacing their original visual encoders.
- Abstract(参考訳): 現代の視覚言語モデル(VLM)は、幅広いマルチモーダルタスクにおいて強力な性能を達成するが、微粒な識別と空間的理解を必要とする視覚的問題に苦慮している。
これらの制限は、補足的な視覚表現が、ネイティブな視覚エンコーダを置き換えることなく、既存のVLMを改善することができるかどうかを調査する動機となっている。
事前訓練された畳み込みネットワークは、その局所的な接続性と空間的重量共有によって動機付けられた、候補となる特徴源を提供する。
本稿では,事前学習したVLMのネイティブな視覚表現を,並列凍結したCNNから最終段階の機能で拡張するCONVCUEを紹介する。
学習可能なアダプタは、畳み込みした特徴をネイティブな視覚的特徴次元にマッピングする。
拡張トークンは元のビジュアル・ツー・ランゲージ・プロジェクタに渡され、モデルは2段階の訓練手順で適応される。
Qwen3-VL-2B, Qwen3-VL-4B, LLaVA-OneVision-7B における CONVCUE の評価を行った。
CONVCUEはオリジナルのモデルよりも平均ベンチマーク性能を改善し、3つのバックボーンの2段階の微調整制御にマッチする。
Qwen3-VL-4Bでは、13のベンチマークで元のモデルよりも改善され、マッチした微調整制御と比較して平均スコアが75.00から78.82に上昇する。
これらの結果から,学習適応と融合によって統合された事前学習された畳み込み表現は,元の視覚エンコーダを置き換えることなく,既存のVLMの視覚的理解を向上させることができることがわかった。
関連論文リスト
- EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models [39.77362541405281]
EPIC-Benchは、大規模視覚言語モデル(VLM)の基盤ベンチマークである。
実環境におけるVLMの視覚知覚能力を体系的に評価する。
論文 参考訳(メタデータ) (2026-05-16T16:38:51Z) - Visual-ERM: Reward Modeling for Visual Equivalence [59.317480168347664]
Visual Equivalence Reward Model (Visual-ERM)は、細粒度、解釈可能、タスクに依存しないフィードバックを提供するマルチモーダル生成報酬モデルである。
Visual-ERM は Qwen3-VL-8B-Instruct を 8.4 で改善し、テーブルとSVGのパースで一貫したゲインを得る。
VisualCritic-RewardBench(VC-RewardBench)は、構造化された視覚データに対して微細な画像と画像の相違を判定するためのベンチマークである。
論文 参考訳(メタデータ) (2026-03-13T17:58:14Z) - Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection [53.558449071113245]
Vision-Language Models (VLM) は、アライメントされたビジュアルエンコーダを利用して、画像をビジュアルトークンに変換することで、バックボーン大言語モデル (LLM) によるテキストと同じように処理することができる。
視覚言語モデリングの最近の進歩は、すべての符号化されたサブイメージをモデルに供給する画像トリミング技術を導入している。
本稿では,既存のVLMとシームレスに統合し,細粒度処理能力を高める軽量で普遍的なフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-14T18:33:31Z) - Probing Visual Language Priors in VLMs [51.016683265437536]
我々は,意図的に分布外画像を特徴付けるベンチマークであるViLPを紹介した。
ViLPの各質問には、3つの潜在的な答えと3つの対応するイメージが結合される。
本稿では,モデルが新たなVQAデータを生成し,ピクセルレベルおよびセマンティックな汚職を適用して,自己学習のための「良いバッド」画像ペアを生成する自己改善フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-31T17:54:29Z) - Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution [82.38677987249348]
本稿では,従来の視覚処理における既定分解能アプローチを再定義するQwen2-VLシリーズを提案する。
Qwen2-VLでは、さまざまな解像度の画像を異なる数のビジュアルトークンに動的に処理できるNaive Dynamic Resolutionメカニズムが導入されている。
また、Multimodal Rotary Position Embedding (M-RoPE)を統合し、テキスト、画像、ビデオ間で位置情報の効果的な融合を容易にする。
論文 参考訳(メタデータ) (2024-09-18T17:59:32Z) - APoLLo: Unified Adapter and Prompt Learning for Vision Language Models [58.9772868980283]
本稿では,視覚言語モデルに対する適応学習とプロンプト学習を組み合わせた統合マルチモーダルアプローチであるAPoLLoを提案する。
APoLLoは10種類の画像認識データセットに対して、MaPLe(SOTA)よりも6.03%向上している。
論文 参考訳(メタデータ) (2023-12-04T01:42:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。