論文の概要: FAVE: Foveated Adaptive Visual Encoding for Efficient Fine-Grained Visual Understanding
- arxiv url: http://arxiv.org/abs/2609.04392v1
- Date: Thu, 03 Sep 2026 18:58:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.799199
- Title: FAVE: Foveated Adaptive Visual Encoding for Efficient Fine-Grained Visual Understanding
- Title(参考訳): FAVE: 高精度な視覚理解のための適応型ビジュアルエンコーディング
- Abstract要約: FAVE(Foveated Adaptive Visual, Foveated Adaptive Visual)は、外部から選択した領域を高精細度で符号化する可変解像度の軽量なViTである。
96ピクセルのネイティブな最大値を持つImageNetオブジェクトでは、FAVEは固定解像度のViTよりもTop-1を9.4ポイント改善している。
16以上のローカルトークンが追加され、FAVEはTextVQAを1.60ポイント改善し、TTFTの3.3倍のスピードアップを達成した。
- 参考スコア(独自算出の注目度): 7.8636382530704365
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-grained visual understanding depends on local detail, yet visual encoders face a trade-off between costly full-image high-resolution processing and compact global encoding that can weaken such evidence. Inspired by human active vision, we separate where to look from what to encode. We focus on the latter and introduce FAVE (Foveated Adaptive Visual Encoding), a lightweight variable-resolution ViT that encodes externally selected regions at high acuity while preserving native geometry. We first isolate this encoding problem using oracle ground-truth crops in a controlled small-object regime. On ImageNet objects with a native maximum side of 96 pixels, FAVE improves Top-1 by 9.4 points over a fixed-resolution ViT on the same crop window with 12.7 times lower FLOPs. Increasing global resolution or backbone capacity does not recover the same operating point. We then integrate FAVE as a complementary local branch in FastVLM. Its local tokens are combined with FastVLM's global visual tokens, while the original global pathway and language model remain frozen. With at most 16 additional local tokens, FAVE improves TextVQA by 1.60 points and achieves a 3.3 times controlled TTFT speedup over SmolVLM2-2.2B. On GQA attribute questions, it improves FastVLM-1.5B by 1.31 points, extending the benefit beyond text while narrowing the gap to FastVLM-7B. Together, these results show that selectively allocating high-acuity local capacity provides an efficient complement to broader global representations and model scaling for fine-grained understanding of small objects, text, and attributes.
- Abstract(参考訳): きめ細かい視覚的理解は局所的な詳細に依存するが、視覚的エンコーダは、コストのかかるフルイメージの高解像度処理と、そのような証拠を弱めるようなコンパクトなグローバル符号化とのトレードオフに直面している。
人間のアクティブなビジョンにインスパイアされた私たちは、どこにエンコードするかを区別します。
FAVE(Foveated Adaptive Visual Encoding, Foveated Adaptive Visual Encoding)は,外部から選択した領域を高能率で符号化し,ネイティブジオメトリを保存した軽量な可変解像度ViTである。
我々はまず,小物体制御系において,オラクルの接地木を用いてこの符号化問題を分離する。
96ピクセルのネイティブな最大値を持つImageNetオブジェクトでは、FAVEは、同じ収穫ウィンドウ上の固定解像度のViTよりもTop-1を9.4ポイント改善し、FLOPは12.7倍低い。
グローバル解像度やバックボーン容量の増加は、同じ操作ポイントを回復しない。
次にFAVEをFastVLMの補完的なローカルブランチとして統合する。
ローカルトークンはFastVLMのグローバルなビジュアルトークンと組み合わせられているが、元のグローバルパスと言語モデルは凍結されている。
16以上のローカルトークンが追加され、FAVEはTextVQAを1.60ポイント改善し、SmolVLM2-2.2Bの3.3倍のTTFTスピードアップを達成した。
GQA属性の質問では、FastVLM-1.5Bを1.31ポイント改善し、FastVLM-7Bにギャップを狭めながらテキストを超えて利益を拡大した。
これらの結果から, 局所的容量を選択的に割り当てることで, より広範にグローバルな表現やモデルスケーリングを補完し, 小さなオブジェクト, テキスト, 属性のきめ細やかな理解を可能にすることが示唆された。
関連論文リスト
- PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference [15.233755808671871]
既存の視覚トークンプルーニング法には2つの基本的な制限がある。
ほとんどのアプローチは、ビジョン後エンコーダのみを動作させ、視覚符号化フェーズのかなりの遅延は、最適化されないままである。
視覚エンコーダと大規模言語モデルの両方を高速化するフレームワークである PACE を提案する。
論文 参考訳(メタデータ) (2026-08-27T14:52:09Z) - VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling [81.92510561363197]
VLZipは、純粋なトランスフォーマー内で高忠実性推論のための視覚的およびテキスト的圧縮を統一するフレームワークである。
また、LongVLBenchというビデオナラティブから派生した、全体論的、物語レベルの推論を要求する新しいベンチマークも紹介する。
論文 参考訳(メタデータ) (2026-08-09T10:31:03Z) - LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs? [7.06721685645839]
LLaVA-UHD v4は,高解像度入力に適した,効率的かつ計算制御可能な視覚符号化方式である。
その結果、下流の性能を犠牲にすることなく、視覚符号化効率を大幅に改善できる可能性が示唆された。
論文 参考訳(メタデータ) (2026-05-09T15:10:26Z) - T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability [10.51971591757392]
T-REN(テキスト整列領域ネットワーク)は、視覚データをテキスト整列領域レベル表現(または領域トークン)のコンパクトなセットにマッピングする効率的なエンコーダである。
T-RENは、凍結したビジョンバックボーン上に追加された軽量ネットワークを通じてこれを達成し、各セマンティック領域内のパッチレベルの表現をリージョントークンにプールし、リージョンレベルのテキストアノテーションと整合させるように訓練する。
論文 参考訳(メタデータ) (2026-04-20T17:57:02Z) - Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models [61.11154533305096]
ビデオ大言語モデル(VLLM)は、強力なビデオ理解を示すが、冗長な視覚トークンによる非効率性に悩まされる。
フレーム内およびフレーム間コンテキスト内でトークン textbfAnchors を詳述する新しい視点を提案する。
提案するAOTは,先行するビデオLLMのショート・ビデオベンチマークとロング・ビデオベンチマークの競合性能を比較検討する。
論文 参考訳(メタデータ) (2026-03-02T03:06:40Z) - LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs [52.24096832965001]
提案するプログレッシブ・ビジュアル・圧縮(PVC)法を中心としたMLLMであるLLaVA-UHD v3を提案する。
PVC法は、視覚変換器(ViT)にシームレスに統合して、効率的なネイティブ解像度符号化を可能にする。
ViT-UHDをベースとしたLLaVA-UHD v3はQwen2-VLとの競合性能も達成し、TTFTを1.9倍削減した。
論文 参考訳(メタデータ) (2025-11-26T08:11:10Z) - LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs [4.478610052538001]
LLaVA-SPは、視覚的表現を高めるために、元の視覚的トークンに6つの空間的視覚的トークンのみを付加する。
LLaVA-SP-CroppingとLLaVA-SP-Poolingは適応的なプールによってグローバルなセマンティクスをキャプチャする。
論文 参考訳(メタデータ) (2025-07-01T07:20:11Z) - VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models [57.2662376527586]
VScanは2段階のビジュアルトークン削減フレームワークである。
1)グローバルスキャンとローカルスキャンを視覚的エンコーディング中にマージすることで,(2)言語モデルの中間層にプルーニングを導入する。
VScanはプリフィルの2.91$times$スピードアップとFLOPの10$times$ダウンを実現し、オリジナルのパフォーマンスの95.4%を維持した。
論文 参考訳(メタデータ) (2025-05-28T17:59:08Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z) - An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models [65.37846460916042]
視覚的トークンに対する注意計算は,LVLMの深い層において極めて非効率であることがわかった。
本稿では,計算効率の最適化を目的とした多用途プラグアンドプレイ方式であるFastVを紹介する。
論文 参考訳(メタデータ) (2024-03-11T14:35:32Z) - Pruning Self-attentions into Convolutional Layers in Single Path [89.55361659622305]
ビジョントランスフォーマー(ViT)は、様々なコンピュータビジョンタスクに対して印象的なパフォーマンスを実現している。
トレーニング済みのViTを効率よく自動圧縮するSPViT(Single-Path Vision Transformer pruning)を提案する。
われわれのSPViTはDeiT-Bで52.0%のFLOPをトリミングできる。
論文 参考訳(メタデータ) (2021-11-23T11:35:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。