論文の概要: SigLIP-HD by Fine-to-Coarse Supervision
- arxiv url: http://arxiv.org/abs/2607.09488v1
- Date: Fri, 10 Jul 2026 15:05:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.877228
- Title: SigLIP-HD by Fine-to-Coarse Supervision
- Title(参考訳): ファイン・ツー・コア・スーパービジョンによるSigLIP-HD
- Abstract要約: 画像を大きくすることなく、低コストで微視的知覚を実現する方法を示す。
我々は、このフレームワークを高度なSigLIP 2モデルに基づいて構築する。
大規模なMLLMベンチマークで検証され、ベースラインモデルよりもずっと強力な結果が得られます。
- 参考スコア(独自算出の注目度): 57.114959792871254
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality visual representation is a long-standing pursuit in computer vision. In the context of multimodal LLMs (MLLMs), feeding higher-resolution images can produce more fine-grained visual tokens. However, it introduces additional computational and design complexity, due to multiple forward passes and post-processing of increased tokens. Before simply adopting a higher resolution, have we truly unlocked the model's full perception capability at a standard resolution? Therefore, we study an interesting problem: how to achieve fine visual perception under lower cost without larger images. We present SigLIP-HD in this work. The core is a highly simple fine-to-coarse supervision design. We enforce the coarse feature of a mid-resolution image to mimic the fine-grained feature of its high-resolution version. We build this framework on the advanced SigLIP 2 model. Our final model produces better visual tokens at exactly the same inference budget. It is validated on extensive MLLM benchmarks and consistently delivers stronger results than our baseline model, especially on OCR-related tasks.
- Abstract(参考訳): 高品質な視覚表現は、コンピュータビジョンにおける長年の追求である。
MLLM(Multimodal LLM)の文脈では、高解像度画像の供給により、よりきめ細かい視覚トークンが生成される。
しかし、複数の前方通過と増大したトークンの処理後処理のため、計算と設計の複雑さが増す。
単に高解像度を採用する前に、標準解像度でモデルの完全な認識能力を本当にアンロックしましたか?
そこで本研究では,より低コストで高画質な視覚認識を実現する方法について検討する。
本稿では,SigLIP-HDについて述べる。
コアは極めてシンプルできめ細かな監視設計である。
高解像度画像の細粒度特徴を再現するために、中間解像度画像の粗い特徴を強制する。
我々は、このフレームワークを高度なSigLIP 2モデルに基づいて構築する。
私たちの最終モデルは、全く同じ推論予算でより良いビジュアルトークンを生成します。
大規模なMLLMベンチマークで検証され、特にOCR関連タスクにおいて、ベースラインモデルよりも一貫して強力な結果が得られます。
関連論文リスト
- Top-Down Semantic Refinement for Image Captioning [15.716415599823243]
大きな視覚言語モデル(VLM)は、画像キャプションに固有の矛盾に直面している。
その強力なシングルステップ生成能力は、しばしばミオピックな意思決定プロセスに繋がる。
生成過程をマルコフ決定過程(MDP)としてモデル化したTDSR(Top-Down Semantic Refinement)という新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-25T18:27:00Z) - ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution [71.69364653858447]
既存のMLLM(Multimodal Large Language Models)は、画像入力によって導入された視覚トークンの追加により、推論コストが増大する。
本研究では,異なる数の視覚トークンを用いて,様々な複雑度の画像を表現可能な,新しい学習アルゴリズムであるVisual Consistency Learning (ViCO)を提案する。
実験の結果,モデルの知覚,推論,OCR能力を維持しつつ,視覚トークンの数を最大50%削減できることがわかった。
論文 参考訳(メタデータ) (2025-10-14T17:58:10Z) - VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning [95.89543460132413]
視覚言語モデル(VLM)は、視覚トークンの数を増やすことで性能を改善した。
しかし、現実世界のシナリオの多くは、このような膨大な数の視覚トークンを必要としない。
視覚的トークン圧縮(VisionThink)のための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2025-07-17T17:59:55Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z) - HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models [10.50453920206006]
HiREDは固定トークン予算内で運用するために設計されたトークンドロップ方式である。
既存のトークンドロップ方式に比べて精度と性能が優れている。
論文 参考訳(メタデータ) (2024-08-20T15:34:27Z) - ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models [77.59651787115546]
高解像度のLMM(Large Multimodal Models)は、過度な視覚トークンと二次的な視覚的複雑さの課題に直面する。
本稿では,LMMのビジュアルエンコーダとして,階層的なバックボーンであるConvNeXtを用いるConvLLaVAを提案する。
ConvLLaVAは高解像度画像を情報豊富な視覚特徴に圧縮し、過剰な視覚トークンの発生を効果的に防止する。
論文 参考訳(メタデータ) (2024-05-24T17:34:15Z) - Low-Resolution Self-Attention for Semantic Segmentation [93.30597515880079]
我々は,グローバルコンテキストを計算コストの大幅な削減で捉えるために,低解像度自己認識(LRSA)機構を導入する。
我々のアプローチは、入力画像の解像度に関わらず、固定された低解像度空間における自己注意を計算することである。
本稿では,エンコーダ・デコーダ構造を持つビジョントランスであるLRFormerを構築することで,LRSA手法の有効性を示す。
論文 参考訳(メタデータ) (2023-10-08T06:10:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。