論文の概要: ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
- arxiv url: http://arxiv.org/abs/2606.27313v2
- Date: Tue, 30 Jun 2026 15:05:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.703084
- Title: ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
- Title(参考訳): ViQ:どんな解像度でもテキスト対応のビジュアル量子化表現
- Authors: Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao,
- Abstract要約: 本稿では,視覚的量子化表現フレームワークViQについて紹介する。
我々のアプローチは、量子化学習をテキスト整列事前学習と特徴分別という2つの段階に構成する。
マルチモーダル・タスクの実験では、ViQは最先端のマルチモーダル・ビジョン・エンコーダに比べて競争性能が高いことを示した。
- 参考スコア(独自算出の注目度): 91.46185855575789
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A unified representation for text and vision is a natural pursuit, as it enables simpler multimodal modeling and more efficient training. However, representing images as discrete signals in the same way as text inevitably introduces severe information loss. Existing work struggles to balance low-level details and high-level semantics in discrete representations: reconstruction-oriented representations often lack semantic information, whereas semantically stronger features typically suffer from severe loss of detail. We present ViQ, a Visual Quantized Representations framework, which is designed to balance semantics and details in discrete representations while supporting inputs at native resolutions, thereby enabling it to serve as a unified and general discrete representation for arbitrary visual inputs. Our approach structures quantization learning into two stages: text-aligned pre-training and feature discretization. With text-aligned pre-training, we enhance the visual encoder semantic-rich supervision from the pretrained language model and enable it to process native-resolution visual inputs. During discretization, we propose a proximal representation learning strategy to progressively compact the feature space, along with a position-aware head-wise quantization mechanism that enables flexible processing of arbitrary resolutions. Extensive experiments on multimodal tasks demonstrate that ViQ achieves competitive performance compared to state-of-the-art multimodal vision encoders with continuous and high-dimensional visual features, while maintaining high precision in low-level reconstruction. We also show that multimodal training with visual quantized representations largely improves efficiency, yielding up to 20\%-70\% acceleration with different base LLMs and training recipes.
- Abstract(参考訳): テキストとビジョンの統一表現は、より単純なマルチモーダルモデリングとより効率的なトレーニングを可能にするため、自然な追求である。
しかし、テキストと同じ方法で画像を離散信号として表現することは、必然的に深刻な情報損失をもたらす。
既存の作業は、離散表現における低レベルの詳細と高レベルのセマンティクスのバランスをとるのに苦労している。
視覚的量子化表現フレームワークであるViQについて述べる。このフレームワークは、ネイティブ解像度での入力をサポートしながら、個別表現のセマンティクスと詳細のバランスを保ちながら、任意の視覚的入力に対する統一的かつ汎用的な離散表現として機能するように設計されている。
我々のアプローチは、量子化学習をテキスト整列事前学習と特徴分別という2つの段階に構成する。
テキスト整列事前学習により、事前訓練された言語モデルから視覚エンコーダのセマンティックリッチな監視を強化し、ネイティブ解像度の視覚入力処理を可能にする。
離散化中、任意の解像度のフレキシブルな処理を可能にする位置認識型頭部量子化機構とともに、特徴空間を段階的にコンパクト化する近似表現学習戦略を提案する。
マルチモーダルタスクの広汎な実験により、ViQは連続的かつ高次元の視覚的特徴を持つ最先端のマルチモーダルビジョンエンコーダと比較して、低レベル再構成における高精度を維持しながら、競争力を発揮することが示された。
また、視覚的量子化表現を用いたマルチモーダルトレーニングは効率を大幅に向上し、異なるベースLLMとトレーニングレシピで最大20\%-70\%の加速が得られることを示した。
関連論文リスト
- Do Vision Language Models Need to Process Image Tokens? [37.581930147059445]
視覚言語モデル(VLM)は、視覚エンコーダと大きな言語モデル(LLM)を統合することで大きな成功を収めた。
画像の持続処理がパフォーマンスに必要か、初期の層から後期層まで有意義に進化するかは、基本的に不明である。
論文 参考訳(メタデータ) (2026-04-10T15:38:00Z) - VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions [51.41587958253802]
視覚情報を捨てることなく推論コストを削減するVISOR(VISion On Request)を導入する。
VISORは画像とテキストトークン間の相互作用をスパースすることで効率を向上する。
実験により、VISORは、最先端の結果を一致または超えながら、計算コストを大幅に削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T17:58:17Z) - VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection [12.835071167163607]
VirProは適応型マルチモーダル事前トレーニングパラダイムであり、様々な弱い教師付き単分子3D検出フレームワークにシームレスに統合することができる。
我々は、さまざまな学習可能なインスタンス条件のプロンプトを生成し、それらをAPB(Adaptive Prompt Bank)に格納する。
論文 参考訳(メタデータ) (2026-03-18T08:23:55Z) - Towards Understanding Multimodal Fine-Tuning: Spatial Features [25.349396112139214]
Vision-Language Models (VLM) は、事前訓練された言語モデルとビジョンエンコーダをペアリングすることで、幅広いタスクにおいて強力なパフォーマンスを達成する。
本稿では,ステージワイドモデル差分法によるVLM適応の最初の力学解析について述べる。
論文 参考訳(メタデータ) (2026-02-06T18:48:18Z) - Multimodal Prompt Alignment for Facial Expression Recognition [24.470095812039286]
MPA-FERは、引き起こされた視覚的特徴の学習プロセスに対して、きめ細かいセマンティックガイダンスを提供する。
我々のフレームワークは、FERベンチマークの3つのベンチマークデータセット上で最先端の手法より優れています。
論文 参考訳(メタデータ) (2025-06-26T05:28:57Z) - Revisit What You See: Disclose Language Prior in Vision Tokens for LVLM Decoding [6.612630497074871]
LVLM(Large Vision-Language Models)は、視覚認識と言語理解を統合することで、マルチモーダルタスクにおける強力なパフォーマンスを実現する。
テキスト生成のガイドとして視覚トークンを参照するトレーニング不要な復号法であるReVisiTを提案する。
論文 参考訳(メタデータ) (2025-06-11T08:46:55Z) - Pre-trained Text-to-Image Diffusion Models Are Versatile Representation Learners for Control [73.6361029556484]
身体的なAIエージェントは、視覚的および言語入力を介して、物理的な世界を詳細に理解する必要がある。
テキストプロンプトから画像を生成するために明示的に最適化された事前学習されたテキスト画像拡散モデルについて検討する。
安定度制御表現により,OVMM上での最先端性能を示す学習ポリシーが実現可能であることを示す。
論文 参考訳(メタデータ) (2024-05-09T15:39:54Z) - SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by
Visual-Textual Contrastive Learning [51.800031281177105]
SignVTCLは、視覚・テキストのコントラスト学習によって強化された連続手話認識フレームワークである。
マルチモーダルデータ(ビデオ、キーポイント、光学フロー)を同時に統合し、統一された視覚バックボーンをトレーニングする。
従来の方法と比較して最先端の結果が得られます。
論文 参考訳(メタデータ) (2024-01-22T11:04:55Z) - Single-Stream Multi-Level Alignment for Vision-Language Pretraining [103.09776737512078]
モーダルを複数のレベルで整列させる単一ストリームモデルを提案する。
対称的相互モダリティ再構築と擬似ラベル付きキーワード予測という2つの新しいタスクを用いてこれを実現する。
我々は、ゼロショット/ファインチューニングされた画像/テキスト検索、参照表現、VQAといった一連の視覚言語タスクにおいて、トップパフォーマンスを示す。
論文 参考訳(メタデータ) (2022-03-27T21:16:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。