論文の概要: SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.01876v1
- Date: Thu, 02 Jul 2026 08:30:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.746063
- Title: SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models
- Title(参考訳): SAB-LVLM:大規模視覚言語モデルのための意味認識二元化
- Authors: Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu, Zhi Han,
- Abstract要約: LVLM(Large Vision-Language Models)はマルチモーダル理解において顕著な進歩を遂げている。
LVLMはメモリと遅延のオーバーヘッドをかなり発生させ、リソース制約のあるデバイスへの実際のデプロイメントを著しく制限する。
本稿では,ストレージと計算コストを大幅に削減するバイナライズ手法を提案する。
- 参考スコア(独自算出の注目度): 75.75091459417304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models (LVLMs) have achieved remarkable progress in multimodal understanding, yet their enormous parameter scale and cross-modal computation incur substantial memory and latency overhead, severely limiting real-world deployment on resource-constrained devices. Binarization offers an attractive solution by drastically reducing storage and computational costs. However, existing binarization methods neglect the varying importance of weights across different layers and modalities. This causes parameters irrelevant to downstream tasks to be unnecessarily retained, whereas modality-critical weights may not be adequately optimized, resulting in significant performance degradation. To address these challenges, we develop a novel \underline{S}ignificance-\underline{A}ware \underline{B}inarization for \underline{L}arge \underline{V}ision-\underline{L}anguage \underline{M}odels (SAB-LVLM). Specifically, after constructing Hessian matrices for textual and visual inputs, we propose a spatial significance map to distinguish full-precision weights activated under a single modality from those activated across modalities. We then devise a modality-guided integration strategy to obtain the significance-aware binarization map, which measures weight significance across layers and modalities. Subsequently, this binarization map is incorporated into the binarization objective as an error reweighting term, and binarization fitting is performed through an alternating significance-weighted update scheme. Extensive experiments illustrate the superiority of our SAB-LVLM over existing binary PTQ methods under an approximately 1-bit compression constraint. Our code is accessible at https://github.com/LyuQi127/SAB_LVLM.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、マルチモーダル理解において顕著な進歩を遂げているが、その膨大なパラメータスケールとクロスモーダル計算は、かなりのメモリとレイテンシのオーバーヘッドを発生させ、リソース制約のあるデバイスへの現実世界の展開を著しく制限している。
バイナリ化は、ストレージと計算コストを大幅に削減することで、魅力的なソリューションを提供する。
しかし、既存の双項化法は、異なる層とモダリティにわたる重みの様々な重要性を無視している。
これにより、下流のタスクに無関係なパラメータは不要に保持されるが、モダリティクリティカルウェイトは適切に最適化されないため、性能が著しく低下する。
これらの課題に対処するため, 新規な \underline{S}ignificance-\underline{A}ware \underline{B}inarization for \underline{L}arge \underline{V}ision-\underline{L}anguage \underline{M}odels (SAB-LVLM) を開発した。
具体的には、テキスト入力と視覚入力のためのヘッセン行列を構築した後、単一のモーダルの下で活性化される全精度重みとモーダル間で活性化される重みを区別する空間的意味マップを提案する。
そこで我々は,重みとモダリティをまたいだ重みを計測する重み付きバイナライゼーションマップを得るために,モダリティ誘導統合戦略を考案した。
その後、二項化マップを誤差再重み付け項として二項化対象に組み込み、二項化フィッティングを交互に重要な重み付け更新方式により行う。
約1ビットの圧縮制約の下で既存のバイナリPTQ法よりもSAB-LVLMの方が優れていることを示す。
私たちのコードはhttps://github.com/LyuQi127/SAB_LVLMでアクセスできます。
関連論文リスト
- BitNet Text Embeddings [104.29781473344813]
BITEMBEDは,符号化効率とベクトル記憶を両立させるLLMベースのテキスト埋め込みのための極低ビットフレームワークである。
BITEMBEDは、トレーニング済みのLLMバックボーンを3次重み、量子化アクティベーション、軽量な正規化改善を備えたBitNetスタイルの埋め込みエンコーダに変換する。
Qwen3-0.6B と Gemma703-2M を用いた MMTEB (eng) の実験では、BITEMBED は完全精度の教師埋め込み器とほぼ同等であることが示された。
論文 参考訳(メタデータ) (2026-06-24T10:37:01Z) - Beyond Real Weights: Hypercomplex Representations for Stable Quantization [6.708338010963415]
マルチモーダル言語モデル(MLLM)は、高次元視覚特徴を言語表現と整合させるために、大きなパラメータ容量を必要とする。
本稿では,高密度フィードフォワードネットワークブロックを徐々に置き換えることで,これらのモデルを圧縮するプログレッシブリパラメタライゼーション戦略を提案する。
残留スケジュールは、軽量な再構築と知識蒸留の損失と共に、PHMモジュールが訓練中に高密度なモジュールの機能的挙動を継承することを保証する。
論文 参考訳(メタデータ) (2025-12-09T12:10:57Z) - HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models [50.31704374968706]
マルチモーダルな大言語モデル(MLLM)は、視覚的およびテキスト的理解を整合させるための変換的アプローチとして登場した。
それらは通常、多粒度レベルでのクロスモーダルアライメントを達成するために、訓練のために非常に高い計算資源を必要とする。
この非効率性の重要な源は、CLIPやSAMなど、広く採用されている視覚エンコーダであり、多粒度レベルでの言語との整合性が欠如している。
論文 参考訳(メタデータ) (2025-10-23T08:16:44Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - Highly Efficient and Effective LLMs with Multi-Boolean Architectures [5.346271362401715]
大型言語モデル(LLM)の複雑さを軽減するための有望な戦略として、重み二項化が登場した。
既存のアプローチは、単純だが重大なパフォーマンス損失を引き起こす訓練後二項化と、完全精度の潜伏重みに依存し、複雑さと制限効率を追加するトレーニング対応の方法に該当する。
本稿では,マルチカーネルBooleanパラメータでLLMを表現する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-28T19:40:34Z) - STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMs [28.70239743254508]
LLM圧縮のための最初の構造双対化法を1ビット未満の精度で提案する。
バイナライズされたLLMの重みは、性能劣化を伴わずにランダムに反転することができる。
本手法は他の圧縮バイナライズ手法よりも優れた性能を示しながら,メモリ要求を大幅に低減する。
論文 参考訳(メタデータ) (2024-08-03T15:07:44Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。