論文の概要: Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs
- arxiv url: http://arxiv.org/abs/2608.21134v1
- Date: Fri, 21 Aug 2026 14:10:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.565474
- Title: Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs
- Title(参考訳): Llama-Mobile: VLMの効率的な2.7ビット量子化
- Abstract要約: 本稿では,資源制約のあるハードウェア上での効率的な推論のための視覚言語モデル(VLM)の定量化フレームワークを提案する。
当社のアプローチでは,トレーニングデータの生成にモデル自体を使用する量子化パイプラインを組み合わせることで,トレーニング設定へのアクセスを不要にしています。
Llama 3.2 11B Vision Instruct Modelを8ビットアクティベートした3.7GBに圧縮することで、我々のアプローチを検証する。
- 参考スコア(独自算出の注目度): 2.851131916285667
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Deploying vision-language models (VLMs) on mobile devices is challenging due to their significant memory and compute requirements. We present a framework for quantizing VLMs for efficient inference on resource-constrained hardware. Our approach combines a quantization pipeline that uses the model itself to generate training data and does not require access to the training setup, with a novel 2.7-bit-per-parameter format supporting efficient execution on Arm CPUs. We validate our approach by compressing the Llama 3.2 11B Vision Instruct model to 3.7 GB with 8-bit activations, preserving strong performance on a set of standard visual question answering tasks.
- Abstract(参考訳): モバイルデバイスに視覚言語モデル(VLM)をデプロイすることは、メモリと計算上の重要な要件のために困難である。
本稿では,資源制約のあるハードウェア上での効率的な推論のためのVLMの定量化フレームワークを提案する。
我々のアプローチは、トレーニングデータを生成するためにモデル自体を使用する量子化パイプラインと、Arm CPU上での効率的な実行をサポートする新しい2.7ビット/パラメータフォーマットを組み合わせたものです。
我々は,Llama 3.2 11B Vision Instruct Modelを8ビットアクティベーション付き3.7GBに圧縮し,標準的な視覚的質問応答タスクのセットで高い性能を維持することによって,我々のアプローチを検証する。
関連論文リスト
- LFM2 Technical Report [87.58431408281973]
LFM2は、デバイス上での効率的なデプロイと強力なタスク機能を実現するために設計された、Liquid Foundation Modelsのファミリーである。
LFM2ファミリーは350M-8.3Bパラメータをカバーしており、密度の高いモデル(350M, 700M, 1.2B, 2.6B)と試験用混合物(合計8.3B, 1.5B)を含んでいる。
視覚遅延タスクのためのLFM2-VL,音声のためのLFM2-Audio,検索のためのLFM2-ColBERTを構築した。
論文 参考訳(メタデータ) (2025-11-28T17:56:35Z) - VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment [88.83260031198023]
本稿では,視覚エンコーダを中心とした生成事前学習パイプラインを提案し,VITAL-Series LMMを開発した。
これまでで最大のVQualAトレーニングデータセットである、450万以上の視覚言語(VL)ペアを構築した。
モデルの定量的スコアリング精度を同時に向上するマルチタスクトレーニングワークフローを採用している。
論文 参考訳(メタデータ) (2025-11-22T07:55:21Z) - MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe [68.04078852416248]
MiniCPM-V 4.5は8Bパラメータモデルであり、高効率で高性能に設計されている。
本稿では,モデルアーキテクチャ,データストラテジー,トレーニング手法の3つの改良点を紹介する。
MiniCPM-V 4.5は30B以下のモデル間で最先端の性能を達成する。
論文 参考訳(メタデータ) (2025-09-16T19:41:48Z) - MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs [20.842336447426682]
MindVLは、Ascend NPUでエンドツーエンドに訓練されたマルチモーダルな大規模言語モデルである。
我々は,安定かつ高性能なトレーニングを支援する,高効率なトレーニングフレームワークであるMindSpeed-MLLMを紹介した。
異なるシーケンス長でトレーニングされたチェックポイントから平均的な重み付けが特に有効であることが判明した。
論文 参考訳(メタデータ) (2025-09-15T08:00:31Z) - Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance [4.6432462796838125]
本研究では,視覚言語モデル(VLM)のためのクロスモーダル微分量子化フレームワークと,視覚障害者支援のためのシーン認識ベクトル化メモリマルチエージェントシステムを提案する。
モデル性能を維持しながら、メモリ要求を38GBから16GBに効果的に削減し、異なる処理戦略を実装したモジュラーフレームワークを開発した。
論文 参考訳(メタデータ) (2025-08-25T16:32:32Z) - MiniCPM4: Ultra-Efficient LLMs on End Devices [126.22958722174583]
MiniCPM4は、エンドサイドデバイス向けに明示的に設計された高効率な大規模言語モデル(LLM)である。
この効率性は、モデルアーキテクチャ、トレーニングデータ、トレーニングアルゴリズム、推論システムという4つの重要な側面において、体系的な革新を通じて達成します。
論文 参考訳(メタデータ) (2025-06-09T16:16:50Z) - APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval [41.81696346270799]
現在の大規模言語モデル(LM)は時間レベルのビデオ理解に苦慮している。
bftextAdaptive textbfPivot MLbfVisual information textbfRetrieval (textbfAPVR)は、十分に重要な視覚情報を階層的に検索し保持する、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2025-06-05T12:27:10Z) - TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler [10.92767902813594]
約3.6Bパラメータを持つ軽量で強力なビデオ理解モデルであるTinyLLaVA-Videoを紹介した。
我々の設計の基盤はビデオレベルのグループ再サンプリングであり、ビデオレベルの視覚トークン数を著しく削減し、制御する新しいメカニズムである。
TinyLLaVA-Videoは例外的な効率を示し、8A100-40GのGPUで1日間のトレーニングしか必要としない。
論文 参考訳(メタデータ) (2025-01-26T13:10:12Z) - Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model [51.83436609094658]
本稿では,2次元画像を入力として,MLLMの時空間推論を強化する軽量な手法である粗対応を導入する。
本手法は,映像のフレーム間や異なる視点における主物体の対応性を特定するために,軽量な追跡モデルを用いている。
この単純なトレーニングフリーアプローチは、4つのベンチマークでGPT4-V/Oに一定の利得をもたらすことを実証する。
論文 参考訳(メタデータ) (2024-08-01T17:57:12Z) - QD-BEV : Quantization-aware View-guided Distillation for Multi-view 3D
Object Detection [57.019527599167255]
BEV (bird-eye-view) に基づく多視点3D検出は、最近大幅に改善されている。
本稿では,BEVタスクに量子化を直接適用することで,トレーニングが不安定になり,性能劣化が許容できないことを示す。
QD-BEVにより,新しいビュー誘導蒸留(VGD)の目標が実現され,QAT(量子化対応トレーニング)の安定化が図られ,モデル性能が向上する。
論文 参考訳(メタデータ) (2023-08-21T07:06:49Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。