論文の概要: Efficient Inference of Large Vision Language Models
- arxiv url: http://arxiv.org/abs/2603.27960v1
- Date: Mon, 30 Mar 2026 02:23:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.19521
- Title: Efficient Inference of Large Vision Language Models
- Title(参考訳): 大規模視覚言語モデルの効率的な推論
- Authors: Surendra Pathak,
- Abstract要約: 本稿では,LVLM推論の高速化のための最先端技術について述べる。
既存の最適化フレームワークを4つの主要な側面に分類する系統分類を導入する。
我々は,これらの方法論の限界を批判的に検討し,効率的なマルチモーダルシステムにおける今後の研究方向を示唆する重要なオープン問題を特定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although Large Vision Language Models (LVLMs) have demonstrated impressive multimodal reasoning capabilities, their scalability and deployment are constrained by massive computational requirements. In particular, the massive amount of visual tokens from high-resolution input data aggravates the situation due to the quadratic complexity of attention mechanisms. To address these issues, the research community has developed several optimization frameworks. This paper presents a comprehensive survey of the current state-of-the-art techniques for accelerating LVLM inference. We introduce a systematic taxonomy that categorizes existing optimization frameworks into four primary dimensions: visual token compression, memory management and serving, efficient architectural design, and advanced decoding strategies. Furthermore, we critically examine the limitations of these current methodologies and identify critical open problems to inspire future research directions in efficient multimodal systems.
- Abstract(参考訳): LVLM(Large Vision Language Models)は、マルチモーダル推論機能を示すが、スケーラビリティと展開は膨大な計算要求によって制限されている。
特に、高解像度の入力データから得られる大量の視覚トークンは、注意機構の二次的な複雑さによって状況が悪化する。
これらの問題に対処するため、研究コミュニティはいくつかの最適化フレームワークを開発した。
本稿では,LVLM推論の高速化のための最先端技術について概説する。
既存の最適化フレームワークを,視覚的トークン圧縮,メモリ管理とサービス,効率的なアーキテクチャ設計,高度な復号化戦略の4つに分類する。
さらに、これらの手法の限界を批判的に検討し、効率的なマルチモーダルシステムにおける今後の研究方向性を刺激する重要なオープン問題を特定する。
関連論文リスト
- Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models [78.32948112203228]
ビデオ理解はコンピュータビジョンにおける最も困難なフロンティアである。
近年,映像理解タスクにおいて,映像多時間モデルが顕著に出現している。
Surveyは、ビデオ-LMM能力を向上するための統一的なフレームワークを研究者や実践者に提供することを目的としている。
論文 参考訳(メタデータ) (2025-10-06T17:10:44Z) - A Survey on Inference Optimization Techniques for Mixture of Experts Models [50.40325411764262]
大規模Mixture of Experts(MoE)モデルは、条件計算によるモデル容量と計算効率の向上を提供する。
これらのモデル上で推論をデプロイし実行することは、計算資源、レイテンシ、エネルギー効率において大きな課題を示す。
本調査では,システムスタック全体にわたるMoEモデルの最適化手法について分析する。
論文 参考訳(メタデータ) (2024-12-18T14:11:15Z) - A Survey on Efficient Inference for Large Language Models [25.572035747669275]
大きな言語モデル(LLM)は、様々なタスクにまたがる顕著なパフォーマンスのために、広く注目を集めている。
LLM推論のかなりの計算とメモリ要件は、リソース制約のあるシナリオへの展開に困難をもたらす。
本稿では,LLMの効率的な推論について,既存の文献を包括的に調査する。
論文 参考訳(メタデータ) (2024-04-22T15:53:08Z) - Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems [13.670262880851537]
生成型大規模言語モデル(LLM)が最前線に立ち、データとのインタラクション方法に革命をもたらします。
しかし、これらのモデルをデプロイする際の計算強度とメモリ消費は、効率性の観点から大きな課題を呈している。
本研究は,機械学習システム(MLSys)研究の観点から,効率的なLCM提供手法の必要性について考察する。
論文 参考訳(メタデータ) (2023-12-23T11:57:53Z) - The Efficiency Spectrum of Large Language Models: An Algorithmic Survey [54.19942426544731]
LLM(Large Language Models)の急速な成長は、様々なドメインを変換する原動力となっている。
本稿では,LLMのエンドツーエンドのアルゴリズム開発に不可欠な多面的効率性について検討する。
論文 参考訳(メタデータ) (2023-12-01T16:00:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。