論文の概要: ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2608.04010v1
- Date: Tue, 04 Aug 2026 17:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.307537
- Title: ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs
- Title(参考訳): ParVL:マルチモーダルLLMのための並列スケーリングと拡張可能なコンピュータアロケーション
- Authors: Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang,
- Abstract要約: マルチモーダル大言語モデルのための並列ビジョンランゲージ(ParVL)スケーリングフレームワークについて紹介する。
ParVLは、既存のViTとLLMのバックボーンパラメータを複数のビジョンと言語ブランチで再利用することで、並列計算をスケールする。
また,ParVLは,シングルブランチベースラインよりも総合的なマルチモーダル性能を向上することを示す。
- 参考スコア(独自算出の注目度): 48.87461975674182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing scaling strategies for Multimodal Large Language Models (MLLMs) typically expand either model parameters or sequential inference computation, incurring substantial memory or latency overhead. More importantly, most existing methods fail to alter the rigid, fixed computation allocation between the Vision Transformer and the Large Language Model components, limiting task-specific optimization. To address this, we introduce the Parallel Vision-Language (ParVL) scaling framework for MLLMs, which scales parallel computation by reusing the existing ViT and LLM backbone parameters across multiple vision and language branches. This framework raises a central question: given a fixed backbone parameter budget, how should additional shared-backbone computation be allocated between the vision and language modalities? We instantiate each parallel computational stream with branch-specific prefix parameters over a shared backbone, and train the entire model end-to-end via full-parameter supervised fine-tuning on roughly 13B tokens. We systematically study the computation-allocation trade-off between the ViT encoder and LLM decoder. ParVL improves overall multimodal performance over same-recipe single-branch baselines, and the best evaluated vision--language allocation varies across tasks. Code is available at https://github.com/YangYangGirl/ParVL.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)の既存のスケーリング戦略は、モデルパラメータまたはシーケンシャル推論計算を拡張し、かなりのメモリまたは遅延オーバーヘッドを発生させるのが一般的である。
さらに重要なことは、既存のほとんどのメソッドは、Vision TransformerとLarge Language Modelコンポーネント間の厳密で固定された計算割り当てを変更することができず、タスク固有の最適化を制限します。
これを解決するために,MLLMの並列ビジョンランゲージ(ParVL)スケーリングフレームワークを導入し,既存のViTおよびLLMバックボーンパラメータを複数のビジョンと言語ブランチで再利用することで並列計算をスケールする。
このフレームワークは、固定されたバックボーンパラメータの予算を考えると、どのようにビジョンと言語モダリティの間に共有バックボーンの計算を割り当てるべきなのか?
我々は,各並列計算ストリームに分岐固有のプレフィックスパラメータを共有バックボーン上でインスタンス化し,約13Bトークン上で全パラメータを教師付き微調整することで,モデル全体をエンドツーエンドにトレーニングする。
本稿では,ViTエンコーダとLLMデコーダの計算-配置トレードオフを系統的に検討する。
ParVLはシングルブランチベースラインよりも総合的なマルチモーダル性能を向上し、最高の評価された視覚-言語割り当てはタスクによって異なる。
コードはhttps://github.com/YangYangGirl/ParVL.comで入手できる。
関連論文リスト
- Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs [16.64366862436724]
MLLM(Multimodal Large Language Models)は先日,視覚言語タスク間での強力なパフォーマンスを実証した。
大量の入力された視覚トークンと大規模言語モデル(LLM)の重い計算の両方から生じる高い推論コストは、実用的デプロイメントにおける重要な障壁である。
本稿では,視覚トークン数とモデル計算能力を協調的に制御する統合適応型推論フレームワークSmartVLを提案する。
論文 参考訳(メタデータ) (2026-07-22T16:43:27Z) - Towards Large Model Feature Coding [90.89390892560094]
大規模モデル特徴符号化(LaMoFC)のためのベンチマークおよび評価フレームワークを提案する。
まず、機能データセットLaMoFCBenchを構築し、4つのカテゴリと16のシナリオで多様なタスク要件をカバーしました。
次に、実際の応用シナリオに従って代表分割点を指定し、中間的特徴を抽出する。
論文 参考訳(メタデータ) (2026-05-20T13:39:48Z) - OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models [69.2503510410147]
予め訓練されたVLM上に構築した統合自動運転フレームワークを提案する。
トレーニング済みのVLMアテンションは、純粋言語モデリング以上の強い伝達性を示すことを示す。
エンドツーエンドの自動運転ベンチマークの実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-04-20T07:50:00Z) - From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion [91.35078719566472]
VLM(Vision-Language Models)は、粗い非対称接続を使用することで、深刻な視覚的特徴のボトルネックを生み出す。
CLI(Cross-Layer Injection)は,2つのモダリティの間に動的に多対多の橋を架ける,斬新で軽量なフレームワークである。
論文 参考訳(メタデータ) (2026-01-15T18:59:10Z) - Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models [59.21082876068122]
大規模言語モデル(LLM)は、並列データに対して明示的に訓練されることなく、印象的な翻訳能力を実証している。
近年の研究では、トレーニングデータに付随するバイリンガル信号が原因であることが示唆されている。
多言語エンコーダベースおよびエンコーダデコーダ言語モデルの多言語能力を高めるために,並列データの有用性を最大化する様々な手法が提案されている。
論文 参考訳(メタデータ) (2025-06-16T02:21:15Z) - ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning [38.26304604660713]
ADEM-VLは、事前訓練された大規模言語モデルに基づいてモデルをチューニングする効率的な視覚言語手法である。
我々のフレームワークはScienceQAデータセットの平均精度を0.77%上回る。
論文 参考訳(メタデータ) (2024-10-23T11:31:06Z) - LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism [12.521026493432181]
既存の大規模言語モデル(LLM)は、異なるフェーズにおける可変長要求を効率的に提供できない。
本稿では,異なる要求と位相の分散に対応するために,新しい並列性パラダイムである弾性列並列性(ESP)を提案する。
LoongServeは、チャンクプレフィルと比較して最大スループットを最大3.85$times$、プリフィルデコードデアグリゲーションと比較して5.81$times$に改善する。
論文 参考訳(メタデータ) (2024-04-15T07:45:04Z) - HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models [70.25499865569353]
本稿では,プロジェクタとLLMパラメータの適応的チューニングを含むHyperLLaVAと,動的ビジュアルエキスパートと言語エキスパートを紹介する。
MME,MMBench,SEED-Bench,LLaVA-Benchなど,既存のMLLMベンチマークではLLaVAを大きく上回っている。
論文 参考訳(メタデータ) (2024-03-20T09:42:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。