論文の概要: Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2607.20357v1
- Date: Wed, 22 Jul 2026 16:43:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.159244
- Title: Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
- Title(参考訳): マルチモーダルLCMのためのジョイントToken-Compute Adaptation
- Authors: Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji,
- Abstract要約: MLLM(Multimodal Large Language Models)は先日,視覚言語タスク間での強力なパフォーマンスを実証した。
大量の入力された視覚トークンと大規模言語モデル(LLM)の重い計算の両方から生じる高い推論コストは、実用的デプロイメントにおける重要な障壁である。
本稿では,視覚トークン数とモデル計算能力を協調的に制御する統合適応型推論フレームワークSmartVLを提案する。
- 参考スコア(独自算出の注目度): 16.64366862436724
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have recently demonstrated strong performance across vision-language tasks. However, their high inference cost, arising from both the large number of input visual tokens and the heavy computation of the large language model (LLM), remains a key barrier to practical deployment. Recent work attempts to reduce the cost by adaptively optimizing individual dimensions, e.g., pruning redundant visual tokens or skipping LLM layers and heads. Nonetheless, prior approaches typically treat these dimensions independently and overlook a fundamental coupling: the available compute resources must be dynamically allocated across all dimensions based on the input content. To bridge the gap, we propose SmartVL, a unified adaptive inference framework that jointly controls vision token number and model compute capability in response to varying input contents and compute budgets. SmartVL introduces a vision-side token controller that dynamically selects informative visual tokens and an LLM-side compute controller that adaptively adjusts LLM computation. Importantly, these controllers are trained to coordinate with each other so that the overall inference cost satisfies a target budget. To allow this joint scheduling, we connect the controllers using a shared budget encoding and leverage a differentiable latency estimator for end-to-end training. This design enables SmartVL to learn cross-stage allocation strategies that adapt to both input complexity and runtime compute constraints. Experiments across multiple MLLM benchmarks demonstrate that, with joint scheduling, SmartVL consistently outperforms prior adaptive methods and achieves superior accuracy-efficiency Pareto frontiers. Project page: https://www.schaterji.io/publications/2026/jointtokencompute.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は先日,視覚言語タスク間での強力なパフォーマンスを実証した。
しかし、大量の入力された視覚トークンと大規模言語モデル(LLM)の重い計算の両方から生じる高い推論コストは、実用的デプロイメントにおいて重要な障壁である。
最近の作業では、個々の次元を適応的に最適化したり、冗長な視覚トークンをプルーニングしたり、LCM層やヘッドをスキップしたりすることでコストを削減しようとしている。
それにもかかわらず、以前のアプローチは一般的にこれらの次元を独立に扱い、基本的な結合を見落としている:利用可能な計算資源は入力内容に基づいてすべての次元にわたって動的に割り当てられなければならない。
このギャップを埋めるため、様々な入力内容や計算予算に応じて、視覚トークン数とモデル計算能力を協調的に制御する統合適応型推論フレームワークSmartVLを提案する。
SmartVLは、情報的視覚トークンを動的に選択する視覚側トークンコントローラと、LLM計算を適応的に調整するLLM側コンピューティングコントローラを導入している。
重要なことに、これらのコントローラは、全体的な推論コストが目標予算を満たすように、互いに調整するように訓練されている。
この共同スケジューリングを可能にするために、共有予算符号化を用いてコントローラを接続し、エンドツーエンドのトレーニングに微分可能な遅延推定器を活用する。
この設計により、SmartVLは入力複雑性と実行時の計算制約の両方に適応する、段階的アロケーション戦略を学習することができる。
複数のMLLMベンチマークでの実験では、共同スケジューリングによりSmartVLは先行適応手法よりも優れ、精度と効率の優れたParetoフロンティアを実現している。
プロジェクトページ: https://www.schaterji.io/publications/2026/jointtokencompute
関連論文リスト
- Compute Where it Counts: Self Optimizing Language Models [10.058821474955177]
自己回帰復号化のための動的予算配分について検討する。
我々は,教師の指導するエピソードに対して,グループ相対的な政策最適化を用いて政策を訓練する。
私たちの報酬は、言語モデルの品質と、エピソード平均の予算使用を促進するソフトなペナルティとのトレードオフです。
論文 参考訳(メタデータ) (2026-05-11T17:27:15Z) - From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion [91.35078719566472]
VLM(Vision-Language Models)は、粗い非対称接続を使用することで、深刻な視覚的特徴のボトルネックを生み出す。
CLI(Cross-Layer Injection)は,2つのモダリティの間に動的に多対多の橋を架ける,斬新で軽量なフレームワークである。
論文 参考訳(メタデータ) (2026-01-15T18:59:10Z) - Learning to Inference Adaptively for Multimodal Large Language Models [19.510735093226703]
AdaLLaVA(アダプティブ・推論・フレームワーク)を導入し,MLLM内での演算の再構成を学習する。
以上の結果から,AdaLLaVAは入力レイテンシの予算に効果的に準拠し,実行時の精度やレイテンシのトレードオフが変化することがわかった。
論文 参考訳(メタデータ) (2025-03-13T21:39:38Z) - Cost-Optimal Grouped-Query Attention for Long-Context Modeling [45.981681856747365]
Grouped-Query Attention(GQA)は、大規模言語モデルにおける注目層の計算コストを削減するための広く採用されている戦略である。
我々は,文脈長,モデルサイズ,GQA構成,モデル損失の関係を分析する。
コスト最適GQA構成の導出法を提案する。
論文 参考訳(メタデータ) (2025-03-12T17:50:42Z) - Duo-LLM: A Framework for Studying Adaptive Computation in Large Language Models [16.16372459671255]
大規模言語モデル(LLM)は通常、固定された計算予算を使用してトークンによって出力トークンを生成する。
LLMの各フィードフォワードネットワーク層に小さな補助モジュールを統合する新しいフレームワークを提案する。
訓練されたルータがオーラクルと異なる動作をしており、しばしば準最適解が得られることを示す。
論文 参考訳(メタデータ) (2024-10-01T16:10:21Z) - CoMMIT: Coordinated Multimodal Instruction Tuning [90.1532838391285]
マルチモーダル大言語モデル(MLLM)は一般に、バックボーンLLMと非テキスト入力モードの特徴エンコーダ間の協調学習を含む。
本稿では,MLLM命令のチューニングを理論的・経験的両面から解析する。
本稿では,学習のバランスを定量的に測定できるマルチモーダルバランス係数を提案する。
論文 参考訳(メタデータ) (2024-07-29T23:18:55Z) - LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit [55.73370804397226]
鍵圧縮技術である量子化は、大きな言語モデルを圧縮し、加速することにより、これらの要求を効果的に軽減することができる。
本稿では,プラグアンドプレイ圧縮ツールキットであるLLMCについて,量子化の影響を公平かつ体系的に検討する。
この汎用ツールキットによって、我々のベンチマークはキャリブレーションデータ、アルゴリズム(3つの戦略)、データフォーマットの3つの重要な側面をカバーしています。
論文 参考訳(メタデータ) (2024-05-09T11:49:05Z) - Efficient Controllable Multi-Task Architectures [85.76598445904374]
本稿では,共有エンコーダとタスク固有デコーダからなるマルチタスクモデルを提案する。
我々のキーとなる考え方は、タスク固有のデコーダの容量を変化させ、計算コストの総和を制御し、タスクの重要度を制御することである。
これにより、与えられた予算に対してより強力なエンコーダを許可し、計算コストの制御を高め、高品質のスリム化サブアーキテクチャを提供することにより、全体的な精度を向上させる。
論文 参考訳(メタデータ) (2023-08-22T19:09:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。