論文の概要: DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models
- arxiv url: http://arxiv.org/abs/2610.08341v1
- Date: Tue, 06 Oct 2026 13:38:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.012128
- Title: DIPrune: Task-Aware Token Pruning with Dual Importance for Efficient Multimodal Language Models
- Title(参考訳): DIPrune: 効率的なマルチモーダル言語モデルのための2つの重要度を考慮したタスク認識型トークンプルーニング
- Abstract要約: DIPruneは階数に基づくフレームワークで、層内静的な特徴塩分と層間動的セマンティックな進化を共同で最適化するために、二重重要性スコアリング機構を使用している。
LLaVAとQwen-VLの実験は、DIPruneが常に最先端の結果を達成することを示した。
- 参考スコア(独自算出の注目度): 33.34887873921607
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent training-free pruning approaches for Multimodal Large Language Models (MLLMs) effectively cut computational overhead by exploiting visual redundancy or text-vision attention. However, they frequently suffer from semantic degradation due to their task-agnostic design or unreliable attention estimates. Based on our empirical analysis, we have found that this issue arises because salient tokens in shallow layers persistently suppress emerging semantic ones through numerical inertia, leading to premature discarding of signals crucial for deep reasoning. To address the aforementioned issue, from the task-oriented aspects, we first reformulate training-free pruning as a minimization of the distortion in the final task loss and derive a tractable, token-wise upper bound to serve as a surrogate objective. Specifically, this formulation inherently reveals a previously neglected inter-layer term that accounts for gradients across layers. Accordingly, for the implementation, we propose DIPrune, a rank-based framework that employs a dual importance scoring mechanism to jointly optimize intra-layer static feature saliency and inter-layer dynamic semantic evolution. Extensive experiments on LLaVA and Qwen-VL demonstrate that DIPrune consistently achieves state-of-the-art results.
- Abstract(参考訳): 近年,Multimodal Large Language Models (MLLM) の学習自由プルーニング手法は,視覚的冗長性やテキストビジョンの注意を生かして,計算オーバーヘッドを効果的に削減している。
しかし、それらはタスクに依存しない設計や信頼できない注意推定のためにしばしば意味の劣化に悩まされる。
実験結果から,浅層層における有意なトークンが数値慣性によって出現するセマンティックなトークンを持続的に抑制し,深い推論に不可欠な信号の早期破棄につながることが判明した。
課題指向の観点からは、まず、最終課題損失における歪みの最小化としてトレーニングフリープルーニングを再構成し、サロゲート目的として機能する、引き込み可能なトークン単位の上界を導出する。
具体的には、この定式化は本質的に、層間の勾配を考慮に入れない、これまで無視されていた層間項を明らかにする。
そこで本実装では,階層内静的特徴量と層間動的セマンティックな進化を協調的に最適化する2重重要なスコアリング機構を用いたランクベースフレームワークであるDIPruneを提案する。
LLaVA と Qwen-VL に関する大規模な実験は、DIPrune が常に最先端の結果を達成することを示した。
関連論文リスト
- Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models [86.02826269126308]
本稿では,局所スナップショット決定から時間軌道モデリング問題へのプルーニングを高める新しいフレームワークであるTrend-Aware Pruningを提案する。
これにより、"ラトブルーミング"トークンを選択的に再活性化する動的修正機構が実現される。
論文 参考訳(メタデータ) (2026-07-30T15:07:00Z) - Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction [42.23525789989544]
MLLM(Multimodal Large Language Models)において、しばしば注意がモデルによって引き起こされる。
我々は,タスク条件付き注意をモデル誘発前と区別するために,事前補正トークン削減(PriorTR)を提案する。
PriorTRは、強いトレーニングのないベースラインよりも精度と効率のトレードオフを一貫して改善する。
論文 参考訳(メタデータ) (2026-06-23T05:24:50Z) - A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning [49.61652671596548]
「多像幻覚推論」では、前頭と時頭クエリ間の大規模なパフォーマンス低下は、真に理解するのではなく、表面的なショートカットへの依存を示す。
これを軽減するために、我々は、チェーンステップへの詳細な推論と決定的な判断に基づく、時間的連鎖構築という新しいデータセットを開発する。
実験により,本手法は精度を向上するだけでなく,70%以上から6.53%まで,前向きのパフォーマンスギャップも改善することが示された。
論文 参考訳(メタデータ) (2026-04-12T07:48:44Z) - Efficient Token Pruning for LLaDA-V [5.790228283932133]
LLaDA-Vのような拡散に基づく大規模マルチモーダルモデルは、視覚言語理解と生成において印象的な能力を示した。
我々は,自己回帰デコーダと異なり,LLaDA-Vは主に中間層から後期層に横断的な情報を集約する。
この観測により,我々はFastVに触発された構造化トークンプルーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-01-28T02:03:03Z) - Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training [76.12556589212666]
学習後のカリキュラムは指数関数的複雑性のボトルネックを回避していることを示す。
結果のみの報酬信号の下では、強化学習の微調整は、サンプルの複雑さを高い精度で達成する。
カリキュラムを意識したクエリにより、報奨託書の呼び出しとサンプリングコストの両方を指数関数的に削減するテストタイムスケーリングの保証を確立する。
論文 参考訳(メタデータ) (2025-11-10T18:29:54Z) - FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution [3.4666771782038652]
大規模言語モデル(LLM)は、その恒星の性能の大部分を入力コンテキストの拡大に負っているが、そのような冗長性は金銭的コスト、炭素フットプリント、推論時間の遅延を膨らませている。
本稿では,LLMのための新しいプロンプト圧縮フレームワークであるFrugalPromptを紹介する。
我々は,4つのNLPタスク(感性分析,コモンセンスQA,要約,数学的推論)にまたがるアプローチを評価する。
論文 参考訳(メタデータ) (2025-10-18T10:22:13Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Synergies between Disentanglement and Sparsity: Generalization and
Identifiability in Multi-Task Learning [79.83792914684985]
我々は,最大スパース基底予測器が不整合表現をもたらす条件を提供する新しい識別可能性の結果を証明した。
この理論的な結果から,両レベル最適化問題に基づくアンタングル表現学習の実践的アプローチを提案する。
論文 参考訳(メタデータ) (2022-11-26T21:02:09Z) - Efficient Iterative Amortized Inference for Learning Symmetric and
Disentangled Multi-Object Representations [8.163697683448811]
本稿では,オブジェクト中心表現の教師なし学習のための効率的なフレームワークであるEfficientMORLを紹介する。
対称性と非絡み合いの両方を必要とすることによる最適化の課題は、高コスト反復的償却推論によって解決できることを示す。
標準のマルチオブジェクト・ベンチマークでは,強いオブジェクト分解と歪みを示しながら,ほぼ1桁の高速なトレーニングとテスト時間推定を実現している。
論文 参考訳(メタデータ) (2021-06-07T14:02:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。