論文の概要: Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling
- arxiv url: http://arxiv.org/abs/2608.29291v2
- Date: Tue, 01 Sep 2026 05:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.619189
- Title: Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling
- Title(参考訳): Core-Expansion RoutingとUnified Computation Schedulingによる統一マルチモーダルモデルの高速化
- Authors: Wengyi Zhan, Chenqian Yan, Songwei Liu, Mingbao Lin, Rongrong Ji,
- Abstract要約: 統一マルチモーダルモデルは、理解と生成を共同でサポートするが、トークン、レイヤ、生成タイムステップ間でかなりの冗長な計算を行う。
本稿では,タスク共有型コアスコアラと進行条件付き生成拡張を提案し,生成分解とクロスタスクコアアライメントを最適化した。
2つの代表的UMMアーキテクチャの実験では、両タスク間で一貫した品質改善が示され、98.03%の高密度な理解性能を維持し、エンドツーエンドの推論速度は1.93times$である。
- 参考スコア(独自算出の注目度): 61.28599393707943
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified multimodal models jointly support understanding and generation, but incur substantial redundant computation across tokens, layers, and generation timesteps. Through token-importance probing, we identify an asymmetric core-expansion structure: understanding exhibits a stable importance component, while generation largely shares this component but requires progress-dependent corrections. We therefore propose CE-Router, which uses a task-shared core scorer and progress-conditioned generation expansions, optimized through generation decomposition and cross-task core alignment. At inference, CE-Router compacts token computation and supplies a learned routing signal to Unified Computation Scheduling, which coordinates layer skipping, FFN pruning, diffusion-head cache reuse, and denoising-step early exit. Experiments on two representative UMM architectures demonstrate consistent quality--efficiency improvements across both tasks, retaining 98.03\% of dense understanding performance with a 1.93$\times$ end-to-end inference speedup.
- Abstract(参考訳): 統一マルチモーダルモデルは、理解と生成を共同でサポートするが、トークン、レイヤ、生成タイムステップ間でかなりの冗長な計算を行う。
トークン重要度探索を通じて、非対称なコア膨張構造を同定する: 理解は安定な重要成分を示し、生成は、この成分を主に共有するが、進行に依存した補正を必要とする。
そこで我々は,タスク共有コアスコアラと進行条件付き生成拡張を用いたCE-Routerを提案し,生成分解とクロスタスクコアアライメントを最適化した。
推論時にCE-Routerはトークン計算を圧縮し、学習したルーティング信号をUnified Computation Schedulingに供給する。
2つの代表的UMMアーキテクチャの実験では、両タスク間で一貫した品質改善が示され、98.03 %の高密度な理解性能と1.93$\times$ end-to-end推論速度が維持されている。
関連論文リスト
- Empowering Cross-Domain Sequential Recommendation with Hybrid Tokenization and Serial-Parallel Decoding [63.74998371740272]
クロスドメインシーケンシャルレコメンデーション(CDSR)は、ユーザの動的関心遷移と複数のドメインにわたるシーケンシャルパターンをモデル化することを目的としている。
我々は,CDSRの効率的かつ効率的な生成フレームワークであるGenCDSRを提案する。
我々は、GenCDSRが、最先端のベースラインと比較して平均精度を1.5パーセント向上し、平均推論遅延を85.1%削減したことを示す。
論文 参考訳(メタデータ) (2026-07-21T08:01:15Z) - DRDN: Decoupled Representation Dynamic Network for From-Scratch ViT Class-Incremental Learning [6.097306160389619]
クラスインクリメンタルラーニング(CIL)のための動的拡張手法は、専用トークンや計算作業でタスク固有の知識を保護する。
我々は、主に現在のタスクデータに対する逐次トレーニングからのクロスタスクの混乱と、バックボーン内の過度に最適化された共有表現の2つの課題を特定する。
本稿では,2つのメカニズムを通じてこれらの課題に対処する解答表現動的ネットワーク(DRDN)を提案する。
論文 参考訳(メタデータ) (2026-07-02T02:57:58Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - DCAU-Net: Differential Cross Attention and Channel-Spatial Feature Fusion for Medical Image Segmentation [2.2015188658021003]
本稿では, DCAU-Netを提案する。
まず,2つの独立なソフトマックスアテンションマップの違いを計算するために,新しい微分クロスアテンション(DCA)を設計した。
第2に,Channel-Spatial Feature Fusion (CSFF) 戦略を導入し,特徴を適応的に再検討する。
論文 参考訳(メタデータ) (2026-03-10T11:37:10Z) - UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation [98.93314262366681]
胸部X線理解・生成のための次世代統合医療基盤モデルUniXについて述べる。
UniXは2つのタスクを、理解のための自己回帰分岐と高忠実度生成のための拡散分岐に分離する。
2つの代表的なベンチマークでは、Unixは46.1%の性能向上と24.2%の世代品質向上を実現している。
論文 参考訳(メタデータ) (2026-01-16T18:59:58Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing [8.705453442427585]
大規模言語モデル(LLM)は様々な推論タスクでほぼ人間に近い性能を達成した。
リソース制約のあるIoT(Internet-of-Things)デバイスへのデプロイメントは、大量のパラメータフットプリントとメモリ集約型の自己回帰デコーディングのため、依然として現実的ではない。
この研究は、エッジデバイスにLLMを配置するために明示的に設計された最初の自動回帰対応分割コンピューティングフレームワークを紹介した。
論文 参考訳(メタデータ) (2025-11-06T02:55:07Z) - Time-Shifted Token Scheduling for Symbolic Music Generation [6.835980208223368]
遅延に基づくスケジューリング機構を適用し、デコードステップを越えて複合的なトークンを拡張する。
本手法は,標準的な複合トークン化よりもすべてのメトリクスを改善し,そのギャップを微細なトークン化に狭める。
論文 参考訳(メタデータ) (2025-09-28T08:52:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。