論文の概要: Allocation Before Ranking: Decoupled Token Compression for OmniLLMs
- arxiv url: http://arxiv.org/abs/2608.01665v1
- Date: Mon, 03 Aug 2026 03:56:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.322948
- Title: Allocation Before Ranking: Decoupled Token Compression for OmniLLMs
- Title(参考訳): ランク付け前のアロケーション:OmniLLMの切り離されたトークン圧縮
- Authors: Zhenghui Guo, Yilin Yang, Yuanbin Man, Miao Yin, Weidong Shi, Rabimba Karanjai, Omprakash Gnawali, Chengming Zhang,
- Abstract要約: トレーニング不要な圧縮機を提案し、まず音声とビデオの予算を割り当て、次に各モードで正規化ランキングを実行する。
Macerは、オーディオ・グラウンド、オーディオ・ビデオ・ジョイント、ビジュアル・マディナント、ビデオ中心のベンチマークで精度を保ちながらトークンコストを大幅に削減する。
- 参考スコア(独自算出の注目度): 11.775745731468923
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Token compression in OmniLLMs is typically posed as a single saliency-ranking problem: score each multimodal token, keep the top-K. We argue this abstraction is mis-specified. The same attention score simultaneously decides two things: how much retained capacity each modality receives, and which tokens within a modality are kept. A shared top-K rule therefore inherits this audio-favoring allocation prior, spending retained capacity on audio before video tokens have a chance to compete. We propose Macer, a training-free compressor that first assigns explicit audio and video budgets, then performs allocation-normalized ranking within each modality at modality-specific shallow layers. Macer significantly reduces token cost while preserving accuracy across audio-grounded, audio--video joint, visual-dominant, and video-centric benchmarks. At 25 % retention, Macer preserves 98.7 % of full-token performance on Qwen2.5-Omni-7B and 97.3 % on Qwen2.5-Omni-3B. On Qwen2.5-Omni-7B, this 25 % setting reaches OmniZip-level performance at 45 % retention while using lower FLOPs. On OmniVinci-9B, the same allocation-before-ranking principle improves over shared top-K ranking by up to 12.9 points.
- Abstract(参考訳): OmniLLMsにおけるトークン圧縮は、通常、単一のサリエンシレベルの問題として、例えば、各マルチモーダルトークンをスコアし、トップKを維持する。
私たちはこの抽象概念を誤解している。
同じ注意スコアは、各モダリティがどれくらいのキャパシティを受け取り、どのトークンをモダリティ内で保持するかという2つのことを同時に決定する。
したがって、共有トップKルールは、ビデオトークンが競合する機会を得る前に、オーディオに保持される容量を、このオーディオに優先するアロケーションを継承する。
トレーニング不要な圧縮機であるMacerを提案する。この圧縮機は、まず明示的なオーディオとビデオの予算を割り当て、その後、モータリティ固有の浅い層で各モータリティ内で割り当て正規化ランキングを実行する。
Macerは、オーディオ・グラウンド、オーディオ・ビデオ・ジョイント、ビジュアル・マディナント、ビデオ中心のベンチマークで精度を保ちながらトークンコストを大幅に削減する。
保持率25%では、Qwen2.5-Omni-7Bでは98.7%、Qwen2.5-Omni-3Bでは97.3%である。
Qwen2.5-Omni-7Bでは、この25%設定は、低いFLOPを使用しながら、45パーセントの保持率でOmniZipレベルのパフォーマンスに達する。
OmniVinci-9Bでは、同じアロケーション前の原則が共有トップKランキングよりも最大12.9ポイント向上している。
関連論文リスト
- OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs [27.392988683974256]
本稿では,意図認識型モーダルアロケーションとコンテンツ認識型イントラモーダルアロケーションを併用した,トレーニングフリーなスキル駆動型フレームワークを提案する。
Qwen2.5-Omni-7Bの25%のトークン保持で、OmniDeltaはGPUメモリを22.0%削減し、フルトークン推論よりも1.64倍のエンドツーエンドのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-07-28T12:50:31Z) - OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models [4.202254591215664]
音声とビデオの関連性を別々に推定しながら,クエリを共有意味アンカーとして使用する,トレーニング不要なトークン圧縮フレームワークを提案する。
4つのオーディオビデオベンチマークと2つのQwen2.5-Omniモデルスケールで、OmniScopeはすべての圧縮設定で最高の平均精度を達成する。
これらの結果は、OmniLLM推論の単純な設計原則を示唆している。
論文 参考訳(メタデータ) (2026-07-25T13:16:04Z) - OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models [72.34361439042634]
我々は,OmniLLMのトレーニング不要なクエリ誘導トークン圧縮手法を提案し,ビデオとオーディオの重要度を独立に推定する。
Qwen2.5-Omniモデルの4つのオーディオ・ビジュアル・ベンチマークによる実験は、OmniFocusが低トークン保持比で強い圧縮性能を維持していることを示している。
論文 参考訳(メタデータ) (2026-07-03T07:41:00Z) - O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding [16.003413095973784]
我々は,高精細な視覚記憶と時間的接地されたオーディオアンカーを保存できる,訓練用フリープラグ・イン・圧縮法であるOMACを紹介する。
メモリ圧縮マルチモーダルコンテキストで学習するための圧縮蒸留フレームワークであるO-MARCについても紹介する。
Qwen2.5-Omni-3Bでは、O-MARCは4つのベンチマークの平均スコアを45.8に改善し、44.1とOmniZipを41.0で上回った。
論文 参考訳(メタデータ) (2026-05-26T06:07:11Z) - Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity [54.95089105944234]
視覚言語モデル(VLM)は、過剰な視覚トークンの生成によって引き起こされる計算の非効率性に直面する。
2段階パイプラインを特徴とする訓練不要なSynergistic Importance-DiversityアプローチPruneSIDを提案する。
LLaVA-NeXTでは11.1%のトークン保持率で96.3%の精度、極端な圧縮速度(5.6%)で92.8%の精度を実現した。
論文 参考訳(メタデータ) (2026-03-10T10:31:58Z) - VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs [82.72388893596555]
MLLM(Multimodal Large Language Models)は、計算とメモリのボトルネックに遭遇する。
従来のトークン圧縮技術は、重要な情報を破棄するリスクを負うルールによって制約されることが多い。
我々は,トークン圧縮をエンドツーエンドの学習可能な決定プロセスに再構成する軽量なプラグアンドプレイフレームワークとして,トークン圧縮を再構成する。
論文 参考訳(メタデータ) (2025-10-18T17:54:18Z) - METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding [55.38256656122857]
トレーニング不要なマルチステージイベントベースのToken圧縮フレームワークであるMETokを提案する。
我々はMETokが情報的視覚トークンを動的に選択することで効率と精度の最適なトレードオフを実現することを示す。
例えば、LongVA-7BをMETokに装備すると、80.6%のFLOPが削減され、93.5%のKVキャッシュメモリが節約される。
論文 参考訳(メタデータ) (2025-06-03T13:19:41Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。