論文の概要: OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.23193v3
- Date: Sun, 02 Aug 2026 03:37:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.321333
- Title: OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
- Title(参考訳): OmniScope:Omnimodal Large Language Modelに対するモダリティデカップリングトケン圧縮
- Authors: Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiawu Zheng,
- Abstract要約: 音声とビデオの関連性を別々に推定しながら,クエリを共有意味アンカーとして使用する,トレーニング不要なトークン圧縮フレームワークを提案する。
4つのオーディオビデオベンチマークと2つのQwen2.5-Omniモデルスケールで、OmniScopeはすべての圧縮設定で最高の平均精度を達成する。
これらの結果は、OmniLLM推論の単純な設計原則を示唆している。
- 参考スコア(独自算出の注目度): 23.801162485653478
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing token compression methods for omnimodal large language models typically rely on one modality to determine what to retain in the other. We show that this assumption often breaks down: for the same query, audio and video relevance often peaks at different moments. This cross-modal salience mismatch makes unidirectional guidance prone to discarding answer-critical cues under aggressive compression. We propose OmniScope, a training-free token compression framework that uses the query as a shared semantic anchor while estimating relevance separately for audio and video. OmniScope allocates modality-specific token budgets, prunes visual tokens with an anchor-delta strategy that preserves both global context and temporal changes, and merges audio tokens within each second to reduce redundancy while maintaining temporal continuity. Across four audio-video benchmarks and two Qwen2.5-Omni model scales, OmniScope achieves the best average accuracy across all compression settings. At 25% overall token retention, it delivers up to 3.53x prefill speedup and more than 15% GPU memory reduction, with only a 0.35-point drop in average accuracy. These results suggest a simple design principle for OmniLLM inference: share the query across modalities, but not the salience estimates. The code is available at https://github.com/MAC-AutoML/OmniScope.
- Abstract(参考訳): 既存の一様大言語モデルに対するトークン圧縮法は、通常、一方のモダリティに頼り、もう一方のモダリティに何を保持するかを決定する。
同じクエリに対して、オーディオとビデオの関連性は、しばしば異なるタイミングでピークとなる。
このクロスモーダルなサリエンスミスマッチは、アグレッシブな圧縮の下で応答クリティカルな手がかりを破棄する一方向誘導を難しくする。
OmniScopeは、クエリを共有セマンティックアンカーとして使用し、オーディオとビデオの関連性を別々に推定する、トレーニング不要なトークン圧縮フレームワークである。
OmniScopeは、モダリティ固有のトークン予算を割り当て、グローバルコンテキストと時間的変化の両方を保存するアンカーデルタ戦略で視覚トークンをプーンし、各秒内にオーディオトークンをマージして、時間的連続性を維持しながら冗長性を低減する。
4つのオーディオビデオベンチマークと2つのQwen2.5-Omniモデルスケールで、OmniScopeはすべての圧縮設定で最高の平均精度を達成する。
トークン保持全体の25%で、最大3.53倍のプリフィルスピードアップと15%以上のGPUメモリ削減を実現し、平均精度は0.35ポイントしか低下しない。
これらの結果は、OmniLLM推論の単純な設計原則を示唆している。
コードはhttps://github.com/MAC-AutoML/OmniScope.comで入手できる。
関連論文リスト
- Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models [18.902147033940434]
Omni-Pruneは、トレーニング不要で、クエリ対応のオーディオ-ビジュアルトークンプルーニングフレームワークである。
タスク関連のクロスモーダルな証拠を保持しながら、両方のモダリティから冗長性を取り除く。
最大3.25倍のプリフィルスピードアップと1.3倍のメモリ削減を実現し、フルモデル性能の99%を維持できる。
論文 参考訳(メタデータ) (2026-07-26T03:51:39Z) - OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models [72.34361439042634]
我々は,OmniLLMのトレーニング不要なクエリ誘導トークン圧縮手法を提案し,ビデオとオーディオの重要度を独立に推定する。
Qwen2.5-Omniモデルの4つのオーディオ・ビジュアル・ベンチマークによる実験は、OmniFocusが低トークン保持比で強い圧縮性能を維持していることを示している。
論文 参考訳(メタデータ) (2026-07-03T07:41:00Z) - OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models [49.34557936004057]
本稿では,マルチモーダル入力に対する適切な圧縮戦略を動的に選択する,トレーニングフリーなモダリティ適応型トークンプルーニングフレームワークを提案する。
本手法は, 訓練を必要とせず, 高い性能を維持しつつ, 効率的なマルチモーダルトークン削減を実現する。
論文 参考訳(メタデータ) (2026-05-18T08:33:52Z) - OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance [11.057999826097829]
高解像度オーディオとビデオ入力によるトークンの爆発は、リアルタイムアプリケーションや長時間の推論において、依然として重要なボトルネックとなっている。
既存のOmni-modalトークン圧縮法は、通常、音声とビデオの類似性や時間的共起に依存して、入力埋め込みレベルでトークンをプーンする。
我々は,LLMデコーダ層内の音声視覚トークンを,入力レベルではなく段階的にプルーフする,トレーニングフリーで層単位でのトークンプルーニングフレームワークであるOmniDropを提案する。
論文 参考訳(メタデータ) (2026-05-14T06:54:37Z) - OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models [14.355322423471018]
我々は,Omni-LLMにおける効率的な音声・視覚トークン圧縮のためのトレーニングフリー2段階フレームワークを提案する。
第一に、対応保存チャンクリファインメントは、ネイティブチャンク境界をクロスモーダルな圧縮ユニットに洗練する。
第二に、Modality-Aware Cooperative Compressionは、各改良されたユニット内のビデオトークンとオーディオトークンを共同で圧縮し、重要な証拠を保持しながら冗長性を低下させる。
論文 参考訳(メタデータ) (2026-05-12T12:42:44Z) - Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs [38.874953063372416]
推論時間トークンのプルーニングフレームワークとしてContextGuardを提案する。
ContextGuardは、音声から粗い視覚的セマンティクスを予測し、ビデオトークンをプーンする。
入力トークンの55%をプルーニングしながら、6つのベンチマークのうち5つでフルトーケンレベルのパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-05-12T06:35:29Z) - MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction [76.4461698685681]
Mini-o 4.5は、人間レベルのリアルタイムストリーミングインタラクションに向けた最新の取り組みです。
Omni-CPMは、オムニモードの知覚と出力を共有時間軸に沿って整列する統合ストリーミングフレームワークである。
合計9Bパラメータで、Mini-o 4.5は視力計算能力においてGemini 2.5 Flashにアプローチし、最先端のオープンな計算性能を提供する。
論文 参考訳(メタデータ) (2026-04-30T04:05:43Z) - Small Vision-Language Models are Smart Compressors for Long Video Understanding [73.65465038390771]
長時間のビデオ理解は、欲求に満ちたコンテキストではなく、意図駆動の効率に頼っている。
本稿では,下流の理解のために長い動画を圧縮する効率的なクエリ認識フレームワークであるTempoを提案する。
テストでは、Tempoが1時間のビデオを理論的限界以下に圧縮し、真のロングフォームビデオ理解が意図駆動の効率に依存することを示した。
論文 参考訳(メタデータ) (2026-04-09T11:40:25Z) - VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs [82.72388893596555]
MLLM(Multimodal Large Language Models)は、計算とメモリのボトルネックに遭遇する。
従来のトークン圧縮技術は、重要な情報を破棄するリスクを負うルールによって制約されることが多い。
我々は,トークン圧縮をエンドツーエンドの学習可能な決定プロセスに再構成する軽量なプラグアンドプレイフレームワークとして,トークン圧縮を再構成する。
論文 参考訳(メタデータ) (2025-10-18T17:54:18Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。