論文の概要: Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.23445v1
- Date: Sun, 26 Jul 2026 03:51:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.103911
- Title: Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models
- Title(参考訳): Omni-Prune: 効率的なOmnimodal大言語モデルのためのクエリ対応統一トークン処理
- Authors: Yiming Zhong, Chang Nie, Caifeng Shan,
- Abstract要約: Omni-Pruneは、トレーニング不要で、クエリ対応のオーディオ-ビジュアルトークンプルーニングフレームワークである。
タスク関連のクロスモーダルな証拠を保持しながら、両方のモダリティから冗長性を取り除く。
最大3.25倍のプリフィルスピードアップと1.3倍のメモリ削減を実現し、フルモデル性能の99%を維持できる。
- 参考スコア(独自算出の注目度): 18.902147033940434
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Omnimodal large language models (OmniLLMs) are rapidly extending multimodal reasoning to cover synchronized audio and video. However, the resulting audio-video token sequences are long, leading to high prefill latency and GPU memory usage at inference time. Existing token pruning methods, designed mainly for vision-only inputs, miss both the cross-modal links between audio and video and the user query that decides which content matters. To bridge this gap, we present Omni-Prune, a training-free, query-aware audio-visual token pruning framework that jointly removes redundancy from both modalities while keeping task-relevant cross-modal evidence. Specifically, Omni-Prune first splits the token sequence into adaptive time windows placed at audio saliency peaks, then scores audio and video tokens on a single scale that combines encoder attention with text-query relevance, and pairs related audio-video tokens so that they are kept together. Within each window, a final K-medoids step then selects a few representative tokens, adding diverse cues that score-based selection alone would miss. Extensive experiments demonstrate that Omni-Prune outperforms established baseline methods, delivering up to 3.25x prefill speedup and 1.3x memory reduction while retaining over 99% of full-model performance.
- Abstract(参考訳): OmniLLMs (OmniLLMs) は、同期音声とビデオをカバーするために、急速にマルチモーダル推論を拡張している。
しかし、結果のオーディオビデオトークンシーケンスは長いため、プリフィルのレイテンシと推論時のGPUメモリ使用率が高くなる。
既存のトークンプルーニング方式は、主に視覚のみの入力用に設計されており、オーディオとビデオの相互接続と、どのコンテンツが重要かを決定するユーザークエリの両方を見逃している。
このギャップを埋めるために、我々はOmni-Pruneというトレーニングフリーでクエリ対応のオーディオ・ビジュアル・トークン・プルーニング・フレームワークを紹介し、タスク関連クロスモーダル証拠を保持しながら、両方のモダリティから冗長性を共同で除去する。
具体的には、Omni-Pruneはまず、トークンシーケンスをオーディオサリエンシピークに配置された適応時間ウィンドウに分割し、エンコーダの注意とテキストクエリの関連性を組み合わせた単一のスケールでオーディオとビデオのトークンをスコアし、関連するオーディオとビデオのトークンをペアリングして、それらを一緒に保持する。
各ウィンドウ内では、最後のK-メドロイドステップがいくつかの代表トークンを選択し、スコアベースの選択だけで見逃すような多様なキューを追加する。
大規模な実験では、Omni-Pruneは確立されたベースライン法よりも優れており、最大3.25倍のプリフィルスピードアップと1.3倍のメモリ削減を実現し、フルモデル性能の99%以上を維持している。
関連論文リスト
- OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models [4.202254591215664]
音声とビデオの関連性を別々に推定しながら,クエリを共有意味アンカーとして使用する,トレーニング不要なトークン圧縮フレームワークを提案する。
4つのオーディオビデオベンチマークと2つのQwen2.5-Omniモデルスケールで、OmniScopeはすべての圧縮設定で最高の平均精度を達成する。
これらの結果は、OmniLLM推論の単純な設計原則を示唆している。
論文 参考訳(メタデータ) (2026-07-25T13:16:04Z) - OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models [72.34361439042634]
我々は,OmniLLMのトレーニング不要なクエリ誘導トークン圧縮手法を提案し,ビデオとオーディオの重要度を独立に推定する。
Qwen2.5-Omniモデルの4つのオーディオ・ビジュアル・ベンチマークによる実験は、OmniFocusが低トークン保持比で強い圧縮性能を維持していることを示している。
論文 参考訳(メタデータ) (2026-07-03T07:41:00Z) - OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models [49.34557936004057]
本稿では,マルチモーダル入力に対する適切な圧縮戦略を動的に選択する,トレーニングフリーなモダリティ適応型トークンプルーニングフレームワークを提案する。
本手法は, 訓練を必要とせず, 高い性能を維持しつつ, 効率的なマルチモーダルトークン削減を実現する。
論文 参考訳(メタデータ) (2026-05-18T08:33:52Z) - OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance [11.057999826097829]
高解像度オーディオとビデオ入力によるトークンの爆発は、リアルタイムアプリケーションや長時間の推論において、依然として重要なボトルネックとなっている。
既存のOmni-modalトークン圧縮法は、通常、音声とビデオの類似性や時間的共起に依存して、入力埋め込みレベルでトークンをプーンする。
我々は,LLMデコーダ層内の音声視覚トークンを,入力レベルではなく段階的にプルーフする,トレーニングフリーで層単位でのトークンプルーニングフレームワークであるOmniDropを提案する。
論文 参考訳(メタデータ) (2026-05-14T06:54:37Z) - Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs [38.874953063372416]
推論時間トークンのプルーニングフレームワークとしてContextGuardを提案する。
ContextGuardは、音声から粗い視覚的セマンティクスを予測し、ビデオトークンをプーンする。
入力トークンの55%をプルーニングしながら、6つのベンチマークのうち5つでフルトーケンレベルのパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-05-12T06:35:29Z) - EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs [28.295585578439212]
EchoingPixelsは、現実世界のシーンにおける視覚と音の共存と相互作用にインスパイアされたフレームワークである。
これは、モダリティごとに固定予算を使うのではなく、オーディオ・ビジュアル・トークンの合計プールからトークンを減らします。
オリジナルのトークンの5~20%しか使用せず、2~3倍のスピードアップとメモリ削減を実現している。
論文 参考訳(メタデータ) (2025-12-11T06:18:58Z) - OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models [21.542205813984243]
本稿では,マルチモーダルトークン表現と推論を最適化する,トレーニング不要な音声視覚トークン圧縮フレームワークを提案する。
具体的には、OmniZipはまず健全な音声トークンを特定し、その後、各タイムグループの音声保持スコアを計算して情報をキャプチャする。
タイムウィンドウ毎に、OmniZipはインターリーブ時間スキームを使用してビデオトークンを圧縮する。
論文 参考訳(メタデータ) (2025-11-18T15:22:32Z) - AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs [53.248502396225724]
AudioMarathonは、ロングフォームオーディオの理解と推論の効率を評価するために設計されたベンチマークである。
我々は、最先端のLALMを評価し、音声の長さが大きくなるにつれて、明らかな性能低下を観察する。
その結果、現在のLALM間での大きなギャップが示され、時間的推論の改善の必要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-10-08T17:50:16Z) - Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities [67.89368528234394]
マルチモーダル学習の主な課題の1つは、異質なモダリティを組み合わせる必要があることである。
ビデオとオーディオはテキストよりもはるかに高いレートで取得され、ほぼ時間内に整列される。
我々の手法は、確立されたマルチモーダルベンチマークの最先端性を達成し、はるかに大きなモデルより優れている。
論文 参考訳(メタデータ) (2023-11-09T19:15:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。