論文の概要: OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.03050v1
- Date: Fri, 03 Jul 2026 07:41:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.506442
- Title: OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models
- Title(参考訳): OmniFocus: Omni-Modal Large Language Modelに対するクエリガイドによるモダリティベースのToken圧縮
- Abstract要約: 我々は,OmniLLMのトレーニング不要なクエリ誘導トークン圧縮手法を提案し,ビデオとオーディオの重要度を独立に推定する。
Qwen2.5-Omniモデルの4つのオーディオ・ビジュアル・ベンチマークによる実験は、OmniFocusが低トークン保持比で強い圧縮性能を維持していることを示している。
- 参考スコア(独自算出の注目度): 72.34361439042634
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Omni modal large language models (OmniLLMs) have attracted wide attention for their ability to jointly process audio and video, but they generate large token sequences under audio-visual inputs, leading to substantial inference cost. Existing audio-visual token compression methods often rely on unimodal guidance, overlooking the temporal locality of query-relevant evidence in audio-visual inputs and implicitly assuming that the two modalities share a temporally aligned information density distribution. We propose \textbf{OmniFocus}, a training-free query-guided token compression method for OmniLLMs that performs independent importance estimation for video and audio, enabling a modality-symmetric compression design that preserves modality-specific salient evidence while maintaining audio-visual alignment, thereby mitigating the modality bias issue that can arise from unimodal-guided compression. Experiments on the Qwen2.5-Omni model family across four audio-visual benchmarks show that OmniFocus maintains strong compressed performance at low token retention ratios and outperforms existing baselines on several major benchmark scores at 25\% token retention. On DailyOmni with Qwen2.5-Omni-7B at 25\% token retention, OmniFocus maintains 59.40 accuracy while delivering up to 1.38$\times$ prefill speedup relative to the full-token baseline, highlighting a favorable practical accuracy-efficiency trade-off.
- Abstract(参考訳): OmniModal Large Language Model (OmniLLMs) は、音声とビデオの共同処理能力で広く注目を集めている。
既存の音声-視覚トークン圧縮法は、音声-視覚入力におけるクエリ関連証拠の時間的局所性を見越し、2つのモダリティが時間的に整合した情報密度分布を共有することを暗黙的に仮定して、非モーダルガイダンスに依存していることが多い。
我々は,OmniLLMのトレーニング不要なクエリ誘導トークン圧縮手法である‘textbf{OmniFocus} を提案する。これはビデオとオーディオの重要度を独立に推定し,オーディオ-視覚的アライメントを維持しながら,モダリティ特異的な健全なエビデンスを保ちながらモダリティ対称な圧縮設計を実現することで,非モーダル誘導圧縮から生じるモダリティバイアス問題を緩和する。
Qwen2.5-Omniモデルファミリーを4つのオーディオ・ビジュアル・ベンチマークで比較したところ、OmniFocusは低いトークン保持率で強い圧縮性能を維持し、いくつかの主要なベンチマークスコアにおいて25倍のトークン保持率で既存のベースラインを上回っている。
Qwen2.5-Omni-7Bのトークン保持率25\%のDailyOmniでは、OmniFocusは59.40の精度を維持し、フルトーケンベースラインに対して最大1.38$\times$プリフィルスピードアップを提供する。
関連論文リスト
- Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs [27.392988683974256]
本稿では,意図認識型モーダルアロケーションとコンテンツ認識型イントラモーダルアロケーションを併用した,トレーニングフリーなスキル駆動型フレームワークを提案する。
Qwen2.5-Omni-7Bの25%のトークン保持で、OmniDeltaはGPUメモリを22.0%削減し、フルトークン推論よりも1.64倍のエンドツーエンドのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-07-28T12:50:31Z) - OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models [23.801162485653478]
音声とビデオの関連性を別々に推定しながら,クエリを共有意味アンカーとして使用する,トレーニング不要なトークン圧縮フレームワークを提案する。
4つのオーディオビデオベンチマークと2つのQwen2.5-Omniモデルスケールで、OmniScopeはすべての圧縮設定で最高の平均精度を達成する。
これらの結果は、OmniLLM推論の単純な設計原則を示唆している。
論文 参考訳(メタデータ) (2026-07-25T13:16:04Z) - O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding [16.003413095973784]
我々は,高精細な視覚記憶と時間的接地されたオーディオアンカーを保存できる,訓練用フリープラグ・イン・圧縮法であるOMACを紹介する。
メモリ圧縮マルチモーダルコンテキストで学習するための圧縮蒸留フレームワークであるO-MARCについても紹介する。
Qwen2.5-Omni-3Bでは、O-MARCは4つのベンチマークの平均スコアを45.8に改善し、44.1とOmniZipを41.0で上回った。
論文 参考訳(メタデータ) (2026-05-26T06:07:11Z) - OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models [49.34557936004057]
本稿では,マルチモーダル入力に対する適切な圧縮戦略を動的に選択する,トレーニングフリーなモダリティ適応型トークンプルーニングフレームワークを提案する。
本手法は, 訓練を必要とせず, 高い性能を維持しつつ, 効率的なマルチモーダルトークン削減を実現する。
論文 参考訳(メタデータ) (2026-05-18T08:33:52Z) - OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models [14.355322423471018]
我々は,Omni-LLMにおける効率的な音声・視覚トークン圧縮のためのトレーニングフリー2段階フレームワークを提案する。
第一に、対応保存チャンクリファインメントは、ネイティブチャンク境界をクロスモーダルな圧縮ユニットに洗練する。
第二に、Modality-Aware Cooperative Compressionは、各改良されたユニット内のビデオトークンとオーディオトークンを共同で圧縮し、重要な証拠を保持しながら冗長性を低下させる。
論文 参考訳(メタデータ) (2026-05-12T12:42:44Z) - LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs [68.35684758116453]
このデータセットは、リッチなオーディオ視覚ダイナミクスを備えたオープンプラットフォームからソースされた高品質なビデオで構成されている。
我々は,長期記憶,時間的局所化,きめ細かい理解,マルチモーダル知覚など,ドメイン間のOmniLLMの能力について精査した。
オープンソースモデルは一般的に35%未満の精度を達成するが、Gemini 3 Proは65%のピーク精度に達する。
論文 参考訳(メタデータ) (2026-03-19T17:58:13Z) - Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity [54.95089105944234]
視覚言語モデル(VLM)は、過剰な視覚トークンの生成によって引き起こされる計算の非効率性に直面する。
2段階パイプラインを特徴とする訓練不要なSynergistic Importance-DiversityアプローチPruneSIDを提案する。
LLaVA-NeXTでは11.1%のトークン保持率で96.3%の精度、極端な圧縮速度(5.6%)で92.8%の精度を実現した。
論文 参考訳(メタデータ) (2026-03-10T10:31:58Z) - OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models [42.615226139135174]
我々はOmni-LLM向けに設計されたトークン圧縮フレームワークであるOmniSIFTを提案する。
フレームワーク全体が、差別化可能なストレートスルー推定器を通じてエンドツーエンドに最適化されている。
オリジナルのトークンコンテキストの25%に過ぎないため、OmniSIFTはすべての圧縮ベースラインを一貫して上回り、複数のタスクでフルトーケンモデルのパフォーマンスを上回ります。
論文 参考訳(メタデータ) (2026-02-04T17:51:05Z) - InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression [114.03378443007074]
現在のトークンライザは、すべてのコンテンツを固定レートで厳格に圧縮し、冗長性や情報損失につながる。
本稿では,適応型ビデオトークン化のための原則的フレームワークであるInfoTokを紹介する。
我々は,適応トークン化を実現するトランスベースの適応圧縮機を開発した。
論文 参考訳(メタデータ) (2025-12-18T17:13:59Z) - EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs [28.295585578439212]
EchoingPixelsは、現実世界のシーンにおける視覚と音の共存と相互作用にインスパイアされたフレームワークである。
これは、モダリティごとに固定予算を使うのではなく、オーディオ・ビジュアル・トークンの合計プールからトークンを減らします。
オリジナルのトークンの5~20%しか使用せず、2~3倍のスピードアップとメモリ削減を実現している。
論文 参考訳(メタデータ) (2025-12-11T06:18:58Z) - OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models [21.542205813984243]
本稿では,マルチモーダルトークン表現と推論を最適化する,トレーニング不要な音声視覚トークン圧縮フレームワークを提案する。
具体的には、OmniZipはまず健全な音声トークンを特定し、その後、各タイムグループの音声保持スコアを計算して情報をキャプチャする。
タイムウィンドウ毎に、OmniZipはインターリーブ時間スキームを使用してビデオトークンを圧縮する。
論文 参考訳(メタデータ) (2025-11-18T15:22:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。