論文の概要: OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM Streaming
- arxiv url: http://arxiv.org/abs/2609.34653v1
- Date: Mon, 28 Sep 2026 08:58:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.75745
- Title: OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM Streaming
- Title(参考訳): OmniTide: デバイス上での効率的なOmni-LLMストリーミングのための協調設計アルゴリズムとシステム
- Abstract要約: オンデバイスストリーミング omni-modal推論は、ユーザのプライバシを保護し、token当たりの禁止的なAPIコストを排除します。
既存のスパースアテンションメソッドは、違法なオンライン推定遅延を発生させるか、インターリーブされたクロスモーダルコンテキストを破壊するかのいずれかで不足する。
我々は,OmniTideを提案する。OmniTideは,デバイス上での効率的なストリーミングオムニモーダル推論に適したアルゴリズム・システムである。
- 参考スコア(独自算出の注目度): 7.944521925732346
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-device streaming omni-modal inference safeguards user privacy and eliminates prohibitive per-token API costs, but faces a critical bottleneck: the continuous influx of multimodal data rapidly exhausts constrained memory and compute budgets via monotonic KV cache growth. Existing sparse attention methods fall short, either incurring prohibitive online estimation latency or destroying interleaved cross-modal context, while failing to resolve physical memory fragmentation. We present OmniTide, the first algorithm-system co-design tailored for efficient on-device streaming omni-modal inference. Driven by the observation of modality-aware structural sparsity, OmniTide adopts a unit-based abstraction with two components: (1) At the algorithm level, OmniPick logically retains critical multimodal context based on unit boundaries and modality importance to preserve task accuracy; (2) At the system level, OmniPage physically partitions the cache by retention likelihood and dynamically compacts surviving sparse tokens, minimizing both memory fragmentation and data-movement overhead. Extensive evaluations across three streaming benchmarks and two consumer-device architectures show that OmniTide achieves up to $12.72\times$ kernel speedups and $2.40\times$ lower stream-loop latency. On StreamingBench, it improves accuracy by up to 18.0 percentage points over sliding-window baselines at comparable session cost. OmniPage further reduces the physical KV span by up to 26.7% relative to native logical eviction, unlocking real-time, infinite-context streaming on edge devices.
- Abstract(参考訳): オンデバイスストリーミングのOmni-modal推論は、ユーザのプライバシを保護し、トークンごとの禁止的なAPIコストを排除しますが、重大なボトルネックに直面します。
既存のスパースアテンションメソッドは、違法なオンライン推定遅延を発生させるか、インターリーブされたクロスモーダルコンテキストを破壊するかのいずれかで、物理メモリの断片化の解決に失敗する。
我々は,OmniTideを提案する。OmniTideは,デバイス上での効率的なストリーミングオムニモーダル推論に適したアルゴリズム・システムである。
1) アルゴリズムレベルでは、OmniPickは、ユニット境界とタスクの正確性を維持するために重要なマルチモーダルコンテキストを論理的に保持する。 2) システムレベルでは、OmniPageは保持可能性によってキャッシュを物理的に分割し、残りのスパーストークンを動的にコンパクト化し、メモリフラグメント化とデータ移動オーバーヘッドを最小化する。
3つのストリーミングベンチマークと2つのコンシューマーデバイスアーキテクチャによる広範囲な評価によると、OmniTideは最大で12.72倍のカーネルスピードアップと2.40倍のストリームループレイテンシを実現している。
StreamingBenchでは、スライディングウィンドウベースラインよりも18.0ポイントの精度を同等のセッションコストで向上させる。
OmniPageはさらに物理KVを26.7%まで削減し、エッジデバイス上でのリアルタイムで無限コンテキストのストリーミングをアンロックする。
関連論文リスト
- Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs [27.392988683974256]
本稿では,意図認識型モーダルアロケーションとコンテンツ認識型イントラモーダルアロケーションを併用した,トレーニングフリーなスキル駆動型フレームワークを提案する。
Qwen2.5-Omni-7Bの25%のトークン保持で、OmniDeltaはGPUメモリを22.0%削減し、フルトークン推論よりも1.64倍のエンドツーエンドのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-07-28T12:50:31Z) - Surprise Forcing: What to Remember, When to Skip in Long Video Generation [65.0022589149937]
自己回帰拡散をストリーミングすることで、ミニスケールのビデオ合成が実用的になるが、そのコンテキスト境界と固定化スケジュールはリソースを均一に割り当てる。
我々は、両方の制限をオンラインリソース割り当て問題として扱う、トレーニング不要のフレームワークであるSurprise Forcingを紹介した。
VBench、VBench-Long、VBench-2.0の実験では、提案されたアロケーション戦略は、リアルタイムストリーミングスループットを維持しながら、長時間の一貫性と視覚的品質を改善する。
論文 参考訳(メタデータ) (2026-07-20T18:37:58Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models [14.355322423471018]
我々は,Omni-LLMにおける効率的な音声・視覚トークン圧縮のためのトレーニングフリー2段階フレームワークを提案する。
第一に、対応保存チャンクリファインメントは、ネイティブチャンク境界をクロスモーダルな圧縮ユニットに洗練する。
第二に、Modality-Aware Cooperative Compressionは、各改良されたユニット内のビデオトークンとオーディオトークンを共同で圧縮し、重要な証拠を保持しながら冗長性を低下させる。
論文 参考訳(メタデータ) (2026-05-12T12:42:44Z) - MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction [76.4461698685681]
Mini-o 4.5は、人間レベルのリアルタイムストリーミングインタラクションに向けた最新の取り組みです。
Omni-CPMは、オムニモードの知覚と出力を共有時間軸に沿って整列する統合ストリーミングフレームワークである。
合計9Bパラメータで、Mini-o 4.5は視力計算能力においてGemini 2.5 Flashにアプローチし、最先端のオープンな計算性能を提供する。
論文 参考訳(メタデータ) (2026-04-30T04:05:43Z) - WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition [0.21748200848556343]
本稿では,書き起こし品質を維持しながらメモリ消費の限界を実現する新しいストリーミングアーキテクチャWhisperPipeを提案する。
我々はWhisperPipeが既存のストリーミングソリューションよりも3~5倍のレイテンシで動作しながら、競争精度(WERがオフラインのWhisperの2%以内)を達成することを示す。
論文 参考訳(メタデータ) (2026-04-28T13:18:59Z) - OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models [42.615226139135174]
我々はOmni-LLM向けに設計されたトークン圧縮フレームワークであるOmniSIFTを提案する。
フレームワーク全体が、差別化可能なストレートスルー推定器を通じてエンドツーエンドに最適化されている。
オリジナルのトークンコンテキストの25%に過ぎないため、OmniSIFTはすべての圧縮ベースラインを一貫して上回り、複数のタスクでフルトーケンモデルのパフォーマンスを上回ります。
論文 参考訳(メタデータ) (2026-02-04T17:51:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。