論文の概要: Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving
- arxiv url: http://arxiv.org/abs/2607.02640v1
- Date: Thu, 02 Jul 2026 15:59:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.378484
- Title: Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving
- Title(参考訳): Metronome:キャッシュのバウンド、リアルタイムインタラクションモデルのビート維持
- Authors: Jiaying Meng, Bojie Li,
- Abstract要約: 各フレームでセッションはストリーミングオーディオを取り込み、ウォールタイムの期限に応答しなければならない。
リアルタイムスタックでは、持続的な負荷は優雅に機能しない。
Metronomeのエンジン内KVウィンドウは、クラッシュを排除し、フレーム単位のレイテンシをモノトーン負荷信号に変換する。
- 参考スコア(独自算出の注目度): 0.4376400608266187
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-time interaction models -- Moshi, MiniCPM-o, Qwen-Omni -- turn serving into a periodic real-time task: on every frame a session ingests streaming audio and must respond by a recurring wall-clock deadline, while its KV cache grows monotonically and stays pinned for the whole conversation. This regime hides a dangerous failure mode. On a real full-duplex stack, sustained load does not degrade serving gracefully: it falls off a cliff, jumping in one step from milliseconds per frame to a stalled engine when accumulated session state exhausts the KV pool. The collapse is metastable -- identical five-minute runs collapse or survive on run-to-run variance -- and silent: latency and deadline-miss metrics read healthy throughout. We show one move restores both stability and observability: bound each session's resident state, and latency starts telling the truth. Metronome's in-engine KV window eliminates the collapse (0/20 vs. 14/20 runs across two batches) and turns per-frame latency into a monotone load signal, on which an online admission controller discovers the schedulable concurrency; without the window, the identical controller over-admits into the wall. A first-order model predicts the collapse time within a few percent on the headline model, and a quality probe validates the bound's design by ablation: the window alone is quality-free in turn-based decoding, and its few pinned attention-sink tokens are what keep free-running generation healthy. Everything is measured end-to-end on real audio, across four interaction models on one GPU.
- Abstract(参考訳): リアルタイムインタラクションモデル -- Moshi、MiniCPM-o、Qwen-Omni -- は、定期的にリアルタイムタスクにサービスを提供する。すべてのフレームにおいて、セッションはストリーミングオーディオを取り込み、ウォールタイムの期限を繰り返す必要がある。
この体制は危険な障害モードを隠す。
持続負荷は崖から落ちて1フレームあたりミリ秒から1ステップで停止したエンジンに飛び込み、累積セッション状態がKVプールを排出する。
崩壊はメタスタブルで、同じ5分間の実行がクラッシュするか、実行時から実行時までの分散で生き残るかで、サイレントです。
各セッションの常駐状態がバインドされ、レイテンシーが真実を語り始めます。
Metronomeのエンジン内KVウィンドウは、崩壊を排除し(0/20 vs. 14/20は2つのバッチで実行される)、フレーム毎のレイテンシをモノトンロード信号に変換し、オンラインの入力コントローラがスケジュール可能な並行性を検出する。
1次モデルは、見出しモデル上で数パーセント以内の崩壊時間を予測し、品質プローブは、境界の設計をアブレーションによって検証する。
すべては、実際のオーディオでエンドツーエンドに測定され、1つのGPU上の4つのインタラクションモデルにまたがる。
関連論文リスト
- Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - MURMUR: An Efficient Inference System for Long-Form ASR [5.721402685889177]
長文自動音声認識は高精度と低レイテンシの両方を必要とする。
チャンクベースのパイプラインは、低レイテンシで並列ウィンドウでオーディオを処理するが、コンテキスト間のコンテキストは失われる。
長いコンテキストモデルは、1回のパスですべてを解決し、精度は向上するが、桁違いに遅い。
本稿では,このトレードオフを克服する2段階の推論システムであるMurmurを提案する。
論文 参考訳(メタデータ) (2026-05-31T22:54:57Z) - OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants [43.2907783462394]
音声-視覚的ストリームに対するネイティブ推論によって評価されたリアルタイム全言語モデルのストリーミングベンチマーク。
本研究では,対話型品質タイムラインF1,割り込み診断スイート,368の1QnAスロットを用いて,応答の正しさ,タイミング,不正出力の割り込み,コンテキスト継続性を評価した。
論文 参考訳(メタデータ) (2026-05-26T02:49:47Z) - MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction [76.4461698685681]
Mini-o 4.5は、人間レベルのリアルタイムストリーミングインタラクションに向けた最新の取り組みです。
Omni-CPMは、オムニモードの知覚と出力を共有時間軸に沿って整列する統合ストリーミングフレームワークである。
合計9Bパラメータで、Mini-o 4.5は視力計算能力においてGemini 2.5 Flashにアプローチし、最先端のオープンな計算性能を提供する。
論文 参考訳(メタデータ) (2026-04-30T04:05:43Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention [37.91838955436801]
自動回帰ビデオ拡散モデルは、ストリーミング生成、ロングフォーム合成への扉を開くこと、ビデオワールドモデル、インタラクティブなニューラルゲームエンジンを可能にする。
生成が進むにつれて、KVキャッシュが増加し、レイテンシの増加とGPUメモリのエスカレーションが生じる。
我々は、自己回帰拡散のための統合されたトレーニングなしアテンションフレームワークを提案する: TempCacheは、時間的対応によるKVキャッシュをバウンドキャッシュ成長に圧縮し、AnnCAは、高速近傍マッチングを用いてフレーム関連プロンプトを選択することで、クロスアテンションを加速し、AnnSAは各クエリを制限して自己アテンションを拡大する。
論文 参考訳(メタデータ) (2026-02-02T08:31:21Z) - AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising [49.785626309848276]
AsyncDiffは、複数のデバイスにまたがるモデル並列化を可能にする、普遍的でプラグアンドプレイのアクセラレーションスキームである。
安定拡散 v2.1 では、AsyncDiff は2.7倍の速度アップと4.0倍のスピードアップを実現し、CLIPスコアの 0.38 をわずかに削減した。
我々の実験は、AsyncDiffがビデオ拡散モデルに容易に適用でき、性能を向上できることを示した。
論文 参考訳(メタデータ) (2024-06-11T03:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。