論文の概要: Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes
- arxiv url: http://arxiv.org/abs/2605.08913v2
- Date: Thu, 14 May 2026 11:50:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 15:19:49.860805
- Title: Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes
- Title(参考訳): Apple MPSデコードにおける非単調レイテンシ:KVキャッシュインタラクションと実行レジーム
- Abstract要約: 我々は,Apple MPSバックエンドにおける予期せぬ非単調遅延挙動を同定した。
特定のデコード-予算間隔で最大21倍のレイテンシのスパイクを観測し、次いで隣接する構成でのリカバリを行った。
これらの結果から,MPSの自己回帰復号化は,粗粒度ベンチマークでは得られない離散的な実行機構に入ることが示唆された。
- 参考スコア(独自算出の注目度): 0.023074632109535153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive inference is typically assumed to scale predictably with decoding length, with latency increasing smoothly as generated sequence length grows. In this work, we identify unexpected non-monotonic latency behavior in the Apple MPS backend, where latency changes abruptly across nearby decoding configurations during transformer decoding. Using multiple model families (GPT-2, BLOOM, and OPT), we observe latency spikes of up to 21x within specific decoding-budget intervals, followed by recovery at neighboring configurations. Controlled experiments show that these anomalies originate primarily during the decode phase rather than prefill, are not explained by memory pressure alone, and remain absent on CPU and NVIDIA CUDA backends under identical conditions. We further show that key-value (KV) cache interacts strongly with these pathological execution regimes: KV caching remains beneficial overall, but its practical speedup collapses sharply within anomalous configurations, while cache-disabled decoding still exhibits residual non-monotonic behavior. These findings suggest that autoregressive decoding on MPS enters discrete execution regimes that are not captured by coarse-grained benchmarking, highlighting the importance of hardware-aware evaluation for long-context inference.
- Abstract(参考訳): 自己回帰推論は典型的にはデコード長で予測可能であり、生成シーケンス長が増加するにつれて遅延は滑らかに増加する。
本研究では,Apple MPSバックエンドにおける予期せぬ非単調遅延挙動を同定する。
複数のモデルファミリ (GPT-2, BLOOM, OPT) を用いて, 特定のデコード-予算間隔で最大21倍の遅延スパイクを観測し, 次いで隣接する構成で回復する。
制御された実験により、これらの異常は主にプリフィルではなくデコードフェーズで発生し、メモリ圧力だけでは説明されず、同じ条件下でCPUやNVIDIA CUDAバックエンドに存在しないことが示されている。
KVキャッシュは全体として有益であるが、その実用的なスピードアップは異常な構成内で急激に崩壊する一方、キャッシュを無効としたデコーディングは依然として非単調な動作を示す。
これらの結果から,MPSの自己回帰復号化は,粗粒度ベンチマークでは捉えられない離散的な実行機構に入り,長文推論におけるハードウェア認識評価の重要性が示唆された。
関連論文リスト
- CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration [67.17709877327232]
ケイトKVは、一貫したヘッドに対して重要なトークン情報のみを保持するハイブリッドKVキャッシュ方式である。
Cate KV はメモリ使用量を最大$2.72 times$に減らし、シングルサンプル入力で$2.18times$に減らした。
論文 参考訳(メタデータ) (2026-08-31T06:02:37Z) - Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation [2.497926557563177]
キーバリュー(KV)キャッシュは、長期的なタスクでLLM(Large Language Models)をデプロイする上で、依然として大きなボトルネックとなっている。
モーメント-KVはモーメント駆動時間アテンションアグリゲーションに基づく復号時間KVキャッシュ圧縮法である。
論文 参考訳(メタデータ) (2026-05-28T12:56:51Z) - DeCoDrift: Stabilizing Decoder Coupling in Closed-Loop Foundation Segmentation [0.431493144418712]
フィードバックループは、マスクデコーダのクロスアテンションがターゲットオブジェクトとのアライメントを徐々に失い、繰り返しにわたってエラーが蓄積されるような、以前見過ごされた障害モード、デコーダ結合ドリフトを誘導できることを示す。
DeCoDriftは、トレーニング不要な推論時間安定化フレームワークで、更新の速やかな制限とイテレーション間のデコーダ結合の保存を行う。
論文 参考訳(メタデータ) (2026-05-25T11:41:21Z) - Taming Asynchronous CPU-GPU Coupling for Frequency-aware Latency Estimation on Mobile Edge [5.2773045718276705]
周波数の組み合わせ間での推測遅延を正確に推定するためにFLAMEを導入する。
重なり合う並列性を定量化し、動的パイプラインバブルを集約する、新しいレイヤワイズ・モデリングが特徴である。
FLAMEの正確なモデリングにより、サンプルの粗いサブセットをプロファイリングし、数時間から数分でプロファイリングを切断し、SLMプロファイリングを数日からほんの数分で行うことができる。
論文 参考訳(メタデータ) (2026-04-11T12:26:06Z) - EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction [55.026048429595384]
EchoKVは、標準と圧縮された推論間のオンデマンド移行を可能にする柔軟なKVキャッシュ圧縮スキームである。
高速で低コストなトレーニングを可能にする2段階の微調整戦略を導入する。
論文 参考訳(メタデータ) (2026-03-24T07:58:42Z) - LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification [14.954035477725276]
本稿では、時間的論理誘導映像理解の精度を保った遅延効率のよいニューロシンボリック・フレームワークLE-NeuSを提案する。
LongVideoBench と Video-MME のベンチマークでは、LE-NeuS は遅延ギャップを 90x から 10x に削減し、時間的に複雑なクエリでは 10% の精度向上を維持している。
論文 参考訳(メタデータ) (2026-02-26T23:28:13Z) - Forecasting as Rendering: A 2D Gaussian Splatting Framework for Time Series Forecasting [79.37674445572462]
時系列予測(TSF)は、周期内変動と周期間トレンドの複雑な絡み合いのため、依然として困難な問題である。
形状変化テンソルを静止画像として扱うと、トポロジカルミスマッチが発生する。
均一な固定サイズの表現に依存することは、モデリング能力を非効率に割り当てる。
TimeGSは、予測パラダイムをレグレッションから2D生成レンダリングに根本的にシフトする、新しいフレームワークである。
論文 参考訳(メタデータ) (2026-02-10T14:13:36Z) - TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control [15.534182843429043]
大規模なVision-Language-Action(VLA)モデルはセマンティックな一般化を提供するが、高い推論遅延に悩まされる。
本稿では,高頻度動作から意味論的推論を分離する階層型フレームワークであるTIDALを提案する。
TIDALは、二重周波数アーキテクチャを用いて拡散ベースのVLAのためのバックボーンに依存しないモジュールとして動作する。
論文 参考訳(メタデータ) (2026-01-21T12:43:11Z) - PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs [57.790910044227935]
ビデオLLMは時間的不整合に悩まされ、フレームタイミングの小さなシフトは注意をそらすことができ、関連するフレームを抑えることができる。
本稿では, 位相アグリゲード平滑化(PAS)について述べる。これは, 頭部に小さな反対位相オフセットを適用して, 出力を集約する学習自由機構である。
解析の結果,RoPE回転ロジットは,時間核でスケールしたコンテントドット積として近似でき,このカーネルを滑らかにすることで,小さな時間シフトに対する注意のリプシッツ安定性が得られ,マルチフェーズ平均化は,Nyquist-valid サンプリング下での頭当たりスペクトルを保ちながら高周波リップルを減衰させることがわかった。
論文 参考訳(メタデータ) (2025-11-14T05:56:47Z) - InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation [56.694702609077495]
ロングシーケンス処理は、現代の大規模言語モデルにとって重要な機能である。
InfLLM-V2は、ショートシーケンスからロングシーケンスまでのモデルをシームレスに適応する訓練可能なスパースアテンションフレームワークである。
実験では、InfLLM-V2は高密度の注意より4$times$速いが、98.1%と99.7%のパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-09-29T12:08:33Z) - PipeInfer: Accelerating LLM Inference using Asynchronous Pipelined Speculation [9.080650575731152]
PipeInferは、パイプライン化された投機的アクセラレーション技術で、トークン間のレイテンシを低減し、単一要求シナリオにおけるシステム利用を改善する。
PipeInferは、標準的な投機的推論よりも生成速度が2.15$times$改善されている。
論文 参考訳(メタデータ) (2024-07-16T14:52:02Z) - AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising [49.785626309848276]
AsyncDiffは、複数のデバイスにまたがるモデル並列化を可能にする、普遍的でプラグアンドプレイのアクセラレーションスキームである。
安定拡散 v2.1 では、AsyncDiff は2.7倍の速度アップと4.0倍のスピードアップを実現し、CLIPスコアの 0.38 をわずかに削減した。
我々の実験は、AsyncDiffがビデオ拡散モデルに容易に適用でき、性能を向上できることを示した。
論文 参考訳(メタデータ) (2024-06-11T03:09:37Z) - Bifurcated Attention: Accelerating Massively Parallel Decoding with Shared Prefixes in LLMs [39.16152482491236]
Bifurcated attentionは、共有コンテキストバッチデコードシナリオにおける言語モデル推論を強化するために設計された手法である。
提案手法は,高バッチサイズおよび拡張コンテキスト長のレイテンシに寄与する重要な要因である冗長メモリIOコストの課題に対処する。
論文 参考訳(メタデータ) (2024-03-13T16:30:57Z) - Practical Conformer: Optimizing size, speed and flops of Conformer for
on-Device and cloud ASR [67.63332492134332]
我々は、デバイス上の制約を満たすのに十分小さく、TPUを高速に推論できる最適化されたコンバータを設計する。
提案するエンコーダは、デバイス上では強力なスタンドアロンエンコーダとして、また高性能なASRパイプラインの第1部として利用することができる。
論文 参考訳(メタデータ) (2023-03-31T23:30:48Z) - Towards Streaming Perception [70.68520310095155]
本稿では、リアルタイムオンライン知覚のための単一のメトリクスにレイテンシと精度を協調的に統合するアプローチを提案する。
この指標の背後にある重要な洞察は、瞬間ごとに認識スタック全体の出力を共同で評価することである。
本稿では,都市ビデオストリームにおけるオブジェクト検出とインスタンスセグメンテーションの具体的タスクに注目し,高品質で時間依存的なアノテーションを備えた新しいデータセットを寄贈する。
論文 参考訳(メタデータ) (2020-05-21T01:51:35Z) - Minimum Latency Training Strategies for Streaming Sequence-to-Sequence
ASR [44.229256049718316]
線形時間復号複雑性を伴うオンライン音声認識を実現するために,ストリームアテンションに基づくシーケンス・ツー・シーケンス(S2S)モデルが提案されている。
これらのモデルでは、一方向エンコーダには将来的な情報がないため、実際の音響境界よりもトークンを生成する決定が遅れる。
本稿では,ハイブリッドモデルから抽出した外部ハードアライメントを活用することで,トレーニング中のいくつかの戦略を提案する。
Cortana音声検索タスクの実験により,提案手法は遅延を著しく低減し,デコーダ側の特定の場合の認識精度も向上することを示した。
論文 参考訳(メタデータ) (2020-04-10T12:24:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。