論文の概要: MawForge: Memory-Bounded Expert Materialization for Local Mixture-of-Experts Inference
- arxiv url: http://arxiv.org/abs/2607.09686v1
- Date: Wed, 17 Jun 2026 00:33:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.367246
- Title: MawForge: Memory-Bounded Expert Materialization for Local Mixture-of-Experts Inference
- Title(参考訳): MawForge: ローカルなMixture-of-Experts推論のためのメモリ境界のエキスパートマテリアル化
- Authors: Craig Opie,
- Abstract要約: ローカルMoEは、ディスク上に全モデルを格納することで、制約付き統一メモリマシンで実践することができる。
パフォーマンスは、慣れたフットプリント、KVキャッシュサイズ、ルートローカリティ、メモリプレッシャーに対する専門家の再利用のバランスに依存する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Sparse Mixture-of-Experts (MoE) language models separate total parameter count from per-token active computation, but local inference systems often still require the full model, key-value cache, runtime buffers, and operatingsystem headroom to fit in fast memory. MawForge tests a different systems hypothesis: local MoE serving can be made practical on constrained unified-memory machines by storing the full model on disk, keeping common tensors resident, and materializing routed expert tensors into a bounded execution cache on demand. The central finding is that MawForge is effective as a bounded execution mechanism and measurement substrate for local MoE inference, but not as a cache-maximization policy. Performance depends on balancing expert reuse against resident footprint, KV-cache size, quantization, route locality, and macOS memory pressure.
- Abstract(参考訳): Sparse Mixture-of-Experts (MoE)言語モデルは、トーケン毎のアクティブな計算から総パラメータカウントを分離するが、ローカル推論システムは、高速メモリに適合するために、フルモデル、キー値キャッシュ、ランタイムバッファ、オペレーティングシステムのヘッドルームを必要とすることが多い。
MawForgeは、異なるシステム仮説をテストしている: ローカルのMoEサービスは、ディスク上にフルモデルを格納し、一般的なテンソルを常駐させ、必要に応じてルーティングされたエキスパートテンソルをバウンダリされた実行キャッシュに実体化することで、制約付き統一メモリマシンで実践することができる。
中心的な発見は、MawForgeが局所MoE推論のための境界実行機構および測定基板として有効であるが、キャッシュ最大化ポリシーとしてではないことである。
パフォーマンスは、常駐フットプリント、KVキャッシュサイズ、量子化、ルートローカリティ、macOSメモリプレッシャーに対する専門家の再利用のバランスに依存する。
関連論文リスト
- Comparative Characterization of KV Cache Management Strategies for LLM Inference [0.31498833540989407]
大言語モデル(LLM)を用いた効率的な推論にはキーバリューキャッシュが不可欠である
これらのキャッシュは、自己回帰トークン生成時の冗長な計算を最小限にするために必須である。
KVキャッシュの成長は、システムレベルの大きな課題を引き起こしている。
論文 参考訳(メタデータ) (2026-04-06T16:00:39Z) - ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling [56.88966608455977]
ZipMoEはエッジデバイスのハードウェア特性とMoEパラメータ固有の統計的冗長性との相乗効果を利用する。
ZipMoEは72.77%の推論遅延低減と6.76タイムのスループットを実現している。
論文 参考訳(メタデータ) (2026-01-29T02:51:59Z) - Joint Encoding of KV-Cache Blocks for Scalable LLM Serving [3.3230675313521716]
既存のKV-cache圧縮手法は剛性に依存し、テンソルレイアウトを乱したり、特別な計算を必要とする。
KV-cacheブロックの連成符号化を提案し、要求と入力チャンクに類似したブロックを融合して共有表現を生成する。
これにより、KV-cacheメモリのボトルネックが軽減され、特別なハードウェアを使わずに高コンカレンシー機能をサポートする。
論文 参考訳(メタデータ) (2026-01-06T14:50:58Z) - Not All Models Suit Expert Offloading: On Local Routing Consistency of Mixture-of-Expert Models [45.691230716687365]
Mixture-of-Experts (MoE) は、推論中に専門家がわずかに活性化された大きな言語モデルの効率的なスケーリングを可能にする。
多くのシステムでは,専門家のサブセットを高速メモリにキャッシュする*専門家オフロード*を導入している。
各層にMoEを適用し、共有専門家を使用しないモデルは、最も高い局所的なルーティング一貫性を示す。
論文 参考訳(メタデータ) (2025-05-21T22:13:09Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition [3.659659889927316]
ChunkAttentionは、大きな言語モデルのためのプレフィックス対応のセルフアテンションモジュールである。
複数のリクエストにまたがる一致したプロンプトプレフィックスを検出し、実行時にそのキー/値テンソルをメモリで共有する。
実験の結果、ChunkAttentionは最先端の実装と比較して、自己保持カーネルを3.2-4.8$times$で高速化できることがわかった。
論文 参考訳(メタデータ) (2024-02-23T09:29:19Z) - A Model or 603 Exemplars: Towards Memory-Efficient Class-Incremental
Learning [56.450090618578]
CIL(Class-Incremental Learning)は、この要件を満たすために、限られたメモリサイズでモデルをトレーニングすることを目的としている。
モデルサイズを総予算にカウントし,メモリサイズに整合する手法を比較すると,保存モデルは常に機能しないことを示す。
本稿では,メモリ効率のよい拡張可能なMOdelのための MEMO という,シンプルで効果的なベースラインを提案する。
論文 参考訳(メタデータ) (2022-05-26T08:24:01Z) - Kanerva++: extending The Kanerva Machine with differentiable, locally
block allocated latent memory [75.65949969000596]
エピソディックメモリとセマンティックメモリは、人間のメモリモデルの重要なコンポーネントです。
我々は、エピソードメモリとセマンティックメモリのギャップを埋める新しい原理ベイズメモリ割り当てスキームを開発しました。
この割り当て方式がメモリ条件画像生成の性能を向上させることを実証する。
論文 参考訳(メタデータ) (2021-02-20T18:40:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。