論文の概要: HCRMap: Pressure-Aware Hot-Expert Residency Mapping for 3.5D MoE Chiplet Inference
- arxiv url: http://arxiv.org/abs/2607.11586v1
- Date: Mon, 13 Jul 2026 14:05:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.498998
- Title: HCRMap: Pressure-Aware Hot-Expert Residency Mapping for 3.5D MoE Chiplet Inference
- Title(参考訳): HCRMap:3.5D MoEChiplet推論のための圧力対応ホットエキスパートレジデンシマッピング
- Abstract要約: 本稿では,圧力対応専門家のレプリカ管理のためのホットエキスパート常駐マッピングフレームワークであるHCRMapを提案する。
エキスパートのホットネス、ロードコスト、マイグレーションのオーバーヘッド、リソースのプレッシャーに基づいて、HCRMapは動的に、どの専門家を昇格、維持、削除、排除すべきかを判断する。
- 参考スコア(独自算出の注目度): 0.16921396880325776
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) large language models (LLM) activate only a small number of experts during inference, but token routing introduces persistent expert hotness skew: a small set of hot experts continuously receives most tokens, while the remaining experts are lightly loaded. On 3.5D multi-chiplet systems, this skew not only causes compute imbalance but also amplifies pressure on communication, memory bandwidth, I/O, and execution queues. Therefore, the core problem is not simply to reduce token movement, but to dynamically place and reuse hot expert replicas across different memory tiers. This paper proposes HCRMap, a hot expert residency mapping framework for pressure-aware expert replica management in 3.5D MoE inference. Based on expert hotness, weight loading cost, migration overhead, and runtime resource pressure, HCRMap dynamically determines which experts should be promoted, retained, demoted, or evicted. It then maps routed token groups to suitable resident replicas, thereby jointly mitigating communication, memory, and queue bottlenecks. Experimental results show that HCRMap reduces end-to-end latency by 43.6% and 43.0% over Hydra in the prefill and decode stages, respectively; by 34.5% and 33.1% over MoEntwine; and by 46.7% and 46.0% over PIMoE.
- Abstract(参考訳): 混合専門家(Mixture-of-Experts, MOE) 大規模な言語モデル(LLM)は、推論中に少数の専門家しかアクティベートしないが、トークンルーティングは永続的な専門家のホットネススキューを導入している。
3.5Dマルチチップシステムでは、このスキューは計算の不均衡を引き起こすだけでなく、通信、メモリ帯域幅、I/O、実行キューへの圧力を増幅する。
したがって、中核的な問題は単にトークンの動きを減らすことではなく、異なるメモリ層にまたがるホットエキスパートレプリカを動的に配置し再利用することである。
本稿では,3.5D MoE推論における圧力認識専門家のレプリカ管理のためのホットエキスパート常駐マッピングフレームワークであるHCRMapを提案する。
専門家のホットネス、重み付けコスト、マイグレーションのオーバーヘッド、ランタイムリソースのプレッシャに基づいて、HCRMapは動的に、どの専門家を昇格、維持、削除、排除すべきかを判断する。
その後、ルーティングされたトークングループを適切な常駐レプリカにマップし、通信、メモリ、キューのボトルネックを緩和します。
実験の結果、HCRMapは、プレフィルおよびデコード段階でそれぞれHydraよりも43.6%、デコード時に43.0%、MoEntwineより34.5%、33.1%、PIMoEより46.7%、PIMoEより46.0%の遅延を減少させることがわかった。
関連論文リスト
- PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval [50.986807025432476]
バックボーンを再トレーニングすることなく、マルチモーダル埋め込みをコンパクトなスパースコードにマッピングするスパースオートエンコーダレシピであるPUMAを紹介する。
テキスト・ツー・イメージと合成画像検索を対象とする5つのベンチマークの評価を行った。
Puma はベクトルストレージを 8-16x (FP32) 削減し、より大きい候補プールの精度の高いスコアよりも25倍高速である。
論文 参考訳(メタデータ) (2026-08-26T13:26:39Z) - Cacheable by Design? Training Mixture-of-Experts Routers for Locality Against the Edge Memory-Bandwidth Wall: A Pre-Registered Negative Result with a Systems Measurement Study [0.0]
Qwen3-235B(Q4_K_M, 134 GB)の帯域幅の壁の定量化
ゼロサージリールータテレメトリーツールである llamamoe-trace を構築し,Q3-30B のルーティングを測定した。
補助的な局所性とドメインルータ損失を有する137M MoE言語モデルの事前登録訓練を行う。
論文 参考訳(メタデータ) (2026-08-18T19:23:32Z) - Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression [74.00650541246374]
そこで本研究では,MoEモデルに適した構造解析フレームワークを提案する。
我々のアプローチはメモリフットプリントを5.27$times削減し、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T06:53:27Z) - Sticky Routing: Training MoE Models for Memory-Efficient Inference [0.0]
StickyMoEは、隣接するトークン間の急激な専門家スイッチをペナライズする。
ポストホックメソッドとは異なり、StickyMoEはエキスパート表現とルーティング決定を、最初のトレーニングステップから共適応させる。
論文 参考訳(メタデータ) (2026-06-12T23:47:19Z) - ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference [8.678113280424876]
きめ細かいMixture-of-Experts(MoE)モデルはトークンごとに専門家のサブセットだけを活性化する。
メモリ制約のある推論シナリオでは、少数の専門家しかキャッシュできない。
トークンワイド専門家の再利用を促進するために設計されたルータファインチューニングフレームワークであるReMoEを提案する。
論文 参考訳(メタデータ) (2026-05-26T14:32:56Z) - TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading [38.243293392367086]
TriMoEは新しいGPU-CPU-NDPアーキテクチャで、AMX対応のCPUを利用して、ホット、ウォーム、コールドの専門家を最適な計算ユニットにマップする。
実験により、TriMoEは最先端のソリューションよりも最大2.83倍のスピードアップを達成することが示された。
論文 参考訳(メタデータ) (2026-03-01T11:27:37Z) - Opportunistic Expert Activation: Batch-Aware Expert Routing for Faster Decode Without Retraining [34.97996720624093]
トークンから専門家へのマッピングを動的に再ルーティングするフレームワークを導入し、MoEレイテンシを低くする。
バッチサイズが16ドルであるQwen3-30BおよびQwen3-235Bモデルについて評価を行った。
論文 参考訳(メタデータ) (2025-11-04T04:00:20Z) - MC#: Mixture Compressor for Mixture-of-Experts Large Models [86.64315380917827]
Mixture-of-Experts (MoE)は、大きな言語モデル(LLM)と視覚言語モデル(VLM)をスパースアクティベーションによって拡張することで効果的にスケールする。
静的量子化と動的エキスパートプルーニングを組み合わせたフレームワークであるMC#(Mixture-Compressor-sharp)を提案する。
論文 参考訳(メタデータ) (2025-10-13T03:12:46Z) - Too Helpful, Too Harmless, Too Honest or Just Right? [19.134202394422285]
大規模言語モデル(LLM)は、幅広いNLPタスクに強いパフォーマンスを示す。
アウトプットをHelpfulness、Harmlessness、Hoesty(HHH)の原則と整合させることは、依然として永続的な課題である。
本稿では,Transformer アーキテクチャに Calibrated Experts (MoCaE) を組み込んだモジュールアライメントフレームワークである TrinityX を提案する。
論文 参考訳(メタデータ) (2025-09-10T10:51:47Z) - HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference [54.40808356999408]
フレキシブルで効率的なMoE推論を実現するための混合精度専門家オフロードシステムHOBBITを提案する。
キーとなる洞察は、重要でないキャッシュミスの専門家を低い精度で動的に置き換えることで、専門家のロード遅延を大幅に削減できるということです。
HOBBITは、最先端のMoEオフロードシステムと比較して、デコードで最大9.93倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2024-11-03T04:25:46Z) - DETR Doesn't Need Multi-Scale or Locality Design [69.56292005230185]
本稿では,"プレーン"特性を維持できる改良型DETR検出器を提案する。
特定の局所性制約を伴わずに、単一スケールの機能マップとグローバルなクロスアテンション計算を使用する。
マルチスケールな特徴マップと局所性制約の欠如を補うために,2つの単純な技術が平易な設計において驚くほど効果的であることを示す。
論文 参考訳(メタデータ) (2023-08-03T17:59:04Z) - You Only Segment Once: Towards Real-Time Panoptic Segmentation [68.91492389185744]
YOSOはリアルタイムのパン光学セグメンテーションフレームワークである。
YOSOは、パン光学カーネルと画像特徴マップの間の動的畳み込みを通じてマスクを予測する。
YOSOは、COCOで46.4 PQ、45.6 FPS、都市景観で52.5 PQ、22.6 FPS、ADE20Kで38.0 PQ、35.4 FPSを達成している。
論文 参考訳(メタデータ) (2023-03-26T07:55:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。