論文の概要: Optimizing ML Workload Partitioning between CPUs and CIM Accelerators for Heterogeneous Computing
- arxiv url: http://arxiv.org/abs/2607.05240v1
- Date: Mon, 06 Jul 2026 15:50:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.228479
- Title: Optimizing ML Workload Partitioning between CPUs and CIM Accelerators for Heterogeneous Computing
- Title(参考訳): 不均一コンピューティングのためのCPUとCIM加速器間のMLワークロード分割の最適化
- Authors: Joel Klein, Rebecca Pelke, Roberto Laudani, Jan Moritz Joseph, Rainer Leupers,
- Abstract要約: 本稿では,計算メモリ(CIM)アクセラレータのための ILP ベースのワークロード分割フレームワークを提案する。
RRAM制約下でのエンドツーエンドの推論遅延を最小限に抑え、並列性を捉え、経験的プロファイリングと分析モデルを組み合わせる。
当社のフレームワークでは,エッジCPU上でのCPUのみの実行を最大30.9倍,高性能CPU上での7.3倍の高速化を実現している。
- 参考スコア(独自算出の注目度): 0.759633586781718
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computing-in-Memory (CIM) accelerators execute Matrix-Vector Multiplications (MVMs) in memory, making them a compelling solution for Machine Learning (ML) workloads. However, existing ML workload partitioning approaches for CIM accelerators do not fully account for Resistive Random Access Memory (RRAM) constraints such as limited memory, high write latency, and limited endurance. They also neglect parallelism, low-level architectural effects, or the Central Processing Unit (CPU) as a complementary compute resource. To address these limitations, we propose an Integer Linear Programming (ILP)-based workload partitioning framework for heterogeneous CPU-CIM systems. It minimizes end-to-end inference latency under RRAM constraints, captures parallelism, and combines empirical profiling with analytical models. Using our framework, heterogeneous CPU-CIM execution achieves speedups of up to 30.9x over CPU-only execution on an edge CPU and 7.3x over a high-performance CPU. A Design Space Exploration (DSE) yields further design insights for future CIM accelerators.
- Abstract(参考訳): Computing-in-Memory(CIM)アクセラレータは、メモリ内でMatrix-Vector Multiplications(MVM)を実行する。
しかし、CIMアクセラレータの既存のMLワークロードパーティショニングアプローチでは、メモリ制限や書き込みレイテンシ、永続性制限といったRRAM(Resistive Random Access Memory)の制約を完全に考慮していない。
また、並列性、低レベルのアーキテクチャ効果、あるいは補完的な計算リソースとしてCPU(Central Processing Unit)も無視する。
これらの制約に対処するため、不均質なCPU-CIMシステムのための Integer Linear Programming (ILP) ベースのワークロード分割フレームワークを提案する。
RRAM制約下でのエンドツーエンドの推論遅延を最小限に抑え、並列性を捉え、経験的プロファイリングと分析モデルを組み合わせる。
このフレームワークを用いることで、エッジCPU上でのCPUのみの実行で最大30.9倍、高性能CPU上での7.3倍の高速化を実現している。
デザイン・スペース・エクスプロレーション(DSE)は将来のCIM加速器の設計上の洞察を得る。
関連論文リスト
- Learning to Share: Selective Memory for Efficient Parallel Agentic Systems [49.78267008828593]
エージェントシステムは、反復的に推論する複数のエージェントを調整することで複雑なタスクを解決し、ツールを呼び出し、中間結果を交換する。
最近のアプローチでは、さまざまな推論の軌跡を探索するために、複数のエージェントチームが並行して運用されている。
我々は並列エージェントフレームワークのための学習された共有メモリ機構であるLearning to Share (LTS)を提案する。
論文 参考訳(メタデータ) (2026-02-05T18:20:21Z) - Mixed-Precision Training and Compilation for RRAM-based Computing-in-Memory Accelerators [0.8708298560474775]
CIMアーキテクチャのための混合精度トレーニングおよびコンパイルフレームワークを提案する。
最大の課題は巨大な検索スペースであり、優れた量子化パラメータを見つけるのが難しくなる。
最良の場合、我々の手法は既存の最先端ソリューションよりも2.48倍のスピードアップを達成し、精度の損失は0.086%である。
論文 参考訳(メタデータ) (2026-01-29T13:54:55Z) - xLLM Technical Report [57.13120905321185]
我々は,知的かつ効率的なLarge Language Model (LLM)推論フレームワークであるxLLMを紹介する。
xLLMは、新しい分離されたサービスエンジンアーキテクチャを構築する。
xLLM-Engineは、システムとアルゴリズムの設計を最適化し、コンピュータリソースを完全に飽和させる。
論文 参考訳(メタデータ) (2025-10-16T13:53:47Z) - DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution [114.61347672265076]
実世界のロボットのためのMLLMの開発は、ロボットプラットフォームで利用可能な計算能力とメモリ容量が典型的に限られているため、難しい。
活性化MLLMのサイズを自動的に調整するロボットビジョンランゲージ・アクション・モデル(DeeR)の動的早期実行フレームワークを提案する。
DeeR は LLM の計算コストを 5.2-6.5x に削減し、GPU のメモリを 2-6x に削減した。
論文 参考訳(メタデータ) (2024-11-04T18:26:08Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - In Situ Framework for Coupling Simulation and Machine Learning with
Application to CFD [51.04126395480625]
近年、流体力学計算を容易にする機械学習(ML)の多くの成功例が報告されている。
シミュレーションが大きくなるにつれて、従来のオフライン学習のための新しいトレーニングデータセットの生成は、I/Oとストレージのボトルネックを生み出します。
この作業は、この結合を単純化し、異種クラスタでのその場トレーニングと推論を可能にするソリューションを提供する。
論文 参考訳(メタデータ) (2023-06-22T14:07:54Z) - An Experimental Evaluation of Machine Learning Training on a Real
Processing-in-Memory System [9.429605859159023]
機械学習(ML)アルゴリズムのトレーニングは、計算集約的なプロセスであり、しばしばメモリバウンドである。
メモリ内の処理能力を備えたメモリ中心のコンピューティングシステムは、このデータ移動ボトルネックを軽減することができる。
実世界の汎用PIMアーキテクチャ上で,いくつかの代表的古典的MLアルゴリズムを実装した。
論文 参考訳(メタデータ) (2022-07-16T09:39:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。