論文の概要: RED-PIM: Reducing Data Movement for Transformers using Processing-in-Memory
- arxiv url: http://arxiv.org/abs/2607.21731v1
- Date: Thu, 23 Jul 2026 18:28:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.969727
- Title: RED-PIM: Reducing Data Movement for Transformers using Processing-in-Memory
- Title(参考訳): RED-PIM:Processing-in-Memoryを用いたトランスフォーマーのデータ移動低減
- Abstract要約: 本稿では,銀行間データ移動の最小化による注目遅延を低減するアルゴリズムアーキテクチャの共同設計であるRED-PIMを提案する。
実世界のデータセットでは、RED-PIMは長文で99.60%、短文で13.44%の性能を改善し、精度を維持または改善している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Transformers are widely used across many domains, including natural language processing, computer vision, web search, and DNA sequence analysis. Given their broad applicability, improving the performance of transformer models is critical. However, the high volume of data movement between processing units and memory during attention operations significantly limits their efficiency. Processing-In-Memory (PIM) mitigates this issue by performing computations directly inside memory. While prior work has proposed PIM-based transformer implementations, they suffer from costly inter-bank communication, and struggle to scale due to the limited capacity of memory banks. As a result, attention-related data must be split across banks, diminishing the potential benefits of PIM. In this work, we propose RED-PIM, an algorithm-architecture co-design that reduces attention latency by minimizing inter-bank data movement from O(N^2) to O(N) and shrinking intermediate attention matrices from N x N to d x d. By reorganizing matrix operations, performing computations locally, and employing an optimized data transfer strategy, RED-PIM significantly reduces computation cost and interconnect traffic. Compared to baseline PIM implementation, RED-PIM achieves inference time reductions ranging from 16.05% to 99.99% (geometric mean of 66.42%), with the largest gains on longer sequences. On real-world datasets, RED-PIM improves performance by 99.60% for long documents and 13.44% for shorter ones, while maintaining or improving accuracy. These results demonstrate RED-PIM's effectiveness for scalable and efficient transformer inference.
- Abstract(参考訳): トランスフォーマーは自然言語処理、コンピュータビジョン、Web検索、DNA配列解析など、多くの領域で広く使われている。
幅広い適用性を考えると、トランスモデルの性能向上が重要である。
しかし、処理ユニットとアテンション操作中のメモリ間のデータ移動量は、その効率を著しく低下させる。
Processing-In-Memory (PIM)は、メモリ内で直接計算を行うことによってこの問題を軽減する。
以前の作業ではPIMベースのトランスフォーマーの実装が提案されていたが、コストのかかる銀行間通信に悩まされ、メモリバンクの容量が限られているためスケールが困難になった。
その結果、注目に関連するデータは銀行間で分割されなければならないため、PIMの潜在的な利益は減少する。
本研究では,O(N^2) から O(N) へのバンク間データ移動を最小化し,中間注目行列を N x N から d x d まで小さくすることで,注目遅延を低減するアルゴリズムアーキテクチャの共同設計であるRED-PIM を提案する。
行列演算を再編成し、ローカルで計算を行い、最適化されたデータ転送戦略を採用することにより、RED-PIMは計算コストと相互接続トラフィックを大幅に削減する。
RED-PIMはベースラインのPIM実装と比較して16.05%から99.99%(幾何学平均66.42%)の推論時間短縮を実現し、より長いシーケンスで最大のゲインを得る。
実世界のデータセットでは、RED-PIMは長文で99.60%、短文で13.44%の性能を改善し、精度を維持または改善している。
これらの結果は、RED-PIMがスケーラブルで効率的なトランスフォーマー推論に有効であることを示す。
関連論文リスト
- AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization [1.5897138572815364]
AQPIMは製品量子化(PQ)に基づくPIM対応アクティベーション量子化フレームワークである
圧縮されたデータの直接計算を可能にし、注意計算のためのメモリフットプリントと計算オーバーヘッドの両方を大幅に削減する。
論文 参考訳(メタデータ) (2026-04-20T12:04:51Z) - A Tensor Compiler for Processing-In-Memory Architectures [8.353569627672622]
Processing-In-Memory(PIM)デバイスは、Large Language Models(LLM)を含む機械学習(ML)モデルにおいて、メモリ集約カーネルを加速することができる。
現在のコンパイルアプローチでは、複数のPIMバックエンドにまたがる多様なMLカーネルの体系的な最適化が欠如している。
我々は、データ再構成と計算コード最適化を共同で最適化するPIMシステムのための、最初のデータ中心のMLコンパイラDCCを設計する。
論文 参考訳(メタデータ) (2025-11-19T14:58:16Z) - Intra-DP: A High Performance Collaborative Inference System for Mobile Edge Computing [67.98609858326951]
Intra-DPはモバイルデバイス上でのディープニューラルネットワーク(DNN)に最適化された高性能な協調推論システムである。
推論毎のレイテンシを最大50%削減し、最先端のベースラインと比較してエネルギー消費量を最大75%削減する。
評価の結果,DP内の遅延は,最先端のベースラインと比較して最大50%,エネルギー消費は最大75%減少することがわかった。
論文 参考訳(メタデータ) (2025-07-08T09:50:57Z) - Compress, Gather, and Recompute: REFORMing Long-Context Processing in Transformers [58.98923344096319]
REFORMは、2フェーズアプローチによって、長いコンテキストを効率的に処理する新しい推論フレームワークである。
RULERとBABILongでそれぞれ1Mコンテキスト長で50%以上と27%のパフォーマンス向上を達成した。
また、Infinite-BenchとMM-NIAHのベースラインを上回り、さまざまなタスクやドメインの柔軟性を示す。
論文 参考訳(メタデータ) (2025-06-01T23:49:14Z) - Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores [3.6385567224218556]
大規模言語モデル(LLM)は広く応用されているが、効率的な推論では課題に直面している。
本稿では、並列計算を容易にし、対称量子化をサポートする新しいバイポーラ-INTデータフォーマットを提案する。
ビットレベルで分解・復元する任意の精度行列乗算方式を実装し,フレキシブルな精度を実現する。
論文 参考訳(メタデータ) (2024-09-26T14:17:58Z) - TrIM, Triangular Input Movement Systolic Array for Convolutional Neural Networks: Dataflow and Analytical Modelling [0.0]
畳み込みニューラルネットワーク(CNN)はフォン・ノイマンのボトルネックに影響を受けやすい。
このボトルネックは、処理コアとメモリ間でデータを移動する際のエネルギーコストに関連している。
本稿では,三角入力運動に基づく新しいSAデータフローであるTrIMを提案する。
論文 参考訳(メタデータ) (2024-08-02T13:15:17Z) - UIO-LLMs: Unbiased Incremental Optimization for Long-Context LLMs [111.05657299071648]
UIO-LLMsは、長いコンテキスト設定下でのメモリ拡張トランスフォーマーの漸進的な最適化手法である。
本稿では,TBPTTアルゴリズムを用いて学習過程を改良する。
UIO-LLMは、Llama2-7b-chatのコンテキストウィンドウを4Kから100Kトークンに、2%の追加パラメータで拡張するなど、長いコンテキストを扱うことに成功した。
論文 参考訳(メタデータ) (2024-06-26T08:44:36Z) - Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers [58.5711048151424]
SPARSEK Attention(SPARSEK Attention)は、計算およびメモリ障害を克服するために設計された、新しいスパースアテンション機構である。
提案手法では,各クエリに対して一定数のKVペアを選択するために,スコアリングネットワークと差別化可能なトップkマスク演算子であるSPARSEKを統合する。
実験結果から,SPARSEK注意は従来のスパースアテンション法よりも優れていた。
論文 参考訳(メタデータ) (2024-06-24T15:55:59Z) - Full-Stack Optimization for CAM-Only DNN Inference [2.0837295518447934]
本稿では,3次重み付けニューラルネットワークと連想プロセッサのアルゴリズム最適化の組み合わせについて検討する。
演算強度を低減し,APの畳み込みを最適化する新しいコンパイルフローを提案する。
本研究では,イメージネット上でのResNet-18推論のエネルギー効率を,クロスバーメモリアクセラレータと比較して7.5倍向上させる。
論文 参考訳(メタデータ) (2024-01-23T10:27:38Z) - Blockwise Parallel Transformer for Large Context Models [70.97386897478238]
Blockwise Parallel Transformer (BPT) は、メモリコストを最小限に抑えるために、自己アテンションとフィードフォワードネットワーク融合のブロックワイズ計算である。
メモリ効率を維持しながら、長い入力シーケンスを処理することにより、BPTはバニラ変換器の32倍、以前のメモリ効率の4倍のトレーニングシーケンスを可能にする。
論文 参考訳(メタデータ) (2023-05-30T19:25:51Z) - Mesa: A Memory-saving Training Framework for Transformers [58.78933015299703]
本稿では,トランスフォーマーのためのメモリ節約トレーニングフレームワークであるMesaを紹介する。
Mesaは、フォワードパス中に正確なアクティベーションを使用し、低精度のアクティベーションを格納することで、トレーニング中のメモリ消費を減らす。
ImageNet、CIFAR-100、ADE20Kの実験は、Mesaがトレーニング中にメモリフットプリントの半分を削減できることを示した。
論文 参考訳(メタデータ) (2021-11-22T11:23:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。