論文の概要: Multi-primitive in-memory computing for Monte Carlo tree search
- arxiv url: http://arxiv.org/abs/2607.22869v1
- Date: Fri, 24 Jul 2026 19:17:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.915697
- Title: Multi-primitive in-memory computing for Monte Carlo tree search
- Title(参考訳): モンテカルロ木探索のためのマルチプリミティブインメモリ計算
- Abstract要約: モンテカルロ木探索(MCTS)は人工知能(AI)による意思決定を可能にするが、従来のプロセッサでは55-300Wを必要とする。
本稿では,各アルゴリズムの位相をハードウェアネイティブなIMCプリミティブとして再構成するフェーズ・ツー・プライミティブ分解を提案する。
IMC-MCTSは9x9 Goで60mWを消費し、中央処理ユニットの96倍のエネルギー効率を達成する。
- 参考スコア(独自算出の注目度): 7.065942969159708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Monte Carlo tree search (MCTS) enables artificial intelligence (AI) decision-making, but requires 55-300 W on conventional processors, limiting edge deployment. In-memory computing (IMC) is energy-efficient on regular workloads but has been considered incompatible with irregular multi-phase algorithms. We introduce phase-to-primitive decomposition, which reformulates each algorithmic phase as a hardware-native IMC primitive. Applied to MCTS, selection, expansion, rollout and backpropagation map to content-addressable memory, combinational logic, a resistive random-access memory (RRAM) crossbar and static random-access memory, keeping search on chip. At 22 nm with fabricated RRAM-array parameters, IMC-MCTS consumes ~60 mW for 9x9 Go, achieving 96x energy efficiency over a central processing unit (CPU) and 65x-2,059x over an H100 graphics processing unit (GPU). It reaches a European Go Federation rating within sample-size uncertainty of open-source Go engines (Pachi-UCT and Michi-C). The same substrate runs eight applications across four AI domains.
- Abstract(参考訳): モンテカルロ木探索(MCTS)は、人工知能(AI)による意思決定を可能にするが、従来のプロセッサでは55-300Wが必要であり、エッジデプロイメントを制限している。
インメモリコンピューティング(IMC)は、通常のワークロードではエネルギー効率が高いが、不規則な多相アルゴリズムとは互換性がないと考えられている。
本稿では,各アルゴリズムの位相をハードウェアネイティブなIMCプリミティブとして再構成するフェーズ・ツー・プライミティブ分解を提案する。
MCTSでは、選択、拡張、ロールアウト、バックプロパゲーションマップをコンテント順応可能なメモリ、組合せ論理、抵抗性ランダムアクセスメモリ(RRAM)クロスバーと静的ランダムアクセスメモリに適用し、チップの検索を継続した。
製造されたRRAMアレイパラメータを持つ22nmでは、MCTSは9x9 Goで60mWを消費し、中央処理ユニット(CPU)では96倍、H100グラフィックス処理ユニット(GPU)では65x-2,059倍のエネルギー効率を実現している。
オープンソースのGoエンジン(Pachi-UCTとMichi-C)のサンプルサイズの不確実性の中で、欧州Goフェデレーションの格付けに達する。
同じ基板は、4つのAIドメインにまたがる8つのアプリケーションを実行する。
関連論文リスト
- Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - Mixed-Precision Training and Compilation for RRAM-based Computing-in-Memory Accelerators [0.8708298560474775]
CIMアーキテクチャのための混合精度トレーニングおよびコンパイルフレームワークを提案する。
最大の課題は巨大な検索スペースであり、優れた量子化パラメータを見つけるのが難しくなる。
最良の場合、我々の手法は既存の最先端ソリューションよりも2.48倍のスピードアップを達成し、精度の損失は0.086%である。
論文 参考訳(メタデータ) (2026-01-29T13:54:55Z) - SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations [54.303301888915406]
混合エキスパートモデル(MoE)は、計算コストを大幅に増加させることなく、言語モデルをスケールアップするためのデファクトアーキテクチャとして登場した。
最小のアクティベーションキャッシングでMoEの前後パスを計算するメモリ効率のアルゴリズムを提案する。
また,グループ化されたGEMMカーネルのパディングによる無駄計算を最小限に抑える新しい「トークンラウンドリング」手法を提案する。
論文 参考訳(メタデータ) (2025-12-16T04:39:10Z) - KScaNN: Scalable Approximate Nearest Neighbor Search on Kunpeng [46.35664429179457]
既存のx86 ANNSアルゴリズムをARMプラットフォームに移植すると、性能が大幅に低下する。
我々は、Kunpeng 920 ARMアーキテクチャ用に設計された新しいANNSアルゴリズムであるKScaNNを紹介する。
論文 参考訳(メタデータ) (2025-11-05T09:01:32Z) - OISMA: On-the-fly In-memory Stochastic Multiplication Architecture for Matrix-Multiplication Workloads [0.2796197251957244]
OISMAは、準確率計算領域(Bent-Pyramidシステム)の計算単純性を利用する、新しいインメモリコンピューティングアーキテクチャである。
OISMAは通常のメモリ読み取り操作を、無視できるコストでインサイト乗算操作に変換する。
精度は平均相対的なフロベニウス誤差を 9.42% (4x4) から 1.81% (512x512) に減少させる。
論文 参考訳(メタデータ) (2025-08-12T10:24:33Z) - MEMHD: Memory-Efficient Multi-Centroid Hyperdimensional Computing for Fully-Utilized In-Memory Computing Architectures [7.990774970571298]
MEMHDはメモリ効率の良いマルチセントロイドHDCフレームワークであり、これらの課題に対処するために設計されている。
提案手法は,IMCアレイの完全活用を実現し,一発(あるいは数発)連想探索を可能にする。
MEMHDは、ベースラインIMCマッピング法と比較して、計算サイクルを最大80倍、配列使用量を最大71倍削減する。
論文 参考訳(メタデータ) (2025-02-11T00:53:15Z) - Pruning random resistive memory for optimizing analogue AI [54.21621702814583]
AIモデルは、エネルギー消費と環境持続可能性に前例のない課題を提示する。
有望な解決策の1つは、アナログコンピューティングを再考することである。
ここでは、構造的塑性に着想を得たエッジプルーニングを用いたユニバーサルソリューション、ソフトウェア・ハードウエアの共設計について報告する。
論文 参考訳(メタデータ) (2023-11-13T08:59:01Z) - A 65nm 8b-Activation 8b-Weight SRAM-Based Charge-Domain Computing-in-Memory Macro Using A Fully-Parallel Analog Adder Network and A Single-ADC Interface [16.228299091691873]
コンピューティング・イン・メモリ(Computer-in-Memory, CiM)は、メモリ内の多重累積演算を可能にする、有望な緩和手法である。
この研究は、CIFAR-10データセットで88.6%の精度を示しながら、51.2GOPSのスループットと10.3TOPS/Wエネルギー効率を達成する。
論文 参考訳(メタデータ) (2022-11-23T07:52:10Z) - EAutoDet: Efficient Architecture Search for Object Detection [110.99532343155073]
EAutoDetフレームワークは、1.4GPU日でオブジェクト検出のための実用的なバックボーンとFPNアーキテクチャを検出できる。
本稿では,一方のエッジ上での候補演算の重みを共有し,それらを一つの畳み込みに集約することでカーネル再利用手法を提案する。
特に、発見されたアーキテクチャは最先端のオブジェクト検出NAS法を超越し、120 FPSで40.1 mAP、49.2 mAP、41.3 FPSをCOCOテストデブセットで達成している。
論文 参考訳(メタデータ) (2022-03-21T05:56:12Z) - Accelerating Markov Random Field Inference with Uncertainty
Quantification [10.825800519362579]
確率的アルゴリズムは従来のプロセッサでは計算コストがかかります
それらの統計的性質、すなわち解釈可能性と不確実量化(UQ)は、魅力的な代替手法である。
マルコフ確率場(MRF)推論のための高スループット加速器を提案する。
また、UQを効率的にサポートするための新しいハイブリッドオンチップ/オフチップメモリシステムとロギング方式を提案する。
論文 参考訳(メタデータ) (2021-08-02T00:02:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。