論文の概要: A Feature-Major Codebook for Memory-Efficient Sparse-Binary Self-Organizing Maps: Scaling a MEDLINE Atlas to 1.05 Million Neurons on a Single Consumer GPU
- arxiv url: http://arxiv.org/abs/2608.24067v2
- Date: Wed, 02 Sep 2026 06:52:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.278966
- Title: A Feature-Major Codebook for Memory-Efficient Sparse-Binary Self-Organizing Maps: Scaling a MEDLINE Atlas to 1.05 Million Neurons on a Single Consumer GPU
- Title(参考訳): メモリ効率の良いスパースバイナリ自己組織化マップのための特徴量コードブック:単一のコンシューマGPU上でMEDLINE Atlasを1.05万ニューロンにスケーリングする
- Abstract要約: MEDLINEスケールで自己組織化マップを構築するのは現実的ではありません。
このボトルネックは、主にコードブックレイアウトの成果です。
実装、精度、更新ルールが固定されたレイアウトのみを変更すれば、BMU検索は4.5-8.5xに高速化される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Building a self-organising map at MEDLINE scale has been impractical: the best-matching-unit (BMU) search that dominates training is bound by the bandwidth needed to read the codebook every epoch. I show that this bottleneck is largely an artefact of codebook layout. Storing it feature-major with each feature's weights contiguous, W[v.M+i], recasts the search as a tiled sparse-dense product in which every loaded weight column is reused across a tile of samples. Varying only the layout, with implementation, precision and update rule held fixed, accelerates the BMU search by 4.5-8.5x, and because an exact-argmin BMU is invariant to codebook layout, this costs nothing: held-out quantisation error agrees with a cuSPARSE baseline to within 0.5% at every map size. The advantage is a crossover: cuSPARSE.SOM is faster at small maps, SparseBin.SOM is 1.5x faster at 128x128 and 2.6x at 256x256, and at 512x512 it is the only one that runs on 24 GB without re-engineering its memory path. Paired with a radius-independent box-blur update and a convergence-based stopping rule, it trains a converged map over 29.9 million MEDLINE articles in about 72 s at 64x64 on one 24 GB GPU, and fits 262,144 neurons (512x512) where every alternative I tested exceeds memory; on a 141 GB H200 it reaches 1,048,576 neurons (1024x1024), to my knowledge the largest self-organising map yet reported. Held-out error follows a smooth power law with no elbow across three decades of map size. At matched work, in the configuration benchmarked here, the design is ~82x faster than MedSOM and, at 128x128, 621x faster than the best multicore-CPU library. A post-submission addendum, tuning both implementations symmetrically, accelerates the search a further 5.6-10.1x, brings that 64x64 run to about 13 s, removes the crossover, raises those margins to ~385x and ~3,000x, and narrows two mechanism claims.
- Abstract(参考訳): MEDLINEスケールで自己組織化マップを構築するのは現実的ではない。トレーニングを統括するBMU(Best-matching-unit)検索は、コードブックを読むのに必要な帯域幅に縛られている。
このボトルネックは、主にコードブックレイアウトの成果です。
特徴量に対して各特徴量W[v.M+i]を連続的に当てはめ、全ての積載重量列がサンプルのタイルにまたがって再利用されるタイル付きスパースセンス製品として検索を再キャストする。
実装、精度、更新ルールが固定されたレイアウトのみを無効にすることで、BMUの検索は4.5-8.5xに加速し、正確なArgmin BMUはコードブックレイアウトに不変であるため、これは何のコストもかからない。
cuSPARSE.SOMは小さな地図ではより高速、SparseBin.SOMは128x128で1.5倍、256x256で2.6倍、メモリパスを再設計することなく24GBで動作するのは512x512のみである。
半径非依存のボックスブルーの更新と収束ベースの停止規則によって、24GBのGPUで約72秒間、64x64で29.9百万個のMEDLINE記事の収束マップをトレーニングし、テストした全ての代替品がメモリを超える262,144個のニューロン(512x512)に適合する。
ヘルドアウト誤差は、30年の地図サイズで肘のない滑らかな電力法則に従う。
ここでベンチマークされた設定では、設計はMedSOMの約82倍高速で、128x128、最高のマルチコアCPUライブラリの621倍高速である。
両方の実装を対称に調整し、さらに5.6-10.1xの探索を加速し、64x64が約13秒まで走り、クロスオーバーを除去し、それらのマージンを385xと3000xに上げ、2つのメカニズムのクレームを狭める。
関連論文リスト
- From 80x to 385x: A Best-Matching-Unit Search at the L2 Roof, Measured Against a Symmetrically Tuned Baseline [0.0]
私は、新しいSOMアルゴリズム(SparseBin)と、それと比較されたベースラインアルゴリズム(cuSPARSE)の両方をチューニングしたプログラムを報告します。
自己組織化マップトレーニングを統括する最良マッチングユニット探索は、4つのレバーで調整された。
チューニングされたカーネルはL2バンド幅の屋根をピークの77%、他のユニットは40-65%、さらにレバーは1.3倍に制限した。
論文 参考訳(メタデータ) (2026-09-04T13:38:42Z) - Unfolding the Leech Lattice: Fused Multi-Shell Decoding and VRAM Layouts for 2-Bit LLM Weights [8.550323073861415]
リーチ格子ベクトル量子化は、最強の報告された2ビット品質を独自の評価プロトコルで保持する。
本報告では, バッチ1におけるデコード相GEMVの供用コストを計測する。
論文 参考訳(メタデータ) (2026-09-02T14:26:06Z) - A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi [0.0]
このレポートはハードウェアを維持し、適合するモデルに何ができるかを尋ねる。
SigLIP2エンコーダとウィンドウアテンションマージを組み合わせた,現代的なマルチモーダルアシスタントであるMini-V-4.6をデプロイする。
システムは、画像質問のエンドツーエンドを1.7秒で答える。
論文 参考訳(メタデータ) (2026-07-16T04:48:44Z) - Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - TileMaxSim: IO-Aware GPU MaxSim Scoring with Dimension Tiling and Fused Product Quantization [3.3723515662362265]
ColBERTのようなマルチベクトル検索モデルは、きめ細かいトークンレベルのMaxSimスコアリングによって最先端の精度を達成する。
既存のGPU実装は、ほとんどのハードウェア性能を未使用のままにしている。
私たちは、このギャップを埋めるIO対応のTritonカーネルのファミリーであるTileMaxSimを紹介します。
論文 参考訳(メタデータ) (2026-06-24T23:03:56Z) - Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode [0.0]
物理AIシステムは、クラウドのLLMサービスとは異なるワークロードを実行する。
4つのNVIDIA GPUにわたる7から8BクラスのGQA変換器のバッチ1デコードを測定する。
ピーク帯域幅はピーク帯域幅が増加するにつれて減少する。
論文 参考訳(メタデータ) (2026-05-28T21:03:14Z) - ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems [51.56484100374058]
LongMemEval-500では、ZenBrainは長いコンテキストのオラクルのバイナリ・ジャッジの精度を4.5pp以内と一致させる。
ZenBrainは7層の神経科学にインスパイアされたメモリアーキテクチャである。
論文 参考訳(メタデータ) (2026-04-26T20:39:19Z) - A Survey of Spatial Memory Representations for Efficient Robot Navigation [4.560386676154887]
52のシステムにまたがる88の参照の空間記憶効率の問題を調査した。
M_textpeak / M_textmap$は、ピーク時メモリ(操作中に消費される全RAMまたはGPUメモリ)と保存されたマップサイズとの比率である。
論文 参考訳(メタデータ) (2026-04-13T02:12:17Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - Chronicals: A High-Performance Framework for LLM Fine-Tuning with 3.51x Speedup over Unsloth [0.0]
Unsloth上で3.5倍のスピードアップを実現したオープンソースのトレーニングフレームワークであるCentralsを紹介します。
オンラインのソフトマックスの正しさ、FlashAttention IO complexity O(N2 d2 M-1)、LoRA+学習速度勾配近似など、完全な数学的基礎を提供する。
論文 参考訳(メタデータ) (2026-01-06T00:00:55Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - Towards Memory-Efficient Training for Extremely Large Output Spaces --
Learning with 500k Labels on a Single Commodity GPU [2.3224617218247134]
巨大な出力空間(数百万ラベルまで)の分類問題では、最後の層は膨大な量のメモリを必要とする。
スパース接続を使用することで、メモリ要求が大幅に削減されるが、モデルの性能が大幅に低下する可能性がある。
提案手法は,わずか4GBのGPU上で670,000ラベルのデータセットにスケール可能であることを示す。
論文 参考訳(メタデータ) (2023-06-06T14:44:52Z) - MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning [72.80896338009579]
メモリボトルネックは畳み込みニューラルネットワーク(CNN)の設計における不均衡なメモリ分布に起因する。
本稿では,ピークメモリを大幅に削減するパッチ・バイ・パッチ・推論スケジューリングを提案する。
ニューラルアーキテクチャサーチによるプロセスを自動化し、ニューラルアーキテクチャと推論スケジューリングを共同で最適化し、MCUNetV2に導いた。
論文 参考訳(メタデータ) (2021-10-28T17:58:45Z) - Efficient and Generic 1D Dilated Convolution Layer for Deep Learning [52.899995651639436]
幅広いパラメータをカバーする汎用的な1D畳み込み層の効率的な実装を紹介します。
特にIntel AVX-512とAVX-512 BFloat16命令を含むアーキテクチャ向けに最適化されている。
本稿では,最適化された1次元畳み込み層の性能を,実際のゲノミクスデータセットを用いたエンドツーエンドニューラルネットワークトレーニングで実証する。
論文 参考訳(メタデータ) (2021-04-16T09:54:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。