論文の概要: GPUSparse: GPU-Accelerated Learned Sparse Retrieval with Parallel Inverted Indices
- arxiv url: http://arxiv.org/abs/2606.26441v1
- Date: Wed, 24 Jun 2026 23:07:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.097552
- Title: GPUSparse: GPU-Accelerated Learned Sparse Retrieval with Parallel Inverted Indices
- Title(参考訳): GPUSparse: 並列反転インデックスによるGPUによる学習スパース検索
- Abstract要約: 本稿では,GPUを高速化した正確なスパース検索システムであるGPUSparseを提案する。
ブロック整列されたワープ対応のポストリストを持つGPU並列逆インデックスを使用する。
Batched scatter-add スコアリングアルゴリズムは数百のクエリを同時に処理する。
- 参考スコア(独自算出の注目度): 3.3723515662362265
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learned sparse retrieval models such as SPLADE achieve retrieval quality competitive with dense models while preserving the interpretability and exact-match advantages of sparse representations. However, inference-time scoring still relies on CPU-bound inverted index traversal algorithms (WAND, Block-Max WAND), creating a fundamental bottleneck for real-time serving at scale. We present GPUSparse, a system for GPU-accelerated exact learned sparse retrieval that introduces: (1) a GPU-parallel inverted index with block-aligned, warp-coalesced posting lists; (2) a batched scatter-add scoring algorithm that processes hundreds of queries simultaneously; and (3) fused Triton kernels with an analysis of the tradeoff between work-efficiency and hardware utilization. On MS MARCO passage ranking (8.8M passages) with real SPLADE embeddings, GPUSparse matches CPU exact scoring to three decimals (MRR@10=0.383, equal to Pyserini SPLADE at this precision; Recall@1000>=0.999 vs. dense matmul, the residual from floating-point tie-breaking) while providing a 235x speedup over Pyserini CPU at 8.8M documents (1.27ms vs. 298ms per query). Compared to Seismic (the fastest CPU sparse retrieval system), which trades 25% recall for speed (R@1000=0.738 vs. 0.983 exact), GPUSparse achieves exact scoring at 787 QPS throughput (batch 500) on the full 8.8M collection, with 1.3ms per query. Our document-parallel kernel reaches 62.6% of H100 peak HBM bandwidth, revealing a fundamental work-efficiency vs. bandwidth-efficiency tradeoff in GPU sparse retrieval. The reformulation of sparse scoring as scatter-add over an inverted index is shared with SPARe's iterative mode; our contribution is its fused-kernel realization, which we measure to be 23-270x faster than a faithful SPARe iterative reimplementation.
- Abstract(参考訳): SPLADEのような学習されたスパース検索モデルは、スパース表現の解釈可能性と正確なマッチングの利点を保ちながら、高密度モデルと競合する検索品質を実現する。
しかし、推論時スコアリングは依然としてCPUバウンドの逆インデックストラバーサルアルゴリズム(WAND、Block-Max WAND)に依存しており、大規模なリアルタイムサービスにおいて基本的なボトルネックを生み出している。
本稿では,GPUを高速化した正確なスパース検索システムであるGPUSparseについて紹介する。(1)ブロック整列,ワープ共役なポストリストを持つGPU並列逆インデックス,(2)数百のクエリを同時に処理するバッチスキャッタ付加評価アルゴリズム,(3)作業効率とハードウェア利用のトレードオフを解析した融合トリトンカーネル。
実際のSPLADEを埋め込んだMS MARCOパスランキング(8.8Mパス)では、GPUSparseはCPUの正確なスコアを3つの10進数(MRR@10=0.383、この精度でPyserini SPLADEに等しい)とマッチングする。
25%のリコールをスピード(R@1000=0.738 vs. 0.983)で処理する耐震性(最速のCPUスパース検索システム)と比較して、GPUSparseは8.8Mのコレクションで787 QPSスループット(バッチ500)の正確なスコアを1クエリあたり1.3msで達成している。
文書並列カーネルはH100ピークHBM帯域幅の62.6%に達し,GPUスパース検索における基本的作業効率と帯域幅効率のトレードオフを明らかにした。
逆指標によるスパーススコアの補正は、SPAReの反復モードと共有され、我々の貢献は、その融合カーネル実現であり、忠実なSPARe反復再実装よりも23-270倍高速である。
関連論文リスト
- SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System [45.52961410486319]
本稿では,各行列,演算子,ターゲットGPU用のGPUカーネルを構築するLLMベースのシステムであるSparseDittoを提案する。
SparseDittoは、統一設計フレームワークでSpMV、SpMM、SpGEMMをサポートする。
生成されたSpMMカーネルは、最大3.39倍のフルバッチGCNトレーニングを加速する。
論文 参考訳(メタデータ) (2026-08-05T16:41:03Z) - TileMaxSim: IO-Aware GPU MaxSim Scoring with Dimension Tiling and Fused Product Quantization [3.3723515662362265]
ColBERTのようなマルチベクトル検索モデルは、きめ細かいトークンレベルのMaxSimスコアリングによって最先端の精度を達成する。
既存のGPU実装は、ほとんどのハードウェア性能を未使用のままにしている。
私たちは、このギャップを埋めるIO対応のTritonカーネルのファミリーであるTileMaxSimを紹介します。
論文 参考訳(メタデータ) (2026-06-24T23:03:56Z) - Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices [18.428868416628017]
本稿では,中程度間隔の大規模言語モデル(LLM)に対する効率的な推論手法を提案する。
SpInferで最大1.64倍のスピードアップを実現し、FlashLLMで最大1.41倍のエンドツーエンドスピードアップを実現している。
論文 参考訳(メタデータ) (2026-06-13T13:38:27Z) - Fast Log-Domain Sinkhorn Optimal Transport with Warp-Level GPU Reductions [1.6679662639178268]
我々は、log-domain Sinkhornアルゴリズムの軽量でネイティブな実装であるFastSinkhornを提案する。
我々の解法はログドメインで完全に動作し、標準ドメインメソッドが失敗するepsilon = 10-4のように、正規化パラメータの計算を可能にする。
画像色変換, 3次元点雲マッチング, 収束解析について検証し, 注意深い数値処理を施したネイティブカーネルが, 大規模最適輸送のための実用的で効率的な基盤となることを示した。
論文 参考訳(メタデータ) (2026-04-04T16:06:27Z) - FastLoop: Parallel Loop Closing with GPU-Acceleration in Visual SLAM [8.555551861128174]
本稿では,この計算複雑性を緩和するGPUアクセラレーションループ閉包モジュールであるFastLoopを提案する。
視覚SLAMのループクローズパイプラインにおける重要なパフォーマンスボトルネックを特定し、GPU上での並列最適化を通じてそれらに対処する。
論文 参考訳(メタデータ) (2026-03-17T23:04:48Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - GPU-Accelerated Interpretable Generalization for Rapid Cyberattack Detection and Forensics [0.0]
IGメカニズムは最近IEEE Transactions on Information Forensics and Securityで公開され、最先端のエビデンスベースの侵入検知を提供する。
我々は、PyTorchの再設計であるIG-GPUを紹介し、すべてのペアの交叉とサブセット評価をコモディティGPUにオフロードする。
15kレコードのNSL-KDDデータセットでは、IG-GPUはIGのマルチコアCPU実装よりも116倍のスピードアップを示している。
論文 参考訳(メタデータ) (2025-07-16T12:38:19Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Speedy MASt3R [68.47052557089631]
MASt3Rは、DUSt3Rを活用して高速な相互マッチング方式を導入することで、画像マッチングを3Dタスクとして再定義する。
高速MASt3Rは、精度を犠牲にすることなく、推論時間(画像ペアあたり198msから91ms)を54%削減する。
この進歩により、リアルタイムな3D理解が可能になり、複合現実ナビゲーションや大規模3Dシーン再構築といったアプリケーションに恩恵をもたらす。
論文 参考訳(メタデータ) (2025-03-13T03:56:22Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - TorchSparse++: Efficient Training and Inference Framework for Sparse
Convolution on GPUs [20.4238781638402]
スパース畳み込みは、AR/VRにおけるポイントクラウド処理、自動運転、レコメンデーションシステムにおけるグラフ理解など、新興ワークロードにおいて重要な役割を果たす。
既存のGPUライブラリはスパース畳み込みのための2つのデータフロー型を提供する。
TorchSparse++は、両方の世界のベストを達成するための新しいGPUライブラリです。
論文 参考訳(メタデータ) (2023-10-25T21:02:38Z) - Providing Meaningful Data Summarizations Using Examplar-based Clustering
in Industry 4.0 [67.80123919697971]
我々は,従来のCPUアルゴリズムと比較して,一精度で最大72倍,半精度で最大452倍の高速化を実現していることを示す。
提案アルゴリズムは射出成形プロセスから得られた実世界のデータに適用し, 得られたサマリーが, コスト削減と不良部品製造の削減のために, この特定のプロセスのステアリングにどのように役立つかについて議論する。
論文 参考訳(メタデータ) (2021-05-25T15:55:14Z) - IRLI: Iterative Re-partitioning for Learning to Index [104.72641345738425]
分散環境でのロードバランスとスケーラビリティを維持しながら、高い精度を得る方法とのトレードオフが必要だ。
クエリ項目関連データから直接バケットを学習することで、アイテムを反復的に分割するIRLIと呼ばれる新しいアプローチを提案する。
我々は,irliが極めて自然な仮定の下で高い確率で正しい項目を検索し,優れた負荷分散を実現することを数学的に示す。
論文 参考訳(メタデータ) (2021-03-17T23:13:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。