論文の概要: Hoss: Fast Oblivious Semantic Search with Heterogeneous GPU-CPU-TEE Architecture
- arxiv url: http://arxiv.org/abs/2609.04522v1
- Date: Thu, 03 Sep 2026 22:21:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.841406
- Title: Hoss: Fast Oblivious Semantic Search with Heterogeneous GPU-CPU-TEE Architecture
- Title(参考訳): Hoss: 異種GPU-CPU-TEEアーキテクチャによる高速なセマンティック検索
- Abstract要約: 現在の曖昧なセマンティックサーチシステムであるCompassは、大きなオーバーヘッドを発生させる。
ヘテロジニアスCPU-GPU TEEアーキテクチャを用いた,一意の難解なセマンティックサーチシステムを提案する。
Hossはハイリコールを維持しながら67倍のスピードアップを達成する。
- 参考スコア(独自算出の注目度): 13.990684047479578
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Semantic search is widely deployed in modern AI systems, but protecting both data contents and access patterns remains challenging. The current state-of-the-art system, Compass, achieves oblivious semantic search by building an optimized ORAM over HNSW graphs. However, even with aggressive optimizations, it still incurs large overheads. Closing this performance gap is fundamentally difficult: Compass has already removed most cryptographic overheads, leaving ORAM accesses as the dominant cost, which are constrained by well-known Omega(log N) bandwidth lower bounds. Our key insight is that traditional ORAM overhead stems from the assumption of limited private memory, whereas modern GPU TEEs provide large private memory (Pmem) that blinds internal access patterns (Hunt et al., NSDI '23). This shift opens a new design space. We therefore propose Hoss, a first-of-its-kind oblivious semantic search system with a heterogeneous CPU-GPU TEE architecture that supports fast, scalable search with low cost of ownership. In Hoss, the GPU TEE's large Pmem hosts the hot-path HNSW traversal, while the lower layers of the graph, if they exceed GPU capacity, are offloaded to CPU TEEs. The system invokes oblivious primitives only when accessing these lower layers. The availability of large Pmem also enables new optimization opportunities. For example, Hoss features a host-access ORAM mechanism that goes beyond traditional performance constraints and incorporates several data-dependent optimizations that are not possible in prior designs. We implement a prototype of Hoss and benchmark it against Compass. Our results show that Hoss achieves up to 67x speedup while maintaining high recall, with larger gains at scale.
- Abstract(参考訳): セマンティック検索は現代のAIシステムに広く採用されているが、データの内容とアクセスパターンの両方を保護することは依然として難しい。
現在の最先端システムであるCompassは、HNSWグラフ上に最適化されたORAMを構築することで、難解なセマンティック検索を実現する。
しかし、アグレッシブな最適化であっても、大きなオーバーヘッドを発生させる。
Compassはすでにほとんどの暗号オーバーヘッドを取り除き、ORAMアクセスを主要なコストとして残しており、よく知られたOmega(log N)帯域幅の低いバウンダリに制約されている。
従来のORAMオーバーヘッドは、限られたプライベートメモリの仮定に由来するが、最近のGPU TEEは、内部アクセスパターンを無視する大きなプライベートメモリ(Pmem)を提供する(Hunt et al , NSDI '23)。
このシフトは、新しいデザイン空間を開く。
そこで我々は,高速でスケーラブルな検索を低コストでサポートするヘテロジニアスCPU-GPU TEEアーキテクチャを備えた,難解なセマンティックサーチシステムHossを提案する。
Hossでは、GPU TEEの大規模PmemはホットパスのHNSWトラバースをホストし、グラフの下位層はGPU容量を超えるとCPU TEEにオフロードされる。
このシステムは、これらの下位層にアクセスする場合にのみ、曖昧なプリミティブを起動する。
大規模なPmemが利用可能になったことで、新たな最適化の機会がもたらされる。
例えばHossは、従来のパフォーマンス制約を超えて、以前の設計では不可能ないくつかのデータ依存最適化を組み込んだホストアクセスORAMメカニズムを備えている。
私たちはHossのプロトタイプを実装し、Compassに対してベンチマークします。
以上の結果から,Hossはハイリコールを維持しながら最大67倍の高速化を実現し,大規模に向上した。
関連論文リスト
- GRAB-ANNS: High-Throughput Indexing and Hybrid Search via GPU-Native Bucketing [39.763467046232584]
動的ハイブリッド検索のためのGPUネイティブグラフインデックスであるGRAB-ANNSを提案する。
GRAB-ANNSは最新のCPUベースシステムよりも最大240.1倍高いクエリスループットと12.6倍高速なインデックス構築を実現する。
論文 参考訳(メタデータ) (2026-03-31T11:00:10Z) - GPU-Accelerated Algorithms for Graph Vector Search: Taxonomy, Empirical Study, and Research Directions [54.570944939061555]
本稿では,GPU加速グラフに基づくベクトル探索アルゴリズムについて包括的に研究する。
我々は、GPU最適化戦略の詳細な分類を確立し、アルゴリズムタスクとハードウェア実行ユニット間のマッピングを明確にする。
我々の発見は、スケーラブルで堅牢なGPUベースの近接検索システムを設計するための明確なガイドラインを提供する。
論文 参考訳(メタデータ) (2026-02-10T16:18:04Z) - GPU-Accelerated ANNS: Quantized for Speed, Built for Change [1.8419317899207142]
現在の近似近傍探索(ANNS)システムは3つの重要な制限に直面している。
現在のシステムでは、コストのかかるランダムなメモリアクセスを導入することなく、データ移動を減らす効率的な量子化技術が欠如している。
本稿では、高いクエリスループットとアップビリティを備えたGPUアクセラレーションANNSシステムであるJasperを紹介する。
論文 参考訳(メタデータ) (2026-01-11T19:51:54Z) - FaST: Efficient and Effective Long-Horizon Forecasting for Large-Scale Spatial-Temporal Graphs via Mixture-of-Experts [49.9321870703948]
既存のモデルは、主に短期水平予測に焦点を当てており、悪名高い計算コストとメモリ消費に悩まされている。
本稿では,長期・大規模STG予測のためのMixture-of-Experts(MoEs)に基づく,効率的かつ効率的なフレームワークであるFaSTを提案する。
まず、計算負担を軽減するための適応型グラフエージェントアテンション機構を提案する。
第2に,従来のフィードフォワードネットワークを Gated Linear Units (GLUs) に置き換えた新しい並列MoEモジュールを提案する。
論文 参考訳(メタデータ) (2026-01-08T18:00:58Z) - Theodosian: A Deep Dive into Memory-Hierarchy-Centric FHE Acceleration [3.8153115302044296]
完全同型暗号化(FHE)は、暗号化されたデータに対するセキュアな計算を可能にし、クラウドおよびエッジ環境におけるプライバシー上の懸念を軽減する。
本稿では,最新のGPU上で一般的なFHE方式であるCKKSのマイクロアーキテクチャ解析を行う。
高帯域幅のL2キャッシュであっても、支配的なカーネルはメモリ帯域幅で束縛され、永続的なメモリ壁が露出することを示す。
これらの知見に触発されて,キャッシュ効率の向上とオーバーヘッド削減を目的とした,相補的でメモリ対応の最適化セットであるTheodosianを紹介した。
論文 参考訳(メタデータ) (2025-12-20T12:18:29Z) - BOLT: Bandwidth-Optimized Lightning-Fast Oblivious Map powered by Secure HBM Accelerators [13.90111222973057]
クラウド実行環境は、パターンリークへのアクセスに対して脆弱である。
Oblivious Mapsは、アクセスパターンを隠すことによってこれを緩和するが、高いオーバーヘッドに悩まされる。
本稿では,光速OMAP加速器BOLTについて述べる。
論文 参考訳(メタデータ) (2025-09-01T19:49:21Z) - A Parallel CPU-GPU Framework for Cost-Bounded DFS with Applications to IDA* and BTS [13.186524200050957]
本稿では,深度第一探索におけるGPU計算手法を提案する。
これは、Iterative Deepening A* (IDA*)アルゴリズムの拡張であるemphsynchronous IDA*のようなアルゴリズムを作成するために使用される。
本研究では, 3x3 の Rubik Cube と 4x4 のスライディングタイルパズル (STP) に対するアプローチを評価し,GPU 操作を DFS で効率的にバッチ化可能であることを示す。
論文 参考訳(メタデータ) (2025-07-16T05:07:33Z) - MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs [55.95879347182669]
MoEアーキテクチャは、推論コストの比例的な増加なしにモデルキャパシティを向上できることで有名である。
MoE-LightningはCPU-GPU-I/OパイプラインスケジュールであるCGOPipeを導入し、ページ重み付けにより高いリソース利用を実現する。
MoE-Lightningは、単一のT4 GPU(16GB)上でMixtral 8x7Bの最先端オフロード可能なLLM推論システムよりも最大10.3倍高いスループットを実現することができる
論文 参考訳(メタデータ) (2024-11-18T01:06:12Z) - FusionAI: Decentralized Training and Deploying LLMs with Massive
Consumer-Level GPUs [57.12856172329322]
我々は、巨大な未使用のコンシューマレベルのGPUをアンロックする分散システムを構想する。
このシステムは、CPUとGPUメモリの制限、ネットワーク帯域幅の低さ、ピアとデバイスの多様性など、重要な課題に直面している。
論文 参考訳(メタデータ) (2023-09-03T13:27:56Z) - Communication-Efficient Graph Neural Networks with Probabilistic
Neighborhood Expansion Analysis and Caching [59.8522166385372]
大規模グラフ上でのグラフニューラルネットワーク(GNN)のトレーニングと推論は、GNNの登場以来活発に研究されている。
本稿では,分散環境におけるノードワイドサンプリングを用いたGNNによるミニバッチ学習と推論について述べる。
分割された特徴データを扱うために,従来のSALIENTシステムを拡張したSALIENT++を提案する。
論文 参考訳(メタデータ) (2023-05-04T21:04:01Z) - ASH: A Modern Framework for Parallel Spatial Hashing in 3D Perception [91.24236600199542]
ASHは、GPU上の並列空間ハッシュのためのモダンで高性能なフレームワークである。
ASHはより高いパフォーマンスを実現し、よりリッチな機能をサポートし、より少ないコード行を必要とする。
ASHとそのサンプルアプリケーションはOpen3Dでオープンソース化されている。
論文 参考訳(メタデータ) (2021-10-01T16:25:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。