論文の概要: A Unified Benchmark for Privacy-preserving Vector Search
- arxiv url: http://arxiv.org/abs/2608.01192v1
- Date: Sun, 02 Aug 2026 12:16:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.115515
- Title: A Unified Benchmark for Privacy-preserving Vector Search
- Title(参考訳): プライバシー保護ベクトル探索のための統一ベンチマーク
- Abstract要約: ベクトル探索はセマンティックサーチ、レコメンデーションシステム、検索強化ジェネレーション(RAG)を利用する
設計上、クエリに応答するサービスは、クエリの埋め込みと、通常、マッチするコーパスの両方を見ることができる。
暗号化スキーム(SAP, EMVP, BNTM, Tip-toe など)のファミリーがそのリークに対処する。
各スキームは、自身のコーパス、脅威モデル、パラメータの選択、ハードウェア、およびメートル法で公開され評価されるので、数値を直接比較することはできない。
- 参考スコア(独自算出の注目度): 3.494935876363005
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vector search powers semantic search, recommendation systems, and retrieval-augmented generation (RAG). By design, the service answering a query sees both the query embedding and, usually, the corpus against which it is matched. This is a privacy breach for both the user issuing the query and the owner of the corpus. A family of cryptographic schemes (e.g., SAP, EMVP, BNTM, Tip-toe) addresses that leak. However, as each scheme is published and evaluated on its own corpus, threat model, parameter choices, hardware, and metric conventions, the numbers cannot be compared directly. Consequently, a practitioner asking which one to deploy today has no defensible way to choose. We close that gap with a uniform experimental comparison, including a Plaintext baseline and four cryptographic backends running over the same workload, hardware, and metric definitions. Under that ruler, the schemes spread across a Pareto frontier in privacy, performance, and recall rather than imposing a flat penalty on performance. We find that the performance of SAP matches Plaintext, EMVP delivers cryptographic indistinguishability at a 4x throughput cost on CPU, BNTM adds malicious-server verifiability at a further 22x median-latency cost, and Tiptoe hides the cluster choice itself, but incurs a 190x per-query cost compared to Plaintext. GPU acceleration pays off for Plaintext and SAP but not for EMVP or BNTM. All our experiment artifacts are publicly available for reproducibility
- Abstract(参考訳): ベクトルサーチはセマンティックサーチ、レコメンデーションシステム、検索強化ジェネレーション(RAG)を利用する。
設計上、クエリに応答するサービスは、クエリの埋め込みと、通常、マッチするコーパスの両方を見ることができる。
これは、クエリを発行するユーザと、コーパスの所有者の両方にとって、プライバシ侵害である。
暗号化スキームのファミリ(SAP, EMVP, BNTM, Tip-toe など)がそのリークに対処する。
しかし、それぞれのスキームを自身のコーパス、脅威モデル、パラメータの選択、ハードウェア、メートル法で公開し評価するので、数値を直接比較することはできない。
結果として、今日デプロイするかを尋ねる実践者は、決めるべき方法を持っていません。
このギャップを、Plaintextベースラインと、同じワークロード、ハードウェア、メトリック定義上で動作する4つの暗号化バックエンドを含む、統一された実験的な比較で埋めます。
その支配下では、これらのスキームはパレートのフロンティアに広がり、プライバシ、パフォーマンス、リコールにおいて、パフォーマンスに対するフラットなペナルティを課すのではなく、広がっていた。
SAPの性能はPlaintextと一致し、EMVPはCPUの4倍のスループットで暗号の不明瞭さを提供し、BNTMは22倍の中央レイテンシコストで悪意のあるサーバの検証性を追加し、Tiptoeはクラスタの選択自体を隠すが、Plaintextと比較して190倍のクエリコストを発生させる。
GPUアクセラレーションはPlaintextやSAPでは有効だが、ECMやBNTMでは有効ではない。
すべての実験成果物は再現性のために公開されています
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Pointing the Way, Hiding the Destination: Practical Private Dense Retrieval at Scale [19.48684574323907]
ホストされた検索強化世代(RAG)とセマンティックサーチにより、ユーザは価値あるプロバイダが所有するコーパスをクエリできる。
既存の暗号化アプローチでは、クエリ毎にコーパス全体を処理することでコストがかかります。
このショートリストは、検索品質を犠牲にすることなく全コーパス暗号検索を行う。
論文 参考訳(メタデータ) (2026-08-26T12:46:36Z) - Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck [1.4991111518581999]
テストタイムスケーリング(TTS)は、追加の推論計算を使用することで、言語モデルの出力を改善する。
5世代ベンチマークで5つのTSファミリーの計算正規化比較を行った。
論文 参考訳(メタデータ) (2026-08-19T13:59:53Z) - SSTQ:Privacy-Preserving Vector Quantization via Subsampled Stochastic TurboQuant [79.24089819400126]
Subsampled TurboQuant (SSTQ) は、オーバーコンプリートな等幅のタイトフレーム、座標サブサンプリング、プライバシ対応量子化を組み合わせたフレームワークである。
SSTQは平均2乗誤差スケーリングを実現し、クライアントあたり$lceil log N il + b$ bitsを使用する。
また、コードブックに依存したMSEスケーリングを$O(4b)$から$O(2b)$に削減する、プライバシを意識したコードブックの目的も導出します。
論文 参考訳(メタデータ) (2026-08-05T17:51:25Z) - MESS: Fast and Private Semantic Search on Multi-Graph HNSW [11.990611521434944]
プライバシ,正確性,効率性の3つの特性を持つ検索システムであるMESSを紹介する。
元のベクトルをバイナリコードにマッピングし、ローカリティ・センシティブなハッシュ(LSH)とランダムな応答を適用し、多グラフ階層ナビゲート可能な小型世界(HNSW)インデックスを摂動コード上に構築する。
MESSは、最先端のベースラインよりも最大15.08タイムのレイテンシを実現する。
論文 参考訳(メタデータ) (2026-07-31T03:53:24Z) - PRISM: Pareto-Efficient Retrieval over Intent-Aware Structured Memory for Long-Horizon Agents [9.504077408241544]
ロングホライゾン言語エージェントは、どの固定されたコンテキストウィンドウよりもはるかに早く会話履歴を蓄積する。
PRISMは、長期記憶を共同検索・圧縮問題として扱う訓練不要な検索サイドフレームワークである。
論文 参考訳(メタデータ) (2026-05-12T15:28:30Z) - Private-RAG: Answering Multiple Queries with LLMs while Keeping Your Data Private [21.980739918403344]
Retrieval-augmented Generation (RAG)は、外部コーパスからドキュメントを推論時に取得することで、大きな言語モデル(LLM)を強化する。
このコーパスが機密情報を含む場合、保護されていないRAGシステムは個人情報を漏洩するリスクがある。
本稿では、より実用的なマルチクエリ設定について検討し、2つのDP-RAGアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-11-10T21:12:32Z) - Benchmarking Fraud Detectors on Private Graph Data [70.4654745317714]
現在、多くの種類の不正は、グラフ上で動く自動検出アルゴリズムによって部分的に管理されている。
データ保有者が不正検知器の開発を第三者にアウトソースしようとするシナリオを考察する。
サードパーティは、不正検出をデータ保持者に送信し、これらのアルゴリズムをプライベートデータセットで評価し、その結果を公表する。
本システムに対する現実的なプライバシ攻撃を提案し,評価結果のみに基づいて個人データの匿名化を可能にする。
論文 参考訳(メタデータ) (2025-07-30T03:20:15Z) - The Elusive Pursuit of Reproducing PATE-GAN: Benchmarking, Auditing, Debugging [11.900523702759598]
PATE-GANは、GAN(Generative Adversarial Networks)とPATEのプライベートトレーニングアプローチを組み合わせた、最も人気のあるアルゴリズムの1つとして登場した。
原著者の3つ(サブセット)を含む6つのオープンソースPATE-GAN実装を分析し,ベンチマークする。
DP監査を含む詳細なプライバシ評価を行い、すべての実装が意図したよりも多くのプライバシをリークしていることを示す。
論文 参考訳(メタデータ) (2024-06-20T04:25:41Z) - Benchmarking Private Population Data Release Mechanisms: Synthetic Data vs. TopDown [50.40020716418472]
本研究では、TopDownアルゴリズムとプライベート合成データ生成を比較し、クエリの複雑さによる精度への影響を判定する。
この結果から,TopDownアルゴリズムは,分散クエリに対して,評価したどの合成データ手法よりもはるかに優れたプライバシー-忠実トレードオフを実現することがわかった。
論文 参考訳(メタデータ) (2024-01-31T17:38:34Z) - Exploit the Leak: Understanding Risks in Biometric Matchers [0.0]
生体認証または識別システムにおいて、マッチング者は、格納されたテンプレートと新しいテンプレートを比較して、マッチがあるかどうかを判断する。
プライバシー法の遵守性を高めるために、マーカはプライバシー保護距離の上に構築することができる。
本稿では,距離評価における情報漏洩の解析を行う。
論文 参考訳(メタデータ) (2023-07-25T17:29:32Z) - A Randomized Approach for Tight Privacy Accounting [63.67296945525791]
推定検証リリース(EVR)と呼ばれる新しい差分プライバシーパラダイムを提案する。
EVRパラダイムは、まずメカニズムのプライバシパラメータを推定し、その保証を満たすかどうかを確認し、最後にクエリ出力を解放する。
我々の実証的な評価は、新たに提案されたEVRパラダイムが、プライバシ保護機械学習のユーティリティプライバシトレードオフを改善することを示している。
論文 参考訳(メタデータ) (2023-04-17T00:38:01Z) - Smooth Anonymity for Sparse Graphs [69.1048938123063]
しかし、スパースデータセットを共有するという点では、差分プライバシーがプライバシのゴールドスタンダードとして浮上している。
本研究では、スムーズな$k$匿名性(スムーズな$k$匿名性)と、スムーズな$k$匿名性(スムーズな$k$匿名性)を提供する単純な大規模アルゴリズムを設計する。
論文 参考訳(メタデータ) (2022-07-13T17:09:25Z) - Individual Privacy Accounting for Differentially Private Stochastic Gradient Descent [69.14164921515949]
DP-SGDで訓練されたモデルをリリースする際の個々の事例に対するプライバシー保証を特徴付ける。
ほとんどの例では、最悪のケースよりも強力なプライバシー保証を享受しています。
これは、モデルユーティリティの観点からは守られないグループが同時に、より弱いプライバシー保証を経験することを意味する。
論文 参考訳(メタデータ) (2022-06-06T13:49:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。