論文の概要: Shadow Queries for Private Retrieval in Vector Databases
- arxiv url: http://arxiv.org/abs/2609.04767v1
- Date: Fri, 04 Sep 2026 05:59:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.926942
- Title: Shadow Queries for Private Retrieval in Vector Databases
- Title(参考訳): ベクトルデータベースにおけるプライベート検索のためのシャドウクエリ
- Abstract要約: 組込み反転攻撃(EIA)に対するセマンティック分解および組込み分離防御であるSHAQを提案する。
ドキュメントの埋め込みを直接格納する代わりに、SHAQは生成言語モデルを使用して、各ドキュメントの異なるセマンティックな側面をキャプチャする多様なシャドウクエリを生成する。
実験により、SHAQは検索ユーティリティを保ちながら、プライバシーを大幅に改善することが示された。
- 参考スコア(独自算出の注目度): 22.541206283544586
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) increasingly rely on information retrieval (IR) systems, such as Retrieval-Augmented Generation (RAG), to incorporate domain-specific knowledge without costly re-training. These systems often store pre-computed document embeddings in cloud-based vector databases. However, such embeddings are vulnerable to embedding inversion attacks (EIAs), which can reconstruct their underlying text. Existing defenses, such as adding noise or scaling embeddings, often provide limited privacy or significantly reduce retrieval utility. We propose SHAQ (shadow query generation), a semantic-decomposition and embedding-decoupling defense against EIAs. SHAQ is based on the insight that EIAs rely on the strong coupling between an embedding and its original text. Instead of storing document embeddings directly, SHAQ uses a generative language model to create diverse shadow queries that capture different semantic aspects of each document. These queries are then encoded and stored in place of the original document embeddings, thereby decomposing document semantics and decoupling stored embeddings from the source text. Experiments across diverse IR datasets show that SHAQ substantially improves privacy while preserving retrieval utility, achieving a recovery rate as low as 0.2104, defending up to 19.50% more tokens than baseline defenses, and reaching up to 0.7967 MAP@10 with up to 5.53% utility improvement. These results demonstrate that semantic decomposition and embedding decoupling provide an effective alternative to directly modifying embeddings for defending against EIAs.
- Abstract(参考訳): 大規模言語モデル (LLM) は、情報検索 (IR) システムに頼りやすくなり、例えばRetrieval-Augmented Generation (RAG) のようなドメイン固有の知識を、コストのかかる再訓練なしに組み入れている。
これらのシステムは、しばしばクラウドベースのベクトルデータベースに事前計算されたドキュメントの埋め込みを格納する。
しかし、そのような埋め込みはインバージョンアタック(EIA)に対して脆弱であり、基盤となるテキストを再構築することができる。
ノイズの追加や拡張の埋め込みといった既存の防御は、プライバシの制限や検索ユーティリティの大幅な削減を提供することが多い。
提案するSHAQ(Shadow query generation, シェードウクエリ生成)は,EIAに対するセマンティック・デコンポジションと埋め込み・デカップリング・ディフェンスである。
SHAQは、EIAが埋め込みと元のテキストの強い結合に依存しているという洞察に基づいている。
ドキュメントの埋め込みを直接格納する代わりに、SHAQは生成言語モデルを使用して、各ドキュメントの異なるセマンティックな側面をキャプチャする多様なシャドウクエリを生成する。
これらのクエリは、元のドキュメントの埋め込みの代わりにエンコードされ、保存されるので、文書のセマンティクスを分解し、元のテキストから格納された埋め込みを分離する。
多様なIRデータセットの実験により、SHAQは検索ユーティリティを保持しながらプライバシーを大幅に改善し、0.2104まで回復率を低くし、ベースラインディフェンスよりも19.50%多くトークンを防衛し、最大0.7967 MAP@10まで到達し、5.53%のユーティリティ改善を実現している。
これらの結果は, セマンティックな分解と組込みデカップリングが, EIAに対する防御のために, 組込みを直接修正する効果的な代替手段であることを示している。
関連論文リスト
- Reward-Guided Semantic Evolution for Test-time Adaptive Object Detection [82.2968697030677]
Grounding DINOのような視覚言語モデル(VLM)を用いたオープン語彙オブジェクト検出は、テスト時間分布シフト時の性能劣化に悩まされる。
Reward-Guided Semantic Evolution (RGSE) は、テスト時にテキストの埋め込みを直接洗練するトレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-05-06T06:17:41Z) - Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generation [61.47019392413271]
WinnowRAGは、価値あるコンテンツを保持しながら、ノイズの多いドキュメントを体系的にフィルタリングするように設計されている。
WinnowRAGは2段階で動作する: ステージIでは、クエリ対応クラスタリングを行い、類似したドキュメントをグループ化し、異なるトピッククラスタを形成する。
ステージIIでは,批判的なLCMが複数のエージェントの出力を評価し,有用な文書をノイズのあるものから反復的に分離する。
論文 参考訳(メタデータ) (2025-11-01T20:08:13Z) - Transform Before You Query: A Privacy-Preserving Approach for Vector Retrieval with Embedding Space Alignment [7.491164990682839]
STEER(textbfSecure textbfTransformed textbfEmbedding vtextbfEctortextbf Retrieval)は、プライベートベクトル検索フレームワークである。
検索精度を維持しながら、クエリテキストのプライバシを保護します。
論文 参考訳(メタデータ) (2025-07-24T15:41:34Z) - Safeguarding LLM Embeddings in End-Cloud Collaboration via Entropy-Driven Perturbation [16.419373701694067]
EntroGuardはエントロピー駆動の埋め込みプライバシー保護手法である。
エンドツーエンドのコラボレーションにおいて、検索精度を維持しながら、テキスト埋め込みのプライバシを保護することができる。
論文 参考訳(メタデータ) (2025-03-17T07:58:05Z) - From Documents to Dialogue: Building KG-RAG Enhanced AI Assistants [28.149173430599525]
我々は、知識グラフ(KG)を利用した検索型拡張生成(RAG)フレームワークを使用して、外部知識ソースから関連情報を検索する。
我々のKG-RAGシステムは、応答を生成するLLMに送信される前に、ユーザのコンテキストに付加された関連する前兆を検索する。
評価の結果,本手法は応答関連性を大幅に向上させ,無関係な回答を50%以上削減し,既存の生産システムと比較して88%以上,完全関連性のある回答を増大させることがわかった。
論文 参考訳(メタデータ) (2025-02-21T06:22:12Z) - Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking [58.69615583599489]
Deliberate Thinking based Retriever (Debater) は、段階的な思考プロセスを導入することで文書表現を強化する新しいアプローチである。
Debaterは、いくつかのベンチマークで既存のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-02-18T15:56:34Z) - ALGEN: Few-shot Inversion Attacks on Textual Embeddings using Alignment and Generation [9.220337458064765]
ALGEN(alignment and generation)を用いたテキスト・エンベディング・インバージョン・アタックを提案する。
ALGEN攻撃はドメインや言語間で効果的に転送でき、重要な情報を明らかにする。
我々は,NLPに埋め込みアライメントを応用した新しいテキスト埋め込みインバージョンパラダイムを構築した。
論文 参考訳(メタデータ) (2025-02-16T23:11:13Z) - Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs [67.0310240737424]
本稿では,テキストデータセットの所有権を保護し,RA-LLMによる不正使用を効果的に検出するための新しいアプローチを提案する。
提案手法では,IPデータセットに特別に設計されたカナリア文書を挿入することにより,元のデータを完全に変更することなく保護する。
検出プロセス中、カナリア文書をクエリし、RA-LLMの応答を分析することにより、不正使用を識別する。
論文 参考訳(メタデータ) (2025-02-15T04:56:45Z) - Multi-Facet Blending for Faceted Query-by-Example Retrieval [5.156059061769101]
本稿では,多面体ブレンディング(FaBle)拡張法を提案する。
モジュール化によって、事前に定義されたファセットの知識やラベルが不要になります。
1K文書上のFaBle拡張は、ファセット条件埋め込みの訓練を著しく支援する。
論文 参考訳(メタデータ) (2024-12-02T12:32:19Z) - Contextual Document Embeddings [77.22328616983417]
本稿では,コンテキスト化された文書埋め込みのための2つの補完手法を提案する。
第一に、文書近傍を明示的にバッチ内コンテキスト損失に組み込む別のコントラスト学習目標である。
第二に、隣接する文書情報をエンコードされた表現に明示的にエンコードする新しいコンテキストアーキテクチャ。
論文 参考訳(メタデータ) (2024-10-03T14:33:34Z) - Precise Zero-Shot Dense Retrieval without Relevance Labels [60.457378374671656]
仮説文書埋め込み(英: hypothetical Document Embeddings, HyDE)は、ゼロショット高密度検索システムである。
我々は,HyDEが最先端の非教師付き高密度検索器であるContrieverを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2022-12-20T18:09:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。