論文の概要: When Global Gating Is Enough: Admission-Time Hubness Control in Anisotropic Vector Retrieval Systems
- arxiv url: http://arxiv.org/abs/2606.19692v1
- Date: Thu, 18 Jun 2026 01:40:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.601958
- Title: When Global Gating Is Enough: Admission-Time Hubness Control in Anisotropic Vector Retrieval Systems
- Title(参考訳): グローバルゲーティングが十分である場合:異方性ベクトル検索システムにおけるアドミッション時間ハネス制御
- Abstract要約: 挿入前,各候補をセンチネルクエリに対してスコアリングし,ハブライクな文書を隔離し,入場時間制御について検討した。
2つの10万のドキュメントコーパス、5つのエンコーダ、そして接続不能な攻撃者およびディフェンダークエリセットにまたがって、グローバルゲートは決定的な埋め込みスペースポイントでリコール1.0を達成する。
HNSWでは、摂取遅延が約3.1%増加し、スコアは106ベクトルに一定であり、決定の1.2%は近似インデックス化の下で反転する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vector hubness, where a few points become nearest neighbors of many queries, creates a poisoning risk in retrieval-augmented generation (RAG): one injected document can influence unrelated requests. Existing defenses use periodic reverse-kNN scans, leaving an exposure window and repeated corpus-wide work. We study admission-time control, scoring each candidate against sentinel queries and quarantining hub-like documents before insertion. Across two 100,000-document corpora, five encoders, and disjoint attacker and defender query sets, a global gate achieves recall 1.0 at the decisive embedding-space point (>=0.92 across the effective range) and 0.91 +/- 0.07 on HotFlip attacks, with 1% false positives on general documents. A per-topic gate provides no reliable benefit, consistent with anisotropy coupling local and global visibility. Thresholds are maintained incrementally, with corpus-size-independent insertion cost and amortized deletion cost. On HNSW, admission adds about 3.1% to ingestion latency, scoring remains flat to 10^6 vectors, and 1.2% of decisions flip under approximate indexing, none involving attacks. Provenance complements the gate for natural or tight-domain hubs.
- Abstract(参考訳): ベクトルのハブ性(Vector Hubness)は、多くのクエリの隣り合う数ポイントに近づき、検索強化世代(RAG)において有毒なリスクを生じさせる。
既存の防御は定期的なリバースkNNスキャンを使用しており、露光窓とコーパス全体の作業を繰り返し残している。
挿入前,各候補をセンチネルクエリに対してスコアリングし,ハブライクな文書を隔離し,入場時間制御について検討した。
2つの10万のドキュメントコーパス、5つのエンコーダ、および接続不能なアタッカーとディフェンダーのクエリセットにまたがって、グローバルゲートは、決定的な埋め込み空間点(==0.92)でリコール1.0を達成し、HotFlip攻撃では0.91 +/- 0.07、一般文書では1%の偽陽性を達成している。
トピックごとのゲートは、局所的な可視性とグローバルな可視性を結合する異方性と整合して、信頼性の高い利益を提供する。
閾値は、コーパスサイズに依存しない挿入コストと償却削除コストで漸進的に維持される。
HNSWでは、摂取遅延が約3.1%増加し、スコアは10^6ベクターに一定であり、決定の1.2%は近似インデックス化の下で反転し、攻撃には関与しない。
自然または密なドメインハブのゲートを補完する。
関連論文リスト
- Coverage Is Not Containment: A Fundamental Limit of Admission-Time Defenses Against Coordinated Poisoning of Vector Retrieval [0.0]
Retrieval-augmented Generationは、ベクトルストアからのパスを取得し、それらをコンテキストとして信頼することで、質問に答える。
最近の、魅力的な防衛フィルターは、摂取時に毒を盛り、ハブのように振る舞う文書を拒絶する。
個々の文書を個別に注入するコーディネートされた敵に打ち負かされることを示す。
論文 参考訳(メタデータ) (2026-08-17T03:18:51Z) - Coverage Is Not Redundancy: Maintenance Cost and Exposure of Query-Aware Admission Indexes in Vector Databases Under Workload Drift [0.0]
プロダクションスケールの検索を行うベクトルデータベースにおいて、クエリワークロードの異常に大きな共有のために単一の挿入文書を検索することができる。
新規の防衛要員は、入場チェックでこれを摂取します。
我々は、管理が摂取経路に課すコストについて検討する。
論文 参考訳(メタデータ) (2026-08-17T03:11:52Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives [48.545980031973556]
GAMBITは、インポスタ検出器を評価するための3つの評価モードと2つの独立したスコアを持つベンチマークである。
ベンチマークには、240の共進化型インポスタ戦略にまたがる27,804のラベル付きインスタンスのデータセットが付属している。
論文 参考訳(メタデータ) (2026-05-09T16:07:23Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - HubScan: Detecting Hubness Poisoning in Retrieval-Augmented Generation Systems [0.031068858355080494]
ハブ性は有害なコンテンツの導入、検索ランキングの変更、コンテンツフィルタリングのバイパス、システムパフォーマンスの低下に利用することができる。
本稿では,RAGシステム内のハブを特定するために,ベクトルインデックスと埋め込みを評価したオープンソースのセキュリティスキャナである Hubscan を紹介する。
Hubscanは0.2%の警告予算で90%のリコールを達成する。100%リコールは0.4%で、敵のハブは99.8%のパーセンタイルを上回っている。
論文 参考訳(メタデータ) (2026-02-25T21:37:53Z) - Retrieval Pivot Attacks in Hybrid RAG: Measuring and Mitigating Amplified Leakage from Vector Seeds to Graph Expansion [0.0]
ハイブリッド検索-拡張生成(RAG)パイプラインは、ベクトル類似性探索と知識グラフ拡張を組み合わせたマルチホップ推論である。
ベクター検索した"シード"チャンクがエンティティリンクを介してセンシティブなグラフ近傍にピボットできることを示し、テナント間のデータ漏洩を引き起こす。
ベクトル-グラフ境界を利用する7つの検索型Pivotアタックを提示し、逆噴射は不要であることを示す。
論文 参考訳(メタデータ) (2026-02-09T13:55:04Z) - TARG: Training-Free Adaptive Retrieval Gating for Efficient RAG [46.122203287541005]
トレーニングフリーのAdaptive Retrieval Gating (TARG) は、ベースモデルからの短い非遅延ドラフトのみを使用していつ取得するかを決定する、単発のポリシーである。
NQ-Open、TriviaQA、PopQAでは、TARGは一貫して精度と効率のフロンティアをシフトさせる。
論文 参考訳(メタデータ) (2025-11-12T23:09:52Z) - Group Evidence Matters: Tiling-based Semantic Gating for Dense Object Detection [0.0]
本稿では,重畳誘起冗長性をグループエビデンスに変換する検出器非依存のポストプロセッシングフレームワークを提案する。
このフレームワークは再訓練を必要とせず、現代の検出器と統合する。
論文 参考訳(メタデータ) (2025-09-13T01:55:08Z) - T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models [70.03122709795122]
バックドア攻撃の検出, 局所化, 緩和のための総合防御手法T2IShieldを提案する。
バックドアトリガーによって引き起こされた横断アテンションマップの「アシミレーション現象」を見いだす。
バックドアサンプル検出のために、T2IShieldは計算コストの低い88.9$%のF1スコアを達成している。
論文 参考訳(メタデータ) (2024-07-05T01:53:21Z) - Graph Agent Network: Empowering Nodes with Inference Capabilities for Adversarial Resilience [50.460555688927826]
グラフニューラルネットワーク(GNN)の脆弱性に対処するグラフエージェントネットワーク(GAgN)を提案する。
GAgNはグラフ構造化エージェントネットワークであり、各ノードは1-hop-viewエージェントとして設計されている。
エージェントの限られたビューは、悪意のあるメッセージがGAgNでグローバルに伝播するのを防ぎ、グローバル最適化ベースのセカンダリアタックに抵抗する。
論文 参考訳(メタデータ) (2023-06-12T07:27:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。