論文の概要: Cross-Attention Calibrated Deduplication for Retrieval-Augmented Generation System
- arxiv url: http://arxiv.org/abs/2607.24332v1
- Date: Mon, 27 Jul 2026 12:09:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.412594
- Title: Cross-Attention Calibrated Deduplication for Retrieval-Augmented Generation System
- Title(参考訳): 検索拡張生成システムにおけるクロスアテンション校正重複
- Abstract要約: 本稿では,RAGシステムにおけるチャンキング戦略のためのCACD(Cross-Attention Calibrated Deduplication)を提案する。
CACDは、単一のプール化されたベクタの代わりにクロスエンコーダを使用して、各チャンクを、既に保持されているチャンクのインメモリプールに対してチェックする。
実験では、CACDは平均して9.75%のチャンクを除去する。
- 参考スコア(独自算出の注目度): 2.6237787246853013
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Common chunking strategies in Retrieval-Augmented Generation (RAG) systems often create redundant chunks. These redundant chunks make the vector database bigger and slow down retrieval. A common fix is cosine-similarity thresholding. This method reduces each chunk to a single vector, then compares vectors using a similarity score. But a single vector can lose the fine-grained, token-level detail needed to tell a true duplicate apart from a chunk that just shares the same topic. We propose Cross-Attention Calibrated Deduplication (CACD). CACD checks each new chunk against an in-memory pool of chunks already kept, using a cross-encoder instead of a single pooled vector. This keeps token-level detail all the way to the final comparison. CACD combines three parts: the cross-encoder comparison itself, a New Information Score (NIS) that measures how much of a chunk is not explained by a candidate already kept, and a majority vote across several candidates rather than a single best match. NIS is calculated from the attention entropy of the cross-encoder. We tested CACD against five existing filtering methods, nine chunking strategies, and 18 configurations, all on the full SQuAD 1.1 validation set. In our experiments, CACD removes 9.75% of chunks on average. This drop rate is close to other semantic-level methods, and much higher than exact-match filters, which barely remove anything. In these experiments, CACD also processes each configuration in 51.0 seconds on average, about 27% faster than the strongest baseline, NERExact (69.6s), and about 7x faster than cosine-similarity filtering (356.7s). These results come from a single dataset, so we present them as an early comparison, not a general claim. Code for the baseline evaluation and for CACD is available at https://github.com/lehuyphuong/rag_bench and https://github.com/lehuyphuong/cacd_dedup.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG)システムにおける一般的なチャンク戦略は、しばしば冗長なチャンクを生成する。
これらの冗長なチャンクは、ベクトルデータベースを大きくし、検索を遅くする。
一般的な修正はコサイン類似性の閾値付けである。
この方法は各チャンクを1つのベクトルに減らし、類似度スコアを用いてベクトルを比較する。
しかし、ひとつのベクトルは、同じトピックを共有するチャンクから真の重複を伝えるために必要な、きめ細かいトークンレベルの詳細を失う可能性がある。
本稿では,CACD(Cross-Attention Calibrated Deduplication)を提案する。
CACDは、単一のプール化されたベクタの代わりにクロスエンコーダを使用して、各チャンクを、既に保持されているチャンクのインメモリプールに対してチェックする。
これはトークンレベルの詳細を最終比較まで保持する。
CACDは、クロスエンコーダ比較そのものと、既に保持されている候補によってチャンクがどの程度説明されていないかを測定する新しい情報スコア(NIS)と、単一のベストマッチではなく、複数の候補で過半数の投票を行う。
NISは、クロスエンコーダの注意エントロピーから算出される。
既存の5つのフィルタリング方法,9つのチャンク戦略,18のコンフィギュレーションに対して,CACDを全SQuAD 1.1検証セット上でテストした。
実験では、CACDは平均して9.75%のチャンクを除去する。
このドロップレートは他のセマンティックレベルのメソッドに近く、正確なマッチフィルタよりもはるかに高く、ほとんど何も取り除かない。
これらの実験では、CACDは各構成を平均51.0秒で処理し、最強のベースラインであるNERExact (69.6s)より約27%速く、コサイン類似度フィルタリング(356.7s)より約7倍高速である。
これらの結果は単一のデータセットから得られるので、我々はそれらを一般的な主張ではなく、早期比較として提示する。
ベースライン評価とCACDのコードはhttps://github.com/lehuyphuong/rag_bench and https://github.com/lehuyphuong/cacd_dedup.comで公開されている。
関連論文リスト
- Rethinking RAG in Long Videos: What to Retrieve and How to Use It? [56.38819694781005]
V-RAGBenchは$langle$query, evidence chunk, answer$rangle$三重項のベンチマークで、検索と生成を忠実に分離した評価を可能にする。
また、CARVEは、コンフィグレーションにまたがって並列レトリバーを動作させ、チャンク毎に入賞構成を識別するためにチャンク適応リランクを用いる手法である。
論文 参考訳(メタデータ) (2026-06-11T10:05:49Z) - No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - Query-Adaptive Semantic Chunking for Retrieval-Augmented Generation: A Dynamic Strategy with Contextual Window Expansion [0.0]
本稿では,クエリを3つのメカニズムを通じてセグメンテーションに統合することにより,チャンクを動的に構築するクエリ適応セマンティックチャンキング(QASC)を提案する。
QASCのF1スコアは0.85で、固定チャンクよりも18-27%、意味論的およびエージェント的代替よりも8-12%向上している。
論文 参考訳(メタデータ) (2026-04-29T06:40:53Z) - RepoShapley: Shapley-Enhanced Context Filtering for Repository-Level Code Completion [15.967314350012755]
RepoShapleyは、Shapleyスタイルの余分なコントリビューションによって管理される、連立を意識したコンテキストフィルタリングフレームワークである。
ChunkShapleyは(i)教師に強制された確率でサイン付き重み付き効果を推定する単一チャンク探索によってオフラインラベルを構築する。
検証済みの$KEEP$ または $DROP$ の決定と検索を個別の制御トークンを介して単一のモデルに抽出する。
論文 参考訳(メタデータ) (2026-01-06T19:27:32Z) - Lossless Compression of Vector IDs for Approximate Nearest Neighbor Search [11.938555573590964]
インデックスのサイズを減らすために、ロスシー圧縮が広く適用されている。
逆ファイルとグラフベースのインデックスでは、ベクトルIDやリンクなどの補助データはほとんどのストレージコストを表すことができる。
いくつかのデータセットに対して、これらの手法は量子化されたベクトルコードも無害に圧縮できることを示す。
論文 参考訳(メタデータ) (2025-01-16T20:45:11Z) - Comparing Neighbors Together Makes it Easy: Jointly Comparing Multiple Candidates for Efficient and Effective Retrieval [36.445443789036226]
一般的な検索と参照のパラダイムは、高速なバイエンコーダ(BE)を使用して、幅広い集合から関連する候補を検索することである。
本稿では,クエリと類似候補の複数の埋め込みを,浅い自己認識層を通じて比較する比較多重候補フレームワークを提案する。
ZeSHELデータセットの実験結果は、バイエンコーダとクロスエンコーダをシームレスな中間リランカとして接続した場合、MCCはリコール@kを効果的に改善できることを示した。
論文 参考訳(メタデータ) (2024-05-21T13:51:48Z) - Target before Shooting: Accurate Anomaly Detection and Localization
under One Millisecond via Cascade Patch Retrieval [49.45246833329707]
異常検出(AD)の「マッチング」性を再検討する
本稿では,ADの精度と実行速度を同時に向上する新しいADフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-13T11:49:05Z) - Detection Transformer with Stable Matching [48.963171068785435]
もっとも重要な設計は, 肯定的な事例の分類スコアを監督するために, 位置測定値のみを使用することである。
本原理では,DTRの分類損失とマッチングコストに位置測定値を統合することで,簡易かつ効果的な2つの修正を提案する。
12エポックおよび24エポックのトレーニング設定の下でResNet-50バックボーンを用いてCOCO検出ベンチマークで50.4および51.5APを達成する。
論文 参考訳(メタデータ) (2023-04-10T17:55:37Z) - SC-Block: Supervised Contrastive Blocking within Entity Resolution
Pipelines [75.5113002732746]
本稿では,教師付きコントラスト学習を利用した埋め込み空間におけるレコードの位置決め手法であるSC-Blockを提案する。
SC-Blockを8つの最先端のブロッキング手法と比較した。
全体の実行時間を測定するため、99.5%の完全性を持つ候補集合を決定し、それらをマーカに渡す。
論文 参考訳(メタデータ) (2023-03-06T13:49:41Z) - Rapid Person Re-Identification via Sub-space Consistency Regularization [51.76876061721556]
Person Re-Identification (ReID) は、歩行者を分離したカメラで識別する。
実値特徴記述子を用いた既存のReID法は精度が高いが、ユークリッド距離計算が遅いため効率が低い。
本稿では,ReID 処理を 0.25 倍高速化するサブスペース一貫性規則化 (SCR) アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-07-13T02:44:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。