論文の概要: Closed Forms and Synthetic Twins: Predicting Approximate Nearest Neighbor Recall from Embedding Statistics
- arxiv url: http://arxiv.org/abs/2609.00364v1
- Date: Mon, 31 Aug 2026 20:58:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.09777
- Title: Closed Forms and Synthetic Twins: Predicting Approximate Nearest Neighbor Recall from Embedding Statistics
- Title(参考訳): 閉じた形と合成双生児:埋め込み統計から近似的近傍のリコールを予測する
- Abstract要約: 本稿では,何かが構築される前に,インデックスの挙動が予測可能であることを示す。
計測されたリコールの0.03以内の予測は、目に見えない数百万のドキュメントコーパスに到達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embedding models are trained and evaluated as if retrieval were exact; in production they serve behind approximate indexes -- HNSW, IVF, product quantization, or the fixed-dimensional encodings (FDEs) of late-interaction models -- whose behavior the encoder's benchmarks never see: one modern encoder recovers just 14% of its exact top-10 through its raw FDE index. Such failures surface only after an index is built, and the standard patches -- corpus-fitted transforms such as whitening -- must be fitted, stored, and refit as the corpus changes, and can silently rewrite what the encoder returns. This paper shows that index behavior is predictable before anything is built, from label-free statistics of the raw embeddings, through a ladder of instruments matched to what each index family consumes: (1) closed-form moment statistics for the fixed-grid quantizers (PQ, FDE); (2) simulation on a synthetic twin corpus -- cluster statistics made generative, on which any index, composed production systems included, can be built and tested -- for partition indexes; (3) size-extrapolated, lightly calibrated twins for graph indexes at million-document scale. Predictions land within 0.03 of measured recall on an unseen million-document corpus. The same geometry is trainable: targeting the one statistic no post-hoc transform can move -- the score margin -- lifts recall for every index family at once, at a small measured task cost. The result: index choice, correction pricing, and production recall forecast from one cheap measurement pass, on new corpora and new indexes alike; serving without per-corpus transform machinery, suited to continuously changing corpora; and a recall-compute frontier pushed by adapting encoders to geometry rather than coupling them to any single index.
- Abstract(参考訳): 埋め込みモデルは、正確に検索されたかのように訓練され、評価され、本番環境では、HNSW、IVF、製品量子化、または後期相互作用モデルの固定次元符号化(FDE)の裏で機能し、その振る舞いはエンコーダのベンチマークでは見られない:ある現代のエンコーダは、その生のFDEインデックスを通して、その正確なトップ10の14%しか回復しない。
このような障害はインデックスが構築された後にのみ表面化し、標準のパッチ -- ホワイトニングのようなコーパスに適合した変換 -- は、コーパスの変更に伴って適合し、保存し、再適合し、エンコーダが返すものを静かに書き直すことができる。
本稿では,(1)固定グリッド量子化器(PQ, FDE)の閉形式モーメント統計,(2)合成ツインコーパスのシミュレーション,(2)合成ツインコーパスのクラスタ統計を作成した。
計測されたリコールの0.03以内の予測は、目に見えない数百万のドキュメントコーパスに到達する。
同じ幾何学がトレーニング可能で、統計的なポストホック変換をターゲットとして -- スコアマージン -- は、小さな測定タスクコストで、すべてのインデックスファミリを一度にリコールする。
その結果,1つの安価な測定パスから得られる指標選択,補正価格,生産リコール予測,新しいコーパスや新しいインデックスなど,コーパスごとの変換機構のない連続的なコーパス変更に適した機能,エンコーダを任意の単一のインデックスに結合するのではなく,ジオメトリに適応させることによるリコール・コンピュート・フロンティアが実現した。
関連論文リスト
- netseg: a Python Package for Measuring Structural Polarization and Segregation in Social Networks [0.0]
Netsegは、ネットワークインデックスのセットを実装するPythonパッケージである。
パッケージはigraphオブジェクトで動作し、基礎となるグラフ操作を実行する。
生成的意見モデルのパラメータスイープ上でのすべての指標の振舞いを報告する。
論文 参考訳(メタデータ) (2026-09-14T10:27:11Z) - Generative Late-Interaction Embeddings For Visual Document Retrieval [3.3830567744123723]
遅延インタラクション検索は、ビジュアルドキュメント検索の最先端技術だが、ストレージの精度は高い。
GLIE (Generative Late-Interaction Embeddings: k N vectors per page) を紹介する。
ViDoRe v1のページあたりの4つのベクトルでは、GLIEは圧縮されていないシステムのnDCG@5の80%を保持しており、最も優れたポストホック法では70%である。
論文 参考訳(メタデータ) (2026-09-10T16:58:39Z) - Overfitting Mitigation via Singular Value Decomposition in Minimum Bayes Risk Decoding [53.9009465845701]
本稿では,一対のユーティリティ行列をノイズ情報信号としてフレーム化するSVD-MBRを提案する。
実験により、SVD-MBRは復号化に成功し、一般化されたメトリクスの範囲でかなりの利得が得られることが示された。
論文 参考訳(メタデータ) (2026-09-01T12:11:29Z) - OneRetrieval: Unifying Multi-Branch E-commerce Retrieval with an Editable Generative Model [34.47411112516513]
産業用eコマース検索は、手作りのマージで融合したマルチブランチ検索段階を通じて、何十億ものアイテムを検索する。
OneRetrievalは、最も強力な生成ベースラインの深いリコールと、クローズドコードブックエンコーディングの桁を超える介入ヒット率とを一致させる。
このシステムはKuaishouで展開され、毎日数億のPVを提供している。
論文 参考訳(メタデータ) (2026-06-11T16:21:13Z) - Closing the Indexing-Decoding Gap in Multimodal Generative Retrieval via Prefix Retention Optimization [68.48718919047127]
マルチモーダル生成検索式は、複数のモーダル検索を離散識別子生成として定義し、外部埋め込みよりも明示的な類似性探索を不要とする。
既存の手法では、残差量子化によって識別子を構築し、トリエ制約ビームサーチでデコードする。
この組み合わせは、インデックス化とデコーディングのギャップを導入している: 識別子学習の目的は、再構成や対照的な損失を含むが、デコーディング中にプレフィックスの識別性を明示的に強制しない。
1)プレフィックスの格付け蒸留は、リストワイドロスを用いた事前量子化埋め込みによって誘導されるプレフィックスと整合する; (ii)語彙スケジューリングは、コードブックを増大させる。
論文 参考訳(メタデータ) (2026-06-08T09:15:47Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - Exploiting Discriminative Codebook Prior for Autoregressive Image Generation [54.14166700058777]
トークンベースの自己回帰画像生成システムは、まずトークンインデックスのシーケンスをコードブックでトークン化し、次にこれらのシーケンスを自己回帰パラダイムでモデル化する。
自己回帰生成モデルはインデックス値のみに基づいて訓練されるが、豊富なトークン類似性情報を含むコードブックにエンコードされた前者は利用されない。
近年の研究では、トークン上に単純なk平均クラスタリングを行い、コードブックを減らした生成モデルのトレーニングを容易にすることで、これを先に組み込もうとしている。
k-meansの代替として、差別的コードブック先駆者(DCPE)を提案する。
論文 参考訳(メタデータ) (2025-08-14T15:00:00Z) - Semi-Parametric Retrieval via Binary Bag-of-Tokens Index [71.78109794895065]
SemI-parametric Disentangled Retrieval (SiDR)は、ニューラルパラメータから検索インデックスを分離するバイエンコーダ検索フレームワークである。
SiDRは、検索のための非パラメトリックトークン化インデックスをサポートし、BM25のようなインデックス化の複雑さを著しく改善した。
論文 参考訳(メタデータ) (2024-05-03T08:34:13Z) - How Does Generative Retrieval Scale to Millions of Passages? [68.98628807288972]
各種コーパス尺度における生成的検索手法の実証的研究を行った。
我々は8.8Mパスのコーパスで数百万のパスに生成検索をスケールし、モデルサイズを最大11Bパラメータまで評価する。
生成的検索は、小さなコーパス上の最先端のデュアルエンコーダと競合するが、数百万のパスへのスケーリングは依然として重要で未解決の課題である。
論文 参考訳(メタデータ) (2023-05-19T17:33:38Z) - DSI++: Updating Transformer Memory with New Documents [95.70264288158766]
DSI++は、DSIが新たなドキュメントをインクリメンタルにインデクシングするための継続的な学習課題である。
新たな文書の連続的な索引付けは,それまでの索引付け文書をかなり忘れてしまうことを示す。
文書の擬似クエリをサンプルとして生成メモリを導入し、連続的なインデックス付け中に補足することで、検索タスクの忘れを防止する。
論文 参考訳(メタデータ) (2022-12-19T18:59:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。