論文の概要: Filtered Vector Search in a Disaggregated Lakehouse: Composing Table-Format Pruning with Per-File ANN
- arxiv url: http://arxiv.org/abs/2608.05441v1
- Date: Wed, 05 Aug 2026 22:20:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.667948
- Title: Filtered Vector Search in a Disaggregated Lakehouse: Composing Table-Format Pruning with Per-File ANN
- Title(参考訳): 解体された湖沼におけるフィルタベクトル探索:ANNによるテーブル型プランニングの構成
- Abstract要約: 各ParquetファイルのフッタにIVFインデックスを埋め込む。
プランナーは、まず述語によってデータファイルをプルークし、その後、生存者に対してのみIVFを実行する。
11.5M x 768テーブルでは、ウォームIVFサーチはrecall@10 >= 0.90でブルート力より32倍速い。
- 参考スコア(独自算出の注目度): 1.0109137908797041
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Approximate nearest-neighbor (ANN) search increasingly runs alongside structured data - "find the 10 nearest documents where tenant='acme' AND lang='en'" - yet similarity and filtering are usually bolted together: a specialized vector index for one, a separate filter step for the other. We ask what happens when both live inside an open lakehouse table (Apache Iceberg over Parquet on object storage), where the engine already owns a mature file-pruning stack (partition pruning, zone-maps, a bitmap index). We embed an IVF index in place in each Parquet file's footer and make filtered vector queries fast not with a new filtering algorithm but by composing the table's existing file pruning with per-file ANN: the planner prunes data files by the predicate first, then runs IVF only over the survivors. The index is built distributed and non-destructively - a metadata-only Iceberg replace that every other engine still reads - and a rendezvous-hashed per-file cache keeps object-store read latency from swamping the algorithmic win. The payoff comes entirely from file pruning. On an 11.5M x 768 table, warm IVF search is ~32x faster than brute force at recall@10 >= 0.90, a selective predicate having pruned 355 of 444 data files before ANN runs; on 5M real IBM Granite embeddings, a filter arriving across a join prunes four of five region partitions and runs nearly two orders of magnitude (~94x: 14.7 s -> 157 ms) faster than the query-time join at identical top-k, once the reduction is materialized into a region-partitioned layout. We characterize when the composition pays off - it requires file-level locality on the filter column, and the residual predicate is only safe to push into the search over a provably pure (partitioned) column, not a merely sorted one - and report the failure modes we hit bolting ANN onto a lakehouse engine.
- Abstract(参考訳): Approximate Near-Nighbor (ANN) 検索は,構造化されたデータ – テナント='acme' と lang='en' の 10 つの最も近いドキュメントを検索する – とともに実行されるようになっている。
どちらもオープンなレイクハウステーブル(オブジェクトストレージ上のApache Iceberg over Parquet)内に住んでいて、エンジンはすでに成熟したファイル処理スタック(パーティションプルーニング、ゾーンマップ、ビットマップインデックス)を所有しています。
各ParquetファイルのフッタにIVFインデックスを埋め込み、新しいフィルタリングアルゴリズムではなく、ファイル毎のANNでテーブルの既存のファイルプルーニングを構成することで、フィルタされたベクトルクエリを高速に作成する。
インデックスは分散して非破壊的に構築されており、メタデータのみのIcebergが、他のすべてのエンジンがまだ読み込むように置き換えている。
支払いは完全にファイルのプルーニングによって行われる。
11.5M x 768テーブルでは、ウォームIVFサーチはリコール@10 >= 0.90でブルートフォースよりも32倍速く、ANNが走る前に444のデータファイルのうち355個をプルーニングした選択述語である。
フィルタ列にファイルレベルのローカリティが必要であり、残留述語は、単にソートされたものではなく、証明可能な純粋な(分割された)列を探索するためにのみ安全であり、ANNをボーリングした障害モードをレイクハウスエンジンに報告します。
関連論文リスト
- PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention [19.844672835223676]
生産システムにおいてDeepSeek S Attention(DSA)によって実装されたトークンレベルのスパースアテンションは、下流のアテンションを効率良くするが、ボトルネックをインデクサにシフトさせる。
PIVOT, Proxy Indexing Via One full-parse Traversal, トレーニング不要でDSAインデクサのドロップイン置換を行う。
DeepSeek-V3.2 と GLM-5.1 では、LongBench と RULER で、PIVOT は密度の高い DSA インデクサの精度にマッチし、最大 4 倍の速度で加速し、エンドツーエンドのレイテンシを減少させる。
論文 参考訳(メタデータ) (2026-07-27T15:58:07Z) - Improving Long-Context Retrieval with Multi-Prefix Embedding [64.08968715893504]
Multi-Prefix Embeddingは、ドキュメントをEOSトークンで区切られたチャンクに分割し、完全なシーケンスを単一の因果フォワードパスにエンコードし、各プレフィックス境界に1つの埋め込みを抽出する。
MPEはクロスチャンクコンテキストを保持し、チャンクレベルのMaxSimマッチングを可能にし、ドキュメントレベルの関連ラベルのみをトレーニングする。
論文 参考訳(メタデータ) (2026-06-22T17:31:02Z) - MLSkip: Data Skipping for ML Filters via Lightweight Metadata [8.09725161771284]
データベースベンダは最近、フィルタ述語で使用できるAI関数をリリースした。
整数と文字列データに対する従来のデータスキップ技術は、新しいフィルタタイプには適用できない。
Parquetのデフォルトのmin-maxメタデータはプルーニングを可能にするのに十分である。
論文 参考訳(メタデータ) (2026-06-02T17:36:06Z) - HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention [62.79085204939384]
HISA (Hierarchical Indexed Sparse Attention) は、平らなトークンスキャンから2段階の階層的な手順に検索パスを書き換える。
カーネルレベルのベンチマークでは、HISAは64Kコンテキストでの高速化を実現している。
論文 参考訳(メタデータ) (2026-03-30T13:59:51Z) - IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse [68.18308357205586]
Longcontext Agenticは、大規模言語モデルの定義ユースケースとして登場した。
Sparseは、この課題を効果的に解決し、DeepSeek Sparse Attention(DSA)は、代表的なプロダクショングレードソリューションである。
我々は、レイヤを独自のインデクサを実行するフルレイヤの小さなセットと、最も近いフルレイヤのトップkインデックスを単純に再利用する共有レイヤの大多数に分割することで、層間の冗長性を利用するIndexCacheを紹介します。
論文 参考訳(メタデータ) (2026-03-12T17:27:21Z) - B+ANN: A Fast Billion-Scale Disk-based Nearest-Neighbor Index [3.4720326275852]
本稿では,HNSWアルゴリズムの問題点に対処するため,新しいディスクベースANNインデックスであるB+ANNを提案する。
入力データをセマンティックに類似したアイテムを含むブロックに分割し、B+ツリーの変種を構築し、インメモリとディスクの両方にブロックを格納する。
HNSWよりも品質(リコール値)と実行性能(秒/QPSあたりのクエリ)の両方を改善する。
論文 参考訳(メタデータ) (2025-11-19T15:50:28Z) - FuseSampleAgg: Fused Neighbor Sampling and Aggregation for Mini-batch GNNs [51.56484100374058]
FuseSampleAggは、隣人の平均アグリゲーションをGraphSAGEの1つのパスにフューズし、サンプリングする。
Operatorは決定論的であり、標準のPyTorchと統合され、CSVログからすべてのテーブルとフィギュアを再現するスクリプトが同梱されている。
論文 参考訳(メタデータ) (2025-11-17T17:57:18Z) - DISTRIBUTEDANN: Efficient Scaling of a Single DISKANN Graph Across Thousands of Computers [9.854925314375024]
分散ベクトル検索サービスであるDistriBUTEDANNは,1000台以上のマシンにまたがる1つの500億ベクトルグラフインデックスを検索可能にする。
これは、スケールアウトベクターサーチシステムにおいて、ベクトルクエリをパーティションのサブセットにルーティングする既存のパーティションおよびルーティング戦略よりも6倍効率がよい。
論文 参考訳(メタデータ) (2025-09-07T13:13:02Z) - FP-NAS: Fast Probabilistic Neural Architecture Search [49.21560787752714]
PARSECのような確率的NASは高性能アーキテクチャ上の分布を学習し、単一のモデルをトレーニングするのに必要なメモリだけを使用する。
本稿では,分布エントロピーに適応したサンプリング手法を提案する。
FP-NAS(Fast Probabilistic NAS)はアーキテクチャを64%削減し、PARSECより2.1倍高速に検索できることを示す。
論文 参考訳(メタデータ) (2020-11-22T06:10:05Z) - The Case for Learned Spatial Indexes [62.88514422115702]
我々は、空間範囲の問合せに答えるために、最先端の学習した多次元インデックス構造(すなわちFlood)から提案した手法を用いる。
i) パーティション内の機械学習検索は、1次元でフィルタリングを使用する場合の2進探索よりも11.79%速く、39.51%高速であることを示す。
また、2次元でフィルタする最も近い競合相手の1.23倍から1.83倍の速さで機械学習インデックスを精査する。
論文 参考訳(メタデータ) (2020-08-24T12:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。