論文の概要: When Is Complex Chunking Worth It? A Multi-Objective Evaluation of Chunking Methods at Scale
- arxiv url: http://arxiv.org/abs/2608.16586v1
- Date: Mon, 17 Aug 2026 13:47:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.721296
- Title: When Is Complex Chunking Worth It? A Multi-Objective Evaluation of Chunking Methods at Scale
- Title(参考訳): 複雑なチャンキングはいつ価値があるのか? 大規模チャンキング手法の多目的評価
- Abstract要約: 拡張性のある2つのコーパス,3つの埋め込みモデル,複数のコーパスサイズにまたがる8つの代表的なチャンキング戦略を評価した。
以上の結果から,計算コストの高い手法では,単純なチャンキングよりも一貫した利得が得られないことが示唆された。
- 参考スコア(独自算出の注目度): 2.7605457369947892
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dense retrieval is commonly evaluated on benchmarks that represent each document with a single embedding, even though real-world retrieval systems often index long documents that require chunking. In these settings, the chosen chunking method not only affects retrieval quality, but also indexing throughput, query latency, and memory usage. Prior comparisons of chunking strategies have mainly focused on retrieval performance, leaving operational trade-offs underexplored. To address these issues, we evaluate eight representative chunking strategies across two scalable corpora, three embedding models, and multiple corpus sizes, measuring both retrieval effectiveness and system-level costs. Our results show that computationally expensive methods rarely provide consistent gains over simpler chunking. Instead, the best performing strategy depends on the embedding model, dataset, corpus size, and target retrieval metric. Methods with similar performance can also differ substantially in operational cost, showing that chunking should be seen as a multi-objective design decision.
- Abstract(参考訳): 実世界の検索システムはチャンキングを必要とする長い文書をインデックス化することが多いが、デンス検索は単一の埋め込みで各文書を表すベンチマークで一般的に評価される。
これらの設定では、選択されたチャンキングメソッドは、検索品質だけでなく、スループット、クエリ待ち時間、メモリ使用量にも影響を及ぼす。
チャンキング戦略の以前の比較では、主に検索性能に重点を置いており、運用上のトレードオフは未調査のままである。
これらの課題に対処するため,2つのスケーラブルコーパス,3つの埋め込みモデル,複数コーパスサイズにまたがる8つの代表的なチャンキング戦略を評価し,検索効率とシステムレベルのコストを測定した。
以上の結果から,計算コストの高い手法では,単純なチャンキングよりも一貫した利得が得られないことが示唆された。
代わりに、最高のパフォーマンス戦略は、埋め込みモデル、データセット、コーパスサイズ、ターゲット検索メトリックに依存する。
同様の性能を持つ手法は運用コストで大きく異なり、チャンキングは多目的設計決定と見なされるべきであることを示している。
関連論文リスト
- Adaptive Chunking: Optimizing Chunking-Method Selection for RAG [0.0]
文書ごとに最適なチャンキング戦略を選択するフレームワークであるAdaptive Chunkingを紹介します。
法、技術、社会科学領域にまたがる多種多様なコーパスにおいて、我々の計量マージ適応法は、下流RAGの性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-03-26T11:20:52Z) - Beyond Chunk-Then-Embed: A Comprehensive Taxonomy and Evaluation of Document Chunking Strategies for Information Retrieval [37.055995647350784]
本稿では,文書チャンキングにおける先行研究を再現し,既存の戦略を統一する体系的枠組みを提案する。
評価の結果,最適なチャンキング戦略はタスク依存であることがわかった。
論文 参考訳(メタデータ) (2026-02-19T00:27:15Z) - SimpleMem: Efficient Lifelong Memory for LLM Agents [73.74399447715052]
セマンティックロスレス圧縮に基づく効率的なメモリフレームワークSimpleMemを紹介する。
本稿では,情報密度とトークン利用量の最大化を目的とした3段階パイプラインを提案する。
ベンチマークデータセットを用いた実験により,提案手法は精度,検索効率,推論コストにおいて,ベースラインアプローチを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-01-05T21:02:49Z) - SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG [41.16937860730275]
We present SmartChunk, a query-adaptive framework for efficient and robust long-document question answering (QA)。
SmartChunkでは、クエリ毎に最適なチャンク抽象化レベルを予測するプランナーと、要約を繰り返しない高レベルのチャンク埋め込みを生成する軽量圧縮モジュールを使用している。
ユーザがさまざまなドキュメントタイプやクエリスタイルに直面する現実世界のアプリケーションを反映するために、私たちは、SmartChunkを5つのQAベンチマークと1つのドメイン外のデータセットで評価しました。
論文 参考訳(メタデータ) (2025-12-17T01:21:44Z) - Rethinking Chunk Size For Long-Document Retrieval: A Multi-Dataset Analysis [0.0]
複数の埋め込みモデルを用いた定サイズチャンキング戦略の評価と検索性能への影響について検討した。
短文データセットと長文データセットの両方で行った実験により,チャンクサイズが検索効率において重要な役割を担っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-27T19:39:16Z) - Is Semantic Chunking Worth the Computational Cost? [0.0]
本研究は,3つの共通検索タスクを用いた意味的チャンキングの有効性を体系的に評価する。
その結果,セマンティックチャンキングに伴う計算コストは,一貫した性能向上によって正当化されないことがわかった。
論文 参考訳(メタデータ) (2024-10-16T21:53:48Z) - CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling [53.97609687516371]
クロスモーダル検索は、異なるモーダルデータの相互作用を通じて、クエリと意味的に関連するインスタンスを検索することを目的としている。
従来のソリューションでは、クエリと候補の間のスコアを明示的に計算するために、シングルトウワーまたはデュアルトウワーのフレームワークを使用している。
粗大なセマンティックモデリングに基づく生成的クロスモーダル検索フレームワーク(CART)を提案する。
論文 参考訳(メタデータ) (2024-06-25T12:47:04Z) - SQLNet: Scale-Modulated Query and Localization Network for Few-Shot Class-Agnostic Counting [67.97870844244187]
CAC(class-agnostic counting)タスクは、最近、任意のクラスの全てのオブジェクトを、入力画像にいくつかの例を付与してカウントする問題を解くために提案されている。
我々は、スケール変調クエリーおよびローカライズネットワーク(Net)と呼ばれる、新しいローカライズベースのCACアプローチを提案する。
クエリとローカライゼーションの段階において、模範者のスケールを完全に探求し、各オブジェクトを正確に位置付けし、その近似サイズを予測することで、効果的なカウントを実現している。
論文 参考訳(メタデータ) (2023-11-16T16:50:56Z) - How Does Generative Retrieval Scale to Millions of Passages? [68.98628807288972]
各種コーパス尺度における生成的検索手法の実証的研究を行った。
我々は8.8Mパスのコーパスで数百万のパスに生成検索をスケールし、モデルサイズを最大11Bパラメータまで評価する。
生成的検索は、小さなコーパス上の最先端のデュアルエンコーダと競合するが、数百万のパスへのスケーリングは依然として重要で未解決の課題である。
論文 参考訳(メタデータ) (2023-05-19T17:33:38Z) - Recall@k Surrogate Loss with Large Batches and Similarity Mixup [62.67458021725227]
微分不可能な場合、評価計量の勾配降下による直接最適化は不可能である。
本研究は,リコールにおける相異なるサロゲート損失を提案する。
提案手法は,複数の画像検索ベンチマークにおいて最先端の結果を得る。
論文 参考訳(メタデータ) (2021-08-25T11:09:11Z) - One-Shot Object Detection without Fine-Tuning [62.39210447209698]
本稿では,第1ステージのMatching-FCOSネットワークと第2ステージのStructure-Aware Relation Moduleからなる2段階モデルを提案する。
また,検出性能を効果的に向上する新たなトレーニング戦略を提案する。
提案手法は,複数のデータセット上で一貫した最先端のワンショット性能を上回る。
論文 参考訳(メタデータ) (2020-05-08T01:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。