論文の概要: The Effect of Text Chunk Size on Retrieval-Augmented Generation Performance
- arxiv url: http://arxiv.org/abs/2607.24767v1
- Date: Mon, 08 Jun 2026 13:55:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.044076
- Title: The Effect of Text Chunk Size on Retrieval-Augmented Generation Performance
- Title(参考訳): テキストチャンクサイズが検索強化生成性能に及ぼす影響
- Abstract要約: 本稿では,チャンクサイズが検索セグメント数とともに生成品質および検索効率に与える影響を評価する。
これらの構成を比較することにより,文書セグメンテーションが検索型拡張生成システムの性能と効率にどのように影響するかをよりよく理解する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Retrieval-Augmented Generation (RAG) systems have emerged as a powerful process for allowing large language models (LLMs) to retrieve relevant information to use as source material during text generation. A critical yet under-explored component of these systems is the granularity at which source documents are segmented into retrievable chunks. The size of these chunks has the potential to significantly influence generation quality, contextual correctness, retrieval precision, and computational efficiency. Despite its importance, chunk size is often selected without proper evaluation of its impact on generation quality. Smaller chunks, such as individual sentences, may allow for precise retrieval by narrowing the focus of each chunk. However, they contain less information, which may limit the model's ability to generate coherent responses. Larger chunks, such as entire chapters, contain lots of broad information that may improve correctness, but also introduce additional noise and increase computational cost. Because larger chunks contain more information, the number of chunks returned to the model must also be considered. This paper evaluates how chunk size, along with the number of retrieved segments, influences generation quality and retrieval effectiveness. By comparing these configurations, this study seeks to better understand how document segmentation affects the performance and efficiency of Retrieval-Augmented Generation systems. segmentation affects the performance and efficiency of Retrieval-Augmented Generation systems.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) システムは、大規模言語モデル(LLM)がテキスト生成時にソース材料として使用する関連情報を検索するための強力なプロセスとして登場した。
これらのシステムの重要かつ未探索なコンポーネントは、ソース文書を検索可能なチャンクに分割する粒度である。
これらのチャンクのサイズは、生成品質、文脈的正確性、検索精度、計算効率に大きな影響を与える可能性がある。
その重要性にもかかわらず、チャンクサイズは、生成品質への影響を適切に評価することなく、しばしば選択される。
個々の文のようなより小さなチャンクは、各チャンクの焦点を狭めることで正確な検索を可能にする。
しかし、情報は少ないため、モデルが一貫性のある応答を生成する能力を制限する可能性がある。
章全体のような大きなチャンクには、正確性を改善するだけでなく、追加のノイズを導入し、計算コストを増大させる幅広い情報が含まれている。
大きなチャンクにはより多くの情報が含まれているため、モデルに返されるチャンクの数も考慮する必要がある。
本稿では,チャンクサイズが検索セグメント数とともに生成品質および検索効率に与える影響を評価する。
これらの構成を比較することにより,文書セグメンテーションが検索型拡張生成システムの性能と効率にどのように影響するかをよりよく理解する。
セグメント化はRetrieval-Augmented Generationシステムの性能と効率に影響を与える。
関連論文リスト
- Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts [0.38597698994416435]
クラスタベースのセマンティックチャンキングは、固定サイズや再帰よりも検索と回答の品質を向上させる。
RAGAベースの忠実度は、この設定の信頼性に制限があることを示している。
論文 参考訳(メタデータ) (2026-07-02T08:12:35Z) - Information Capacity: Evaluating the Efficiency of Large Language Models via Text Compression [53.39128997308138]
テキスト圧縮性能に基づくモデル効率の指標である情報容量を導入する。
主流のオープンソースモデルに対する実証的な評価は、シリーズ内のさまざまなサイズのモデルが一貫した情報容量を示すことを示している。
情報容量の特徴的な特徴は、入力と出力の両方のトークン数に影響を与えるトークン化効率が組み込まれていることである。
論文 参考訳(メタデータ) (2025-11-11T10:07:32Z) - SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension [77.93156509994994]
本研究では,検索性能を向上させるために,より広いコンテキストウインドウに条件付きで短いチャンクを表現する方法を示す。
既存の埋め込みモデルは、そのような場所のコンテキストを効果的にエンコードするのに十分な装備がない。
我々の手法は、最先端の埋め込みモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-08-03T23:59:31Z) - Rethinking Chunk Size For Long-Document Retrieval: A Multi-Dataset Analysis [0.0]
複数の埋め込みモデルを用いた定サイズチャンキング戦略の評価と検索性能への影響について検討した。
短文データセットと長文データセットの両方で行った実験により,チャンクサイズが検索効率において重要な役割を担っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-27T19:39:16Z) - Quantifying Memory Utilization with Effective State-Size [73.52115209375343]
「我々は、テキスト・メモリ利用の尺度を策定する。」
この計量は、textitinput-invariant および textitinput-variant linear operator を持つシステムの基本的なクラスに適合する。
論文 参考訳(メタデータ) (2025-04-28T08:12:30Z) - Exploring Training and Inference Scaling Laws in Generative Retrieval [50.82554729023865]
生成検索は、検索を自己回帰生成タスクとして再構成し、大きな言語モデルがクエリから直接ターゲット文書を生成する。
生成的検索におけるトレーニングと推論のスケーリング法則を体系的に検討し,モデルのサイズ,トレーニングデータスケール,推論時間計算が協調的に性能に与える影響について検討した。
論文 参考訳(メタデータ) (2025-03-24T17:59:03Z) - Improving Factuality with Explicit Working Memory [68.39261790277615]
大規模な言語モデルは、幻覚として知られる、事実的に不正確なコンテンツを生成することができる。
EWE(Explicit Working Memory)は、外部リソースからのリアルタイムフィードバックを受信するワーキングメモリを統合することで、長文テキスト生成における事実性を高める新しい手法である。
論文 参考訳(メタデータ) (2024-12-24T00:55:59Z) - Is Semantic Chunking Worth the Computational Cost? [0.0]
本研究は,3つの共通検索タスクを用いた意味的チャンキングの有効性を体系的に評価する。
その結果,セマンティックチャンキングに伴う計算コストは,一貫した性能向上によって正当化されないことがわかった。
論文 参考訳(メタデータ) (2024-10-16T21:53:48Z) - Introducing a new hyper-parameter for RAG: Context Window Utilization [0.0]
RAGシステムは、外部知識ベースから取得した関連情報を組み込むことで、生成モデルを強化する。
検索および処理されたテキストチャンクのサイズは、RAG性能に影響を与える重要な要因である。
本研究の目的は,回答生成品質を最大化する最適チャンクサイズを特定することである。
論文 参考訳(メタデータ) (2024-07-29T08:38:14Z) - Financial Report Chunking for Effective Retrieval Augmented Generation [2.6680382112425374]
チャンキング情報は検索拡張生成(RAG)における重要なステップである
現在の研究は主に段落レベルのチャンキングに焦点を当てている。
本稿では,文書の構造的要素によって,単に段落レベルのチャンクを超えて文書をチャンクし,文書をチャンクするアプローチを提案する。
論文 参考訳(メタデータ) (2024-02-05T22:35:42Z) - An Empirical Investigation of Commonsense Self-Supervision with
Knowledge Graphs [67.23285413610243]
大規模知識グラフから抽出した情報に基づく自己監督は、言語モデルの一般化を改善することが示されている。
本研究では,言語モデルに適用可能な合成データを生成するための知識サンプリング戦略とサイズの影響について検討する。
論文 参考訳(メタデータ) (2022-05-21T19:49:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。