論文の概要: Comparing Chunking and Embedding Strategies for Turkish RAG Systems
- arxiv url: http://arxiv.org/abs/2608.26192v1
- Date: Mon, 24 Aug 2026 07:24:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.114505
- Title: Comparing Chunking and Embedding Strategies for Turkish RAG Systems
- Title(参考訳): トルコのRAGシステムにおけるチャンキングと埋め込み戦略の比較
- Abstract要約: ドキュメントを検索可能なチャンクに分割する方法と、それらのチャンクを埋め込む方法が、Retrieval-Augmented Generation (RAG)の品質に強く影響します。
トルコの文書質問の回答を3つのチャンキング戦略で比較する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: How documents are segmented into retrievable chunks and how those chunks are embedded strongly affect Retrieval-Augmented Generation (RAG) quality, yet neither has been systematically studied for morphologically rich languages such as Turkish. We compare Turkish document question answering across three chunking strategies (fixed-length, semantic, and layout-aware Docling), five embedding models, and two generator LLMs, over three documents with contrasting layouts. The fully crossed design yields 9,000 graded question-answer evaluations, each scored by an independent judge model, and component comparisons are tested by paired McNemar tests under Holm correction. Four findings follow. The chunking strategy determines how much the embedding choice matters: layout-aware chunking compresses the spread between the modern embedding models to about a point. The three leading embedding models are statistically indistinguishable, so language specialization yields no measurable retrieval advantage. The faster generator is not the more accurate one. And the preferred configuration depends on content type, since layout-aware chunking helps documents containing tables far more than prose. The best individual components therefore do not compose into the best complete configuration, which reaches 87.0%.
- Abstract(参考訳): 文書を検索可能なチャンクに分割し、それらのチャンクをどのように埋め込むかは、Retrieval-Augmented Generation (RAG)の品質に強く影響を及ぼすが、トルコ語のような形態学的に豊かな言語については、体系的に研究されていない。
我々は,3つのチャンキング戦略(固定長,セマンティック,レイアウトを意識したドッキング),5つの埋め込みモデル,および2つのジェネレータLDM)で比較した。
完全交差設計では、独立判定モデルによって評価され、ホルム補正下でのMcNemar検定により成分比較試験が行われる。
以下の4つの発見がある。
レイアウトを意識したチャンキングは、モダンな埋め込みモデル間の広がりを約1ポイントまで圧縮します。
3つの主要な埋め込みモデルは統計的に区別できないので、言語の特殊化は測定可能な検索の利点を生まない。
より高速な発電機は、より正確なものではない。
レイアウトを意識したチャンキングは、散文よりもはるかにテーブルを含むドキュメントを支援するためである。
したがって、最も優れた個々のコンポーネントは、87.0%に達する最高の完全な構成に構成されない。
関連論文リスト
- Choosing a Text Embedding Model: A Practical Benchmarking and Decision Framework [0.0]
本報告では,モデル選択を組み込むための実践的,エビデンスに基づくフレームワークを開発する。
商用APIベースの埋め込みモデルであるT3EMを、英語検索タスクに関する幅広いオープンソース代替案に対して評価する。
論文 参考訳(メタデータ) (2026-07-26T07:13:33Z) - SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding [7.772410077546426]
ヴィジュアル言語モデル(VLM)はDocVQA、ChartQA、MMLongBench-Docといったビジュアル文書理解ベンチマークで高いパフォーマンスを達成した。
文書長,レイアウト構造,モダリティ構成,質問型などの要素を制御できる,長文視覚文書理解のための完全合成ベンチマークであるSynthDocBenchを紹介した。
論文 参考訳(メタデータ) (2026-07-11T17:02:49Z) - Rethinking RAG in Long Videos: What to Retrieve and How to Use It? [56.38819694781005]
V-RAGBenchは$langle$query, evidence chunk, answer$rangle$三重項のベンチマークで、検索と生成を忠実に分離した評価を可能にする。
また、CARVEは、コンフィグレーションにまたがって並列レトリバーを動作させ、チャンク毎に入賞構成を識別するためにチャンク適応リランクを用いる手法である。
論文 参考訳(メタデータ) (2026-06-11T10:05:49Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Contexts are Never Long Enough: Structured Reasoning for Scalable Question Answering over Long Document Sets [7.102370558887478]
本稿では,長い文書コレクションに対する質問応答のためのフレームワークであるSLIDERSについて,構造化された推論を通して紹介する。
SLIDERSは、有能な情報をリレーショナルデータベースに抽出し、永続的な構造化状態に対するスケーラブルな推論を可能にする。
既存の3つのロングコンテキストベンチマークにおいて、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-04-24T07:16:44Z) - Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation [51.55755193937205]
提案するQREAMは,検索した文書を事実を保存しながら質問指向のスタイルで整列するスタイル制御リライタである。
本フレームワークは,(1) 反復的書き換え探索にスタイリスティックシードを用いたQREAM-ICL,(2) ICL出力から抽出した軽量学生モデルQREAM-FTの2段階からなる。
論文 参考訳(メタデータ) (2026-04-19T08:39:21Z) - CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents [6.134883925217888]
大規模言語モデル(LLM)によるチャンク関係を反復的に評価するフレームワークであるCHOPを提案する。
CHOPはCNM-ExtractorとContinuity Decision Moduleという2つの重要なコンポーネントを統合している。
ベンチマークデータセットの実験では、CHOPは検索の混乱を緩和し、高品質な知識ベースを構築するためのスケーラブルなアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-17T08:05:17Z) - M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models [20.44093242908907]
LVLMベースのパイプラインであるM3DocDepを提案する。
共有ブロック評価プロトコルの下で、M3DocDepはDHPベンチマークでSTEDSを+28.5から+39.6%改善し、nDCGを+1.1から+15.3%、QA ANLSを+4.5から+15.3%改善した。
論文 参考訳(メタデータ) (2026-04-17T05:33:45Z) - Adaptive Chunking: Optimizing Chunking-Method Selection for RAG [0.0]
文書ごとに最適なチャンキング戦略を選択するフレームワークであるAdaptive Chunkingを紹介します。
法、技術、社会科学領域にまたがる多種多様なコーパスにおいて、我々の計量マージ適応法は、下流RAGの性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-03-26T11:20:52Z) - MoDora: Tree-Based Semi-Structured Document Analysis System [62.01015188258797]
半構造化文書は、様々な不規則なレイアウトで配置された様々なインターリーブされたデータ要素を統合する。
MoDora は半構造化文書解析のための LLM を利用したシステムである。
実験では、MoDoraは5.97%-61.07%の精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T14:48:49Z) - LLMStructBench: Benchmarking Large Language Model Structured Data Extraction [1.338174941551702]
LLM(Large Language Models)の評価のための新しいベンチマークを提案する。
私たちのオープンデータセットは、さまざまな複雑さの多様な手作業による解析シナリオで構成されています。
モデルサイズなどの標準属性よりも適切なプロンプト戦略を選択することが重要であることを示す。
論文 参考訳(メタデータ) (2026-02-16T13:37:58Z) - SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension [77.93156509994994]
本研究では,検索性能を向上させるために,より広いコンテキストウインドウに条件付きで短いチャンクを表現する方法を示す。
既存の埋め込みモデルは、そのような場所のコンテキストを効果的にエンコードするのに十分な装備がない。
我々の手法は、最先端の埋め込みモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-08-03T23:59:31Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - Optimizing RAG Pipelines for Arabic: A Systematic Analysis of Core Components [0.0]
Retrieval-Augmented Generation (RAG) は、検索システムの精度と大規模言語モデルの流速を結合する強力なアーキテクチャとして登場した。
本研究では,最先端のRAGコンポーネントの包括的評価,チャンキング戦略,埋め込みモデル,リランカー,言語モデルなど,さまざまなアラビアデータセットの集合を包括的に比較した。
論文 参考訳(メタデータ) (2025-06-01T00:04:58Z) - LLM$\ imes$MapReduce: Simplified Long-Sequence Processing using Large Language Models [73.13933847198395]
本稿では,文書理解を包括的に行うための分割・対数戦略を利用して,長文処理のための学習自由フレームワークを提案する。
提案された LLM$times$MapReduce フレームワークは、ドキュメント全体を LLM が読み取るためにいくつかのチャンクに分割し、中間回答を集約して最終的な出力を生成する。
論文 参考訳(メタデータ) (2024-10-12T03:13:44Z) - RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content [13.187520657952263]
大規模言語モデル(LLM)は大量のデータに基づいて訓練されており、そのほとんどは自動的にインターネットから取り除かれる。
トレーニングセットに漏れたかもしれない テストスプリットのモデルを評価する 結論を誤解させる傾向がある
本稿では,質問応答とトピック検索タスクに適したRepLiQAという新しいテストデータセットを提案する。
論文 参考訳(メタデータ) (2024-06-17T17:52:54Z) - xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token [108.7069350303884]
xRAGは、検索拡張生成に適した、革新的なコンテキスト圧縮手法である。
xRAGは、言語モデル表現空間に文書の埋め込みをシームレスに統合する。
実験の結果、xRAGは6つの知識集約タスクで平均10%以上の改善を達成していることがわかった。
論文 参考訳(メタデータ) (2024-05-22T16:15:17Z) - Are Layout-Infused Language Models Robust to Layout Distribution Shifts?
A Case Study with Scientific Documents [54.744701806413204]
近年の研究では、レイアウト機能を言語モデル(LM)に注入することで、科学論文などの視覚に富んだ文書の処理が改善されている。
レイアウトを注入したLMがレイアウト分布シフトに対して堅牢であるかどうかを検証する。
論文 参考訳(メタデータ) (2023-06-01T18:01:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。