論文の概要: Comparing Chunking and Embedding Strategies for Turkish RAG Systems
- arxiv url: http://arxiv.org/abs/2608.26192v2
- Date: Fri, 28 Aug 2026 10:54:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.086462
- Title: Comparing Chunking and Embedding Strategies for Turkish RAG Systems
- Title(参考訳): トルコのRAGシステムにおけるチャンキングと埋め込み戦略の比較
- Abstract要約: トルコの文書質問応答を3つのチャンキング戦略(固定長,意味,レイアウト対応ドクリング)で比較する。
すべての構成は同じ質問セットに答え、コンポーネントのエフェクトをペアテストで分離することができる。
レイアウトを意識したチャンキングは、テキストを多用するよりも、テーブルを多用するドキュメントをずっと助けます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-Augmented Generation conditions a language model on chunks retrieved from a document collection. Its accuracy is therefore limited by the chunking and embedding stages that determine what can be retrieved. We compare Turkish document question answering across three chunking strategies (fixed-length, semantic, and layout-aware Docling), five embedding models, and two LLMs, over three documents with contrasting layouts. Every configuration answers the same question set, which allows component effects to be separated by paired testing rather than inferred from separate benchmarks. The fully crossed design yields 9{,}000 graded question-answer evaluations, each scored by an independent judge model, and component comparisons are tested by paired McNemar tests under Holm correction. The three leading embedding models are statistically indistinguishable, so language specialization yields no measurable retrieval advantage. The faster LLM is not the more accurate one. The preferred configuration depends on content type, since layout-aware chunking helps table-heavy documents far more than text-heavy ones.
- Abstract(参考訳): Retrieval-Augmented Generation条件 ドキュメントコレクションから取得したチャンク上の言語モデル。
そのため、その精度は、何を取得するかを決定するチャンキングと埋め込みの段階によって制限される。
我々は,3つのチャンキング戦略(固定長,セマンティック,レイアウト対応ドクリング),5つの埋め込みモデル,および2つのLDM)に対して,3つの文書に対して比較を行った。
すべての構成は同じ質問セットに答えるため、別のベンチマークから推測されるのではなく、ペアテストによってコンポーネント効果を分離することができる。
完全交差設計は9{,}000グレードの質問応答評価を行い,それぞれ独立判定モデルにより評価し,ホルム補正下でのMcNemar検定により成分比較試験を行った。
3つの主要な埋め込みモデルは統計的に区別できないので、言語の特殊化は測定可能な検索の利点を生まない。
より高速なLCMは、より正確なものではありません。
レイアウトを意識したチャンキングは、テキストを多用するよりも、テーブルを多用するドキュメントをずっと助けます。
関連論文リスト
- Choosing a Text Embedding Model: A Practical Benchmarking and Decision Framework [0.0]
本報告では,モデル選択を組み込むための実践的,エビデンスに基づくフレームワークを開発する。
商用APIベースの埋め込みモデルであるT3EMを、英語検索タスクに関する幅広いオープンソース代替案に対して評価する。
論文 参考訳(メタデータ) (2026-07-26T07:13:33Z) - SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding [7.772410077546426]
ヴィジュアル言語モデル(VLM)はDocVQA、ChartQA、MMLongBench-Docといったビジュアル文書理解ベンチマークで高いパフォーマンスを達成した。
文書長,レイアウト構造,モダリティ構成,質問型などの要素を制御できる,長文視覚文書理解のための完全合成ベンチマークであるSynthDocBenchを紹介した。
論文 参考訳(メタデータ) (2026-07-11T17:02:49Z) - Rethinking RAG in Long Videos: What to Retrieve and How to Use It? [56.38819694781005]
V-RAGBenchは$langle$query, evidence chunk, answer$rangle$三重項のベンチマークで、検索と生成を忠実に分離した評価を可能にする。
また、CARVEは、コンフィグレーションにまたがって並列レトリバーを動作させ、チャンク毎に入賞構成を識別するためにチャンク適応リランクを用いる手法である。
論文 参考訳(メタデータ) (2026-06-11T10:05:49Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Contexts are Never Long Enough: Structured Reasoning for Scalable Question Answering over Long Document Sets [7.102370558887478]
本稿では,長い文書コレクションに対する質問応答のためのフレームワークであるSLIDERSについて,構造化された推論を通して紹介する。
SLIDERSは、有能な情報をリレーショナルデータベースに抽出し、永続的な構造化状態に対するスケーラブルな推論を可能にする。
既存の3つのロングコンテキストベンチマークにおいて、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-04-24T07:16:44Z) - Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation [51.55755193937205]
提案するQREAMは,検索した文書を事実を保存しながら質問指向のスタイルで整列するスタイル制御リライタである。
本フレームワークは,(1) 反復的書き換え探索にスタイリスティックシードを用いたQREAM-ICL,(2) ICL出力から抽出した軽量学生モデルQREAM-FTの2段階からなる。
論文 参考訳(メタデータ) (2026-04-19T08:39:21Z) - CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents [6.134883925217888]
大規模言語モデル(LLM)によるチャンク関係を反復的に評価するフレームワークであるCHOPを提案する。
CHOPはCNM-ExtractorとContinuity Decision Moduleという2つの重要なコンポーネントを統合している。
ベンチマークデータセットの実験では、CHOPは検索の混乱を緩和し、高品質な知識ベースを構築するためのスケーラブルなアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-17T08:05:17Z) - M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models [20.44093242908907]
LVLMベースのパイプラインであるM3DocDepを提案する。
共有ブロック評価プロトコルの下で、M3DocDepはDHPベンチマークでSTEDSを+28.5から+39.6%改善し、nDCGを+1.1から+15.3%、QA ANLSを+4.5から+15.3%改善した。
論文 参考訳(メタデータ) (2026-04-17T05:33:45Z) - Adaptive Chunking: Optimizing Chunking-Method Selection for RAG [0.0]
文書ごとに最適なチャンキング戦略を選択するフレームワークであるAdaptive Chunkingを紹介します。
法、技術、社会科学領域にまたがる多種多様なコーパスにおいて、我々の計量マージ適応法は、下流RAGの性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-03-26T11:20:52Z) - MoDora: Tree-Based Semi-Structured Document Analysis System [62.01015188258797]
半構造化文書は、様々な不規則なレイアウトで配置された様々なインターリーブされたデータ要素を統合する。
MoDora は半構造化文書解析のための LLM を利用したシステムである。
実験では、MoDoraは5.97%-61.07%の精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T14:48:49Z) - LLMStructBench: Benchmarking Large Language Model Structured Data Extraction [1.338174941551702]
LLM(Large Language Models)の評価のための新しいベンチマークを提案する。
私たちのオープンデータセットは、さまざまな複雑さの多様な手作業による解析シナリオで構成されています。
モデルサイズなどの標準属性よりも適切なプロンプト戦略を選択することが重要であることを示す。
論文 参考訳(メタデータ) (2026-02-16T13:37:58Z) - SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension [77.93156509994994]
本研究では,検索性能を向上させるために,より広いコンテキストウインドウに条件付きで短いチャンクを表現する方法を示す。
既存の埋め込みモデルは、そのような場所のコンテキストを効果的にエンコードするのに十分な装備がない。
我々の手法は、最先端の埋め込みモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-08-03T23:59:31Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - Optimizing RAG Pipelines for Arabic: A Systematic Analysis of Core Components [0.0]
Retrieval-Augmented Generation (RAG) は、検索システムの精度と大規模言語モデルの流速を結合する強力なアーキテクチャとして登場した。
本研究では,最先端のRAGコンポーネントの包括的評価,チャンキング戦略,埋め込みモデル,リランカー,言語モデルなど,さまざまなアラビアデータセットの集合を包括的に比較した。
論文 参考訳(メタデータ) (2025-06-01T00:04:58Z) - LLM$\ imes$MapReduce: Simplified Long-Sequence Processing using Large Language Models [73.13933847198395]
本稿では,文書理解を包括的に行うための分割・対数戦略を利用して,長文処理のための学習自由フレームワークを提案する。
提案された LLM$times$MapReduce フレームワークは、ドキュメント全体を LLM が読み取るためにいくつかのチャンクに分割し、中間回答を集約して最終的な出力を生成する。
論文 参考訳(メタデータ) (2024-10-12T03:13:44Z) - RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content [13.187520657952263]
大規模言語モデル(LLM)は大量のデータに基づいて訓練されており、そのほとんどは自動的にインターネットから取り除かれる。
トレーニングセットに漏れたかもしれない テストスプリットのモデルを評価する 結論を誤解させる傾向がある
本稿では,質問応答とトピック検索タスクに適したRepLiQAという新しいテストデータセットを提案する。
論文 参考訳(メタデータ) (2024-06-17T17:52:54Z) - xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token [108.7069350303884]
xRAGは、検索拡張生成に適した、革新的なコンテキスト圧縮手法である。
xRAGは、言語モデル表現空間に文書の埋め込みをシームレスに統合する。
実験の結果、xRAGは6つの知識集約タスクで平均10%以上の改善を達成していることがわかった。
論文 参考訳(メタデータ) (2024-05-22T16:15:17Z) - Are Layout-Infused Language Models Robust to Layout Distribution Shifts?
A Case Study with Scientific Documents [54.744701806413204]
近年の研究では、レイアウト機能を言語モデル(LM)に注入することで、科学論文などの視覚に富んだ文書の処理が改善されている。
レイアウトを注入したLMがレイアウト分布シフトに対して堅牢であるかどうかを検証する。
論文 参考訳(メタデータ) (2023-06-01T18:01:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。