論文の概要: Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations
- arxiv url: http://arxiv.org/abs/2608.00824v1
- Date: Sat, 01 Aug 2026 19:01:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.949232
- Title: Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations
- Title(参考訳): タイトルチェーンプリフィックスによる構造対応セマンティックチャンキング:テキスト変換アブレーションにおける1600クエリ評価と測定トラップ
- Abstract要約: 3段階のチャンク側のみのセマンティックチャンクパイプラインを提示する。
タイトルチェーンは、生成された要約ではなく、文書のヘッダ階層を再利用する。
パイプラインは完全なセットでMRR@5を0.374から0.463に、答え可能なサブセットで0.828から0.925に改善する。
- 参考スコア(独自算出の注目度): 4.342406076796542
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chunking is the first and most consequential step in retrieval-augmented generation (RAG): every downstream retrieval decision inherits the chunk boundaries. We present a three-stage, chunk-side-only semantic chunking pipeline---header-split, semantic merge, and title-chain prefixing---that costs zero additional LLM calls: the title chain reuses the document's own header hierarchy instead of a generated summary. On a 1600-query stratified evaluation over a production Markdown knowledge base, the pipeline improves MRR@5 from 0.374 to 0.463 (+23.8%) on the full set and from 0.828 to 0.925 (+11.7%) on the answerable subset (n=563), with dual-annotator Cohen's kappa 0.45 (unweighted, 16,000 score pairs). We then report what we tried and what failed: three query-side or architecture-level follow-ups are design dead ends (unevaluated---no comparable run artifacts), one measured failure (prefix weight decay), and one protocol-level failure that is the paper's central methodological finding. In a same-pool prefix on/off ablation, dual-annotator agreement collapsed from kappa 0.45 to 0.04 under identical prompts---stripping the title-chain context strips the disambiguation signal annotators need to agree on relevance. This measurement trap invalidates a common evaluation practice in chunking research and motivates retrieval-time per-candidate prefix evaluation, the direction we recommend from all our evidence.
- Abstract(参考訳): チャンキングは、検索拡張生成(RAG)の最初の、そして最も重要なステップである。
我々は,3段階,チャンク側のみのセマンティックチャンキングパイプライン – ヘッダ分割,セマンティックマージ,タイトルチェーンプレフィックス – を提示する。
1600クエリによるマークダウン知識ベースに対する階層化評価では、パイプラインは完全なセットでMRR@5を0.374から0.463(+23.8%)、答え可能なサブセット(n=563)で0.828から0.925(+11.7%)に改善した。
3つのクエリ側またはアーキテクチャレベルのフォローアップは、設計の終了(非評価--同等の実行成果物)、1つの測定された障害(修正の重み付けの崩壊)、1つのプロトコルレベルの障害で、この論文の中心的な方法論的な発見です。
同一プールプレフィックスのオン/オフアブレーションでは、二重アノテータの合意は、同一のプロンプトの下でカッパ0.45から0.04に崩壊し、タイトルチェーンコンテキストをストリップすることで、曖昧な信号アノテータは関連性について合意する必要がなくなる。
この測定トラップは、チャンキング研究において一般的な評価プラクティスを無効にし、全ての証拠から推奨する方向である候補ごとの検索時間をモチベーション化する。
関連論文リスト
- Threshold Choice, Not Sample Size, Bounds Trustless Verification of Nondeterministic Compound AI Workflows [0.0]
複合AIパイプライン LLMコール、レトリバー、ツールは非決定論的である。
各ステージのインプット、アウトプット、コンテキストのダイジェストをコミットします。
合成HotpotQAパイプラインでは、校正された固定しきい値が45個の正直な複製のうち44個を受け入れ、105個の発散ペアのうち104個を拒絶する。
論文 参考訳(メタデータ) (2026-09-07T22:10:54Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study [32.505127447635864]
シュワルツの10つの基本値に対するトップ1認識の制御について検討した。
我々は,21の命令調整LDM動作を定位応答プロトコルで評価する。
モデルはしばしば正しいモチベーション領域を見つけ、近い選択肢を不安定にランク付けする。
論文 参考訳(メタデータ) (2026-07-22T15:22:14Z) - The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling [8.616356693448987]
本稿では,言語モデル推論の減衰の制御された評価法である複雑性シーリングベンチマーク(CCB)を紹介する。
CCBはタスクのセマンティックな内容を修正し、その深さ N は3つの構造的に異なる状態に対して 5,...,50 でしか変化しない。
広く区切られた領域天井で幾何毎の崩壊のパターンが一貫することがわかった。
論文 参考訳(メタデータ) (2026-06-28T08:56:34Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Hierarchical Certified Semantic Commitment for Byzantine-Resilient LLM-Agent Collaboration [30.310793549183117]
本稿では,BFTにインスパイアされたプロトコルH-CSC(Hierarchical Certified Semantic Commitment)を紹介する。
H-CSCはBFT対応バケット(0.31から2.04度)に低角偏差でコミットし、意図したようにBFTを超えるラウンド(n3f+1)の100%を中止する。
論文 参考訳(メタデータ) (2026-06-05T14:35:58Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Mining Subscenario Refactoring Opportunities in Behaviour-Driven Software Test Suites: ML Classifiers and LLM-Judge Baselines [1.9537983097153042]
振る舞い駆動開発(BDD)ソフトウェアテストスイートは、重複したステップサブシーケンスを蓄積します。
3つのパブリッシュパターンが利用可能である(ファイルの背景、再利用可能な再利用可能なシナリオ呼び出し、組織間の共有高レベルステップ)。
繰り返し続くサブシーケンスが抽出に値するか、どのメカニズムが適用されるかを自動化する前の作業はありません。
論文 参考訳(メタデータ) (2026-05-14T08:38:04Z) - Reducing Maintenance Burden in Behaviour-Driven Development: A Paraphrase-Robust Duplicate-Step Detector with a 1.1M-Step Open Benchmark [1.9537983097153042]
振る舞い駆動開発スイートは、ドキュメント化されたメンテナンスコストとステップ重複の重複を蓄積します。
私たちはこれまでで最大の組織横断的なBDDステップコーパスをリリースします。
論文 参考訳(メタデータ) (2026-04-22T11:44:05Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - Evidence Units: Ontology-Grounded Document Organization for Parser-Independent Retrieval [0.0]
要素レベルの索引付けは、独立したチャンクとして解析された全ての要素を扱い、セマンティックな結合単位を別々の検索候補に分散させる。
本稿では,エビデンス・ユニット(EU)を構成するパイプラインについて述べる。
論文 参考訳(メタデータ) (2026-04-01T05:32:16Z) - LLM-guided Hierarchical Retrieval [54.73080745446999]
LATTICEは階層的な検索フレームワークであり、LLMは対数探索の複雑さで大きなコーパスを推論し、ナビゲートすることができる。
LLM誘導探索における中心的な課題は、モデルの関連性判断がノイズが多く、文脈に依存し、階層性に気付かないことである。
我々のフレームワークは、推論集約型BRIGHTベンチマークで最先端のゼロショット性能を実現する。
論文 参考訳(メタデータ) (2025-10-15T07:05:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。