論文の概要: A Multi-Framework Comparison of Outline Stages in Long-Form Generation with LLMs
- arxiv url: http://arxiv.org/abs/2608.26177v1
- Date: Thu, 13 Aug 2026 15:44:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 05:49:59.255218
- Title: A Multi-Framework Comparison of Outline Stages in Long-Form Generation with LLMs
- Title(参考訳): LLMを用いた長期生産におけるアウトラインステージの多面的比較
- Authors: Yifan Song,
- Abstract要約: 長文生成は、大きな言語モデルの基本的制約を明らかにする。
SuperWriterは、長さ制限付きシングルチャプタモードで最初にランク付けする。
フォローアップ実験はサンプルのサイズを拡大し、クロスモデル評価器を追加する。
- 参考スコア(独自算出の注目度): 9.826721433645526
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-form generation exposes fundamental limitations of large language models. Even 70B-parameter models exhibit length collapse at 16k-token outputs, and multi-chapter stories frequently trigger the attribute drift characteristic of the ``lost-in-the-middle'' effect. The ``outline-first, write-later'' paradigm has gained wide adoption, yet existing research evaluates the final writing rather than the outline itself, conflating two evaluation objects that should be decoupled. We construct a unified head-to-head benchmark covering 7 representative long-form generation frameworks across 3 generation granularities -- single-chapter, multi-chapter, and whole-book -- and propose an anchor-based LLM-as-a-judge protocol that directly assesses outlines against the source text on a 5-point anchored scale. Across 21 framework-granularity cells, no single framework dominates; performance depends on the match between a framework's intrinsic output form and the target granularity. SuperWriter ranks first in the length-constrained single-chapter mode, but this advantage degrades in whole-book mode. The outline-side ranking correlates only moderately with the writing-side ranking, supporting the outline--writing decoupling principle. Compute constraints limit the writing-side evaluation to a subset of cases; follow-up experiments will expand the sample size and add cross-model evaluators to enable stronger statistical inference.
- Abstract(参考訳): 長文生成は、大きな言語モデルの基本的制約を明らかにする。
パラメータ70Bモデルでさえ16k-token出力で長さの崩壊を示し、マルチチャプタ・ストーリーは'lost-in-the-middle'効果の属性ドリフト特性を頻繁に引き起こす。
のパラダイムが広く採用されているが、既存の研究では、アウトライン自体よりも最終的な書き込みを評価し、分離されるべき2つの評価オブジェクトを混同している。
5点アンカースケールでソーステキストに対してアウトラインを直接評価するアンカーベースのLCM-as-a-judgeプロトコルを提案する。
フレームワーク固有の出力形式とターゲットの粒度との一致によってパフォーマンスが変わる。
SuperWriterは、長さ制限付きシングルチャプタモードで最初にランクインするが、この利点は全ブックモードで低下する。
アウトラインサイドランキングは、アウトラインサイドランキングと適度に相関し、アウトラインサイドのデカップリング原則をサポートする。
後続の実験ではサンプルのサイズを拡大し、より強い統計的推測を可能にするクロスモデル評価器を追加する。
関連論文リスト
- Inferring the Size of Large Language Models From Popular Text Memorization [0.989901717499058]
モデルは、長さの異なるテキスト断片をまたいだ次の単語を正確に予測することは、その単語がどれだけ記憶されたかの信頼できる信号である。
この記憶信号は、テキストと断片長の多種多様なコーパスにまたがって、モデル毎の1つの精度プロファイルベクトルに集約する。
その上に2つの補完的推論手法を構築し、その上に2つのモデルのうちどれが大きいかを決定するペア統計テストと、スケーリング法則推定器を構築した。
論文 参考訳(メタデータ) (2026-05-28T01:20:35Z) - HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification Strategy [54.91468501159335]
文書間関係抽出 (RE) は, 異なる文書に存在する頭部尾部エンティティ間の関係を識別することを目的としている。
本稿では,各レベルでの多視点検証により信頼性を向上させる推論戦略を提案する。
論文 参考訳(メタデータ) (2026-04-09T07:55:27Z) - Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents [10.682600460180174]
長期文書トピックセグメンテーションは,情報検索や文書理解において重要な役割を担っている。
従来の識別モデルは固定ウィンドウによって制約されており、文書レベルの意味論をモデル化することはできない。
生成可能な大言語モデルは段落境界を出力することができるが、推論は高価であり、長い入力はサポートし難い。
論文 参考訳(メタデータ) (2025-12-23T16:16:51Z) - Context-Aware Hierarchical Merging for Long Document Summarization [56.96619074316232]
本論文では,階層的なマージをソース文書からコンテキストと統合する手法を提案する。
法的および物語的領域を表すデータセットの実験結果は、文脈的拡張がゼロショットと階層的な融合ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-02-03T01:14:31Z) - Long text outline generation: Chinese text outline based on unsupervised framework and large language mode [9.570650109953679]
本研究では,教師なしフレームワークと大規模モデルを組み合わせた中国語のアウトライン生成手法を提案する。
具体的には、まず、エンティティと構文的依存関係に基づいた章特徴グラフデータを生成する。
グラフ注意層に基づく表現モジュールは、章グラフデータの深い埋め込みを学習し、プロット境界を分割する。
最後に、各プロットセグメントの要約を生成し、全体像を生成するために、大きなモデルを用いる。
論文 参考訳(メタデータ) (2024-12-01T13:46:15Z) - Long Document Summarization with Top-down and Bottom-up Inference [113.29319668246407]
本稿では、2つの側面の要約モデルを改善するための原則的推論フレームワークを提案する。
我々のフレームワークは、トップレベルが長距離依存性をキャプチャするドキュメントの階層的な潜在構造を前提としています。
本稿では,様々な要約データセットに対して提案手法の有効性を示す。
論文 参考訳(メタデータ) (2022-03-15T01:24:51Z) - Retrieve-and-Fill for Scenario-based Task-Oriented Semantic Parsing [110.4684789199555]
シナリオベースのセマンティックパーシングを導入し、最初に発話の「scenario」を曖昧にする必要がある元のタスクの変種を紹介します。
この定式化により、タスクの粗くきめ細かな側面を分離することが可能となり、それぞれがオフザシェルフニューラルネットワークモジュールで解決される。
私たちのモデルはモジュール化され、差別化可能で、解釈可能で、シナリオから余分な監督を得られるようになります。
論文 参考訳(メタデータ) (2022-02-02T08:00:21Z) - Unsupervised Summarization with Customized Granularities [76.26899748972423]
本稿では,最初の教師なし多粒度要約フレームワークであるGranuSumを提案する。
異なる数のイベントを入力することで、GranuSumは教師なしの方法で複数の粒度のサマリーを生成することができる。
論文 参考訳(メタデータ) (2022-01-29T05:56:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。