論文の概要: Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training
- arxiv url: http://arxiv.org/abs/2607.28109v1
- Date: Thu, 30 Jul 2026 12:15:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.550797
- Title: Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training
- Title(参考訳): 言い換える - 書籍レベルの組織は、中級教育のための合成教科書データを改善する
- Authors: Jiawen Tao, Miao Peng, Yaoming Li, Xiaokun Yuan, Mengzhou Wu, Wenhan Yu, Guoan Wang, Nuo Chen, Tong Yang, Maxm Pan,
- Abstract要約: 関連コンテンツがコヒーレントな書籍レベル文書に整理されているかを検討する。
学習前のコーパスからソースを抽出し、トピック単位に集約し、コンテンツの階層的なテーブルを計画し、ソースグラウンドされたセクションを完全な本に組み立てる。
このコーパスとミドルミキシングによる自然書の置き換えにより、下流の性能は平均+1.09向上する。
- 参考スコア(独自算出の注目度): 12.81568269791334
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthetic textbook data has improved language model pre-training, but prior work largely treats the benefit as a property of generated content or local rewriting style. We study a different factor: whether related content is organized into coherent book-level documents. We contribute both a scalable synthesis pipeline and controlled evidence that this organization matters. The pipeline retrieves source material from a pre-training corpus, clusters it into topical units, plans hierarchical tables of contents, and assembles source-grounded sections into complete books (our Full setting), yielding 686K textbooks (32B tokens) across 15,000+ disciplines. Replacing natural books in a mid-training mix with this corpus improves downstream performance by +1.09 on average. Controlled comparisons then disentangle the relevant design factors. A content-matched Split condition holds generated text and tokens fixed but treats each section as an independent document; Full's +1.02 mean gain isolates document packaging. A length-matched RandomConcat control that joins sections from different books remains below Full, ruling out document length alone. A retrieval-pool-matched Rephrase condition independently rewrites individual retrieved documents under the same audience-by-style scheme, without clustering, TOC planning, or book assembly; Full's +1.17 gain demonstrates the value of structured synthesis. On Llama3-8B, Full likewise outperforms both RandomConcat and Natural Books, supporting book-level organization as a useful axis for synthetic pre-training data design.
- Abstract(参考訳): 合成教科書データは、言語モデルの事前学習を改善したが、以前の研究は、生成されたコンテンツや局所的な書き直しスタイルの特質として、その利点を主に扱っている。
関連コンテンツがコヒーレントな書籍レベル文書に整理されるかどうかという,異なる要因について検討する。
私たちはスケーラブルな合成パイプラインと、この組織が重要な証拠を管理しています。
パイプラインはトレーニング済みのコーパスからソース資料を取得し、トピック単位に集約し、コンテンツの階層的なテーブルを計画し、15,000以上の規律で686Kの教科書(32Bトークン)を生成する。
このコーパスとミドルミキシングによる自然書の置き換えにより、下流の性能は平均+1.09向上する。
制御された比較は、関連する設計要素を分解する。
コンテンツマッチングされたSplit条件は、生成されたテキストとトークンを固定するが、各セクションを独立したドキュメントとして扱う。
長さにマッチしたRandomConcatコントロールは、異なる書籍からセクションを結合するが、Fullの下に留まり、ドキュメントの長さのみを除外する。
検索プールマッチングされたリフレーズ条件は、クラスタリングやTOC計画、書籍の組み立てなしに、同一のオーディエンス・バイ・スタイルのスキームの下で、個別の検索された文書を独立に書き直し、Fullの+1.17ゲインは構造化された合成の価値を示す。
Llama3-8Bでは、FullもRandomConcatとNatural Booksより優れており、本レベルの組織を合成事前学習データ設計の有用な軸としてサポートしている。
関連論文リスト
- Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training [23.87978106727431]
本稿では、堅牢なエンドツーエンド文書解析のためのデータ学習協調設計フレームワークを提案する。
本手法は,スキャン・デジタル・実世界の両方のシナリオにおいて,精度とロバスト性を向上する。
論文 参考訳(メタデータ) (2026-03-25T03:19:09Z) - Synthetic bootstrapped pretraining [52.92577542049469]
本稿では,SBP(Synthetic Bootstrapped Pretraining)について述べる。
SBPはまず、事前学習データセットから文書間の関係のモデルを学び、次にそれを利用して巨大な新しいコーパスを合成する。
SBPは高い繰り返しベースラインを継続的に改善し、オラクル上界で達成可能な性能改善のかなりの部分を提供する。
論文 参考訳(メタデータ) (2025-09-17T22:28:27Z) - Context-Aware Hierarchical Merging for Long Document Summarization [56.96619074316232]
本論文では,階層的なマージをソース文書からコンテキストと統合する手法を提案する。
法的および物語的領域を表すデータセットの実験結果は、文脈的拡張がゼロショットと階層的な融合ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-02-03T01:14:31Z) - A Scalable Framework for Table of Contents Extraction from Complex ESG
Annual Reports [19.669390380593843]
2001年から2022年までの563社から1093社のESG年次レポートをまとめた新しいデータセットESGDocを提案する。
これらの報告は、その多様な構造と幅広い長さのために重大な課題を提起している。
3つのステップからなる新しいToc抽出フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-27T11:40:32Z) - Extractive Summarization as Text Matching [123.09816729675838]
本稿では,ニューラル抽出要約システムの構築方法に関するパラダイムシフトを作成する。
抽出した要約タスクを意味テキストマッチング問題として定式化する。
我々はCNN/DailyMailの最先端抽出結果を新しいレベル(ROUGE-1の44.41)に推し進めた。
論文 参考訳(メタデータ) (2020-04-19T08:27:57Z) - Pre-training for Abstractive Document Summarization by Reinstating
Source Text [105.77348528847337]
本稿では,Seq2Seqに基づく非ラベルテキストによる抽象要約モデルの事前学習を可能にする3つの事前学習目標を提案する。
2つのベンチマーク要約データセットの実験では、3つの目的がすべてベースラインでパフォーマンスを向上させることが示されている。
論文 参考訳(メタデータ) (2020-04-04T05:06:26Z) - Learning to Select Bi-Aspect Information for Document-Scale Text Content
Manipulation [50.01708049531156]
我々は、テキストスタイルの転送とは逆の文書スケールのテキストコンテンツ操作という、新しい実践的なタスクに焦点を当てる。
詳細は、入力は構造化されたレコードと、別のレコードセットを記述するための参照テキストのセットである。
出力は、ソースレコードセットの部分的内容と参照の書き込みスタイルを正確に記述した要約である。
論文 参考訳(メタデータ) (2020-02-24T12:52:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。