論文の概要: When Does Generating More Help? Disentangling Fixed-Source Synthesis from Source Expansion in Synthetic Data Scaling
- arxiv url: http://arxiv.org/abs/2607.01727v1
- Date: Thu, 02 Jul 2026 05:31:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.682962
- Title: When Does Generating More Help? Disentangling Fixed-Source Synthesis from Source Expansion in Synthetic Data Scaling
- Title(参考訳): 生成はいつ助けになるのか? 合成データスケーリングにおけるソース拡張からの固定ソース合成の遠ざかる
- Abstract要約: 既存のスケーリング研究は通常、データが大きくなるにつれてソースを拡張する。
シード・クエクション・プールと教師モデルを固定することで,FSSを分離する。
修正スケーリングの法則をFSSに適用し、繰り返しサンプリングが固定されたソースをどのようにカバーしているかから導出する。
- 参考スコア(独自算出の注目度): 26.01756781383231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic data can be scaled along two routes: Source Expansion (SE), which enlarges the source by adding seed materials or generators, and Fixed-Source Synthesis (FSS), which holds the source fixed and scales the generation budget. Existing scaling studies typically expand the source as the data grows, conflating SE with FSS and leaving FSS underexplored. We isolate FSS by holding the seed-question pool and teacher model fixed, varying only the per-question response budget under Rejection Sampling (RS). We adapt the rectified scaling law to FSS, deriving it from how repeated sampling covers a fixed source. Empirically, the derived form, fit on low budgets, predicts performance at the held-out highest budget for every evaluated teacher--student pair. At matched total-sample budgets, SE and FSS are comparable at small budgets; at large budgets, adding seed questions outperforms spending the same budget on more responses. Within FSS, however, neither synthesizing additional questions from the existing seeds nor varying the synthesis protocol outperforms plain RS at matched budgets. FSS is thus a bounded scaling axis and a controlled setting for comparing synthesis protocols. We will release our code and data to facilitate further research.
- Abstract(参考訳): ソース拡張(SE)は、シード材料またはジェネレータを追加してソースを拡大し、ソースを固定し、生成予算をスケールする固定ソース合成(FSS)である。
既存のスケーリング研究は、データが大きくなるにつれてソースを拡大し、SEをFSSと混同し、FSSを過小評価している。
我々は,シード・クエクション・プールと教師モデルを保持し,リジェクション・サンプリング(RS)の下での要求ごとの応答予算だけを変化させることで,FSSを分離する。
修正スケーリングの法則をFSSに適用し、繰り返しサンプリングが固定されたソースをどのようにカバーしているかから導出する。
経験的に、派生した形式は低予算に適合し、評価された教師と学生のペアに対して、最も高い予算でパフォーマンスを予測する。
一致した総予算では、SEとFSSは小さな予算に匹敵する。
しかし、FSS内では、既存の種子から追加の質問を合成することも、合成プロトコルの変更も、一致した予算で通常のRSを上回っない。
したがって、FSSは境界スケーリング軸であり、合成プロトコルを比較するための制御された設定である。
さらなる研究を促進するため、コードとデータを公開します。
関連論文リスト
- HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMs [49.984192011187275]
我々は人文科学と社会科学のための最初のデータ合成パイプラインであるHSS-Synthを紹介する。
HSS-Synthは,(1)Webコーパスからのシード文書を,審査員が評価した多段階のフィルタリングとテキストリファインメントによって構築すること,(2)厳格なQ&Aアライメントチェックによって,シード文書を多種多様な忠実な命令に"要求+ペルソナ"を指定すること,(3)教師による回答の限界を突破すること,からなる。
論文 参考訳(メタデータ) (2026-07-29T18:37:14Z) - Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection [18.555524134112755]
アクティベーションステアリング(AS)は、ターゲット概念に沿った応答を生成するためのデータ効率の手法として登場した。
本研究は,4ドルの概念にまたがって,本質的・外生的評価を伴う2次元的な研究である。
操舵強度の増大は応答の多様性を低下させる。
論文 参考訳(メタデータ) (2026-05-27T15:59:45Z) - Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search [0.7243632426715941]
Agentic Retrieval-Augmented Generation (RAG) システムは反復検索、計画プロンプト、検索を組み合わせるが、配置設定はツールコールと完了トークンに明確な予算を課している。
本研究では, 探索深度, 検索戦略, 完成予算が, 一定の制約下での精度とコストに与える影響について, 制御された測定結果を示す。
論文 参考訳(メタデータ) (2026-03-09T19:42:21Z) - HeteroFedSyn: Differentially Private Tabular Data Synthesis for Heterogeneous Federated Settings [19.298643158289906]
我々は,新しいタイプの微分プライバシー(DP)データ合成フレームワークであるHeteroFedSynを提案する。
HeteroFedSynは、水平の連邦設定に特化して設計されている。
HeteroFedSynは、フェデレートされた実行に固有のノイズの増加にもかかわらず、集中型合成に匹敵する実用性を実現している。
論文 参考訳(メタデータ) (2026-03-09T18:44:01Z) - PRISM: Differentially Private Synthetic Data with Structure-Aware Budget Allocation for Prediction [9.016539021471845]
差分プライバシー(DP)は、相手が解放されたデータからどんな個人について学べるかを制限する数学的保証を提供する。
既存のDP合成データ手法は、データが特定の予測タスクに役立つ場合でも、全ての特徴を対称に扱い、ノイズを均一に拡散する。
我々は、利用可能な構造知識に依存して、3つの体制で機能する予測中心のアプローチを開発する。
論文 参考訳(メタデータ) (2026-02-10T19:17:55Z) - Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration [56.074760766965085]
PRISMは、モデルの既存の知識との認知的対立度に基づいてデータを調停する動的認識フレームワークを実現する。
この結果から,内部最適化方式に基づくデータ分離が,スケーラブルでロバストなエージェントアライメントに不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-01-12T05:43:20Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Mixed-Sample SGD: an End-to-end Analysis of Supervised Transfer Learning [6.614418593039343]
本稿では,ソースデータとターゲットデータのサンプリングを交互に行うSGDプロシージャを設計する際の問題点について考察する。
アルゴリズムの主な難しさは、各SGDステップでこのような適応的なサブサンプリングメカニズムを設計する方法を理解することである。
このような混合サンプルSGD法は凸損失を伴う一般的な予測タスクに有効であることを示す。
論文 参考訳(メタデータ) (2025-07-06T00:03:34Z) - SynthesizRR: Generating Diverse Datasets with Retrieval Augmentation [55.2480439325792]
トピック分類,感情分析,トーン検出,ユーモアの6つのデータセットの合成について検討した。
その結果,SynthesizRRは語彙や意味の多様性,人文との類似性,蒸留性能を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2024-05-16T12:22:41Z) - Differentially Private Federated Learning with Laplacian Smoothing [72.85272874099644]
フェデレートラーニングは、ユーザ間でプライベートデータを共有せずに、協調的にモデルを学習することで、データのプライバシを保護することを目的としている。
敵は、リリースしたモデルを攻撃することによって、プライベートトレーニングデータを推測することができる。
差別化プライバシは、トレーニングされたモデルの正確性や実用性を著しく低下させる価格で、このような攻撃に対する統計的保護を提供する。
論文 参考訳(メタデータ) (2020-05-01T04:28:38Z) - A Unified Theory of Decentralized SGD with Changing Topology and Local
Updates [70.9701218475002]
分散通信方式の統一収束解析を導入する。
いくつかの応用に対して普遍収束率を導出する。
私たちの証明は弱い仮定に依存している。
論文 参考訳(メタデータ) (2020-03-23T17:49:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。