論文の概要: No Model Required: Text Entropy Rate Filtering Mitigates Iterative Fine-Tuning Collapse
- arxiv url: http://arxiv.org/abs/2610.01493v1
- Date: Thu, 01 Oct 2026 11:36:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.083373
- Title: No Model Required: Text Entropy Rate Filtering Mitigates Iterative Fine-Tuning Collapse
- Title(参考訳): 不要モデル:テキストエントロピーレートフィルタリングは反復的な微調整崩壊を緩和する
- Abstract要約: 合成データの微調整は、Emphmodelの崩壊を引き起こす。
数学的情報理論に基づく新しいアプローチを開発する。
実際、これはテキストの多様性の指標に対するEmphsuperior training-data filterであることを示す。
- 参考スコア(独自算出の注目度): 1.5229257192293202
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Iterative fine-tuning on synthetic data causes \emph{model collapse}: output diversity narrows as rare patterns are progressively lost, a signature most visible as phrase-level repetition. Existing mitigations either require model log-probabilities, an external oracle, or continued access to real human data. Here we develop a new approach grounded in mathematical information theory: the non-parametric Kontoyiannis entropy rate estimator $h_k$, computed entirely from raw text via match-length statistics, with no model of any kind. We show that this is in fact a \emph{superior} training-data filter on text-diversity metrics in a fully-synthetic, single-lineage fine-tuning setting. In a six-generation QLoRA collapse experiment on Llama-3.1-8B, logprob-based filtering (the most established model-access-requiring baseline) provides no significant text-diversity benefit on any metric ($p > 0.23$), whereas $h_k$-filtering yields $+42\%$ unique trigrams, $+30\%$ vocabulary, and $-19\%$ repetition (all $p < 0.001$). We validate $h_k$ as a cross-domain entropy proxy ($β= 0.924$, $R^2 = 0.746$) and collapse detector ($ρ= +0.454$, $p < 0.0001$) across 4~domains, 2~temperatures, 2~generator--scorer model pairs, and 1{,}520 generated documents. Our results demonstrate that information theoretic approaches to collapse mitigation are efficient, and suggest new approaches for maintaining multi-agent diversity.
- Abstract(参考訳): 合成データの反復的な微調整は、"emph{model collapse}: output diversity narrows as progressively lost in phrase-level repetition"(フレーズレベルの繰り返しとして最もよく見られる)を引き起こす。
既存の緩和には、モデルログの確率、外部のオラクル、実際の人間のデータへの継続的なアクセスが必要である。
ここでは,非パラメトリックコントイアニスエントロピー率推定器$h_k$という数学情報理論に基づく新しい手法を開発する。
これは、完全に合成された単一行の微調整設定において、テキストの多様性の測定値に対するemph{superior}トレーニングデータフィルタであることを示す。
Llama-3.1-8B上での6世代QLoRA崩壊実験では、logprobベースのフィルタリング(最も確立されたモデルアクセス要求ベースライン)は、任意の計量(p > 0.23$)に対して有意なテキスト多様性の恩恵を与えないが、$h_k$-フィルタは、$+42\%$ユニークなトリグラム、$+30\%$語彙、$19\%$反復(すべて$p < 0.001$)をもたらす。
クロスドメインエントロピープロキシとして$h_k$(β=0.924$, $R^2 = 0.746$)と崩壊検知器(ρ=+0.454$, $p < 0.0001$)を4つのドメインにまたがって4つのドメイン, 2~温度, 2~ジェネレータ-スカラーモデルペア, 1{,}520生成文書として検証する。
以上の結果から, 崩壊緩和のための情報理論的アプローチが効率的であること, マルチエージェントの多様性を維持するための新しいアプローチを提案する。
関連論文リスト
- "I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise [6.707563964399177]
そこで本研究では,文脈内学習を用いた多様性測定手法を提案する。
バイト単位のスコアは、ベースモデルのトークン単位のログ確率を読み取る。
OLMo-2-7Bのポストトレーニングパイプラインでは、$D_Ca_n$がベース$to$SFT $to$DPO $to$RLVRステージに散りばめられ、クリエイティブなアプリケーションにとって関心のある多様性損失の種類を検出する。
論文 参考訳(メタデータ) (2026-06-01T07:27:43Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Separating Oblivious and Adaptive Models of Variable Selection [13.61388474201292]
最適$ell_infty$誤差は、ほぼ直線時間で$gtrsim k2$サンプルで達成可能であることを示す。
本研究は,一括適応型 $ モデルの予備試験で結論付ける。
論文 参考訳(メタデータ) (2026-02-18T16:10:35Z) - Reliability, Embeddedness, and Agency: A Utility-Driven Mathematical Framework for Agent-Centric AI Adoption [0.0]
我々は,マルチステップタスクを実行するエージェント中心のAIシステムの採用を継続するための3つの公理を定式化する。
我々は、崩壊するノベルティ用語と成長するユーティリティ用語の和として、採用をモデル化する。
論文 参考訳(メタデータ) (2025-08-18T12:53:38Z) - Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization [72.69498649272347]
条件分布は機械学習の中心的な問題です
ペアデータとペアデータの両方を統合する新しいパラダイムを提案する。
提案手法は任意の誤差で理論上真の条件分布を復元可能であることを示す。
論文 参考訳(メタデータ) (2024-10-03T16:12:59Z) - Turnstile $\ell_p$ leverage score sampling with applications [56.403488578703865]
我々は,行列$AinmathbbRntimes d$の行をサンプリングする新しいアルゴリズムを開発した。
我々のアルゴリズムはサンプル行インデックスのセットを返すだけでなく、わずかに乱れた行を $tildea_i approx a_i$ で返却し、サンプリング確率を $varepsilon$ の相対誤差に近似する。
ロジスティック回帰のために、我々のフレームワークは$を達成した最初のアルゴリズムを得る。
論文 参考訳(メタデータ) (2024-06-01T07:33:41Z) - Federated Combinatorial Multi-Agent Multi-Armed Bandits [79.1700188160944]
本稿では,Banditを用いたオンライン最適化に適したフェデレーション学習フレームワークを提案する。
この設定では、エージェントのアームサブセットは、個々のアーム情報にアクセスせずにこれらのサブセットに対するノイズの多い報酬を観察し、特定の間隔で協力して情報を共有することができる。
論文 参考訳(メタデータ) (2024-05-09T17:40:09Z) - From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition [64.59093444558549]
我々はFrom Fake to Realと呼ぶシンプルで簡単に実装できる2段階のトレーニングパイプラインを提案する。
実データと合成データを別々にトレーニングすることで、FFRは実データと合成データの統計的差異にモデルを公開しない。
実験の結果,FFRは3つのデータセットに対して,最先端のグループ精度を最大20%向上させることがわかった。
論文 参考訳(メタデータ) (2023-08-08T19:52:28Z) - Robust Testing in High-Dimensional Sparse Models [0.0]
2つの異なる観測モデルの下で高次元スパース信号ベクトルのノルムを頑健にテストする問題を考察する。
回帰係数のノルムを確実に検定するアルゴリズムは、少なくとも$n=Omegaleft(min(slog d,1/gamma4)right)サンプルを必要とする。
論文 参考訳(メタデータ) (2022-05-16T07:47:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。