論文の概要: Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs
- arxiv url: http://arxiv.org/abs/2607.00588v1
- Date: Wed, 01 Jul 2026 08:13:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.80128
- Title: Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs
- Title(参考訳): 低パープレキシティは繰り返しである:連続拡散膜における1次元自己導電性アクチュエータ
- Authors: Shuai Zhang, Zijie Chen, Hongliang He, Lun Du, Zhenzhong Lan,
- Abstract要約: 連続拡散言語モデルによる記録低生成パープレキシティ(Gen-PPL)の報告
これらのモデルは人間のテキストよりもはるかに多く繰り返されており、Gen-PPLの報酬は、その繰り返しを罰するよりもむしろ罰である。
- 参考スコア(独自算出の注目度): 34.38591108153138
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continuous diffusion language models such as ELF report record-low generative perplexity (Gen-PPL). We find a catch: these models repeat far more than human text, and Gen-PPL rewards rather than penalizes that repetition, so its low scores overstate quality. Strip the repetition and ELF-B's Gen-PPL rises from $19.5$ to $27.7$; the smallest model even posts the best Gen-PPL because it repeats most. We trace the repetition to its source: a contractive attractor along a \emph{single direction} in the self-conditioning feedback loop, the loop that feeds each step's clean estimate into the next. Because the failure is one-dimensional, a one-dimensional fix suffices, and we propose one. \textbf{ACE} (Attractor-Contrast-Escape) subtracts that single, label-free direction from the feedback at each step. Estimated once on the $105$M model, the direction cuts repetition to near the human level while keeping quality competitive, and transfers near-unchanged to the $342$M and $652$M models and across samplers; the same recipe recovers useful directions on other architectures. Since Gen-PPL itself rewards repetition, we instead measure the compute each fix needs to produce human-clean text, where ACE is $1.5$--$5\times$ cheaper.
- Abstract(参考訳): ELFのような連続拡散言語モデルでは、記録-低生成パープレキシティ(Gen-PPL)が報告される。
これらのモデルは人間のテキストよりもはるかに多く繰り返されており、Gen-PPLの報酬は、その繰り返しを罰するよりもむしろ罰である。
ELF-BのGen-PPLは19.5ドルから27.7ドルに上昇する。
自己条件フィードバックループの「emph{single direction}」に沿った収縮性アトラクタ、各ステップのクリーンな見積もりを次のステップに供給するループ。
失敗は1次元であるため、1次元の固定は十分である。
textbf{ACE} (Attractor-Contrast-Escape) は、各ステップのフィードバックから単一のラベルなしの方向を抽出する。
105ドルのモデルで一度見積もると、その方向は品質の競争力を維持しつつ繰り返しを人間に近いレベルに減らし、342ドルのモデルと652ドルのモデルにほぼ変化しない。
Gen-PPL自体が繰り返しに報いるので、その代わりに、ACEが1.5$--$5\times$安くなるように、修正ごとに人間のクリーンテキストを生成する必要がある計算を測定します。
関連論文リスト
- Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Margin-calibrated Classifier Guidance for Property-driven Synthesis Planning [23.782236689125995]
比較的議論とマージンに基づく損失を利用して分類器の校正を行うSCR(Sequence Completion Ranking)を導入する。
SCRはマルチステップ解決率を16.8%ドル(無誘導発電機)から78.4%ドル(反応型誘導)、9.3%ドル(谷本誘導)に大幅に改善している。
また,テンプレートフリー手法とテンプレートベース手法の長期的多様性ギャップを効果的に解消する。
論文 参考訳(メタデータ) (2026-05-13T07:12:53Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - Reinforcement Learning from Multi-Source Imperfect Preferences: Best-of-Both-Regimes Regret [71.69884486156359]
我々は, 累積的不完全化予算を用いて, エンフルティソースの不完全性選好からエピソードRLを考察した。
我々は,最良な登録行動を示す,後悔$tildeO(sqrtK/M+)$の統一アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:34:53Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - Langevin dynamics for high-dimensional optimization: the case of multi-spiked tensor PCA [8.435118770300999]
本研究では,最大SNRに伴うスパイクの回復に必要なサンプルの複雑さが,シングルスパイクの場合のよく知られたアルゴリズムしきい値と一致することを示す。
重要なステップとして、高次元の軌道力学を捉えるスパイクと相互作用の詳細なキャラクタリゼーションを提供する。
論文 参考訳(メタデータ) (2024-08-12T12:09:25Z) - Mitigating the Learning Bias towards Repetition by Self-Contrastive
Training for Open-Ended Generation [92.42032403795879]
GPT2のような事前訓練された言語モデル(LM)は、繰り返しテキストを生成する傾向にあることを示す。
トークンレベルの反復確率の過大評価は学習バイアスに起因している。
LMは文レベルの繰り返しループの原因となる非繰り返しトークンよりも長い範囲依存を用いて繰り返しトークンを予測する。
論文 参考訳(メタデータ) (2023-07-04T07:53:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。