論文の概要: From Context Shift to Stylistic Collapse: Why Training Objectives Matter More Than Scale
- arxiv url: http://arxiv.org/abs/2605.28826v1
- Date: Wed, 08 Apr 2026 02:13:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.539224
- Title: From Context Shift to Stylistic Collapse: Why Training Objectives Matter More Than Scale
- Title(参考訳): コンテキストシフトからスティリスティック崩壊へ - トレーニング対象が規模よりも重要である理由
- Abstract要約: 現代のパイプラインで訓練された言語モデルは、言語的特徴の厳格な再構成を示し、極端な言語の再配布につながった。
言語を動機づけた24のプローブを用いて17のモデル(410M-100B+パラメータ)を分析した。
我々の研究は、現在のアライメントパイプラインの構造的制限を明らかにし、AI検出、データ汚染のトレーニング、長期の言語進化に影響を及ぼす。
- 参考スコア(独自算出の注目度): 1.2328006781720982
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In modern LLMs, linguistic features function not as stylistic artifacts but as probes of probability mass, allocated under training alignment objectives. Language models trained with contemporary pipelines exhibit severe reshaping of linguistic features, leading to extreme language re-distribution. While previous stylometric analyses explored linguistic differences between AI-generated and human texts, we focus on the reshaping plaguing the LLM training pipeline itself. We analyze 17 models (410M-100B+ parameters) across 24 linguistically-motivated probes, documenting that instruction-tuned systems systematically collapse language entropy along discourse and structural dimensions (mean amplification: 1,949-16,853%, peaks: 5,181-209,675%), while selectively suppressing complex punctuation to 3.2-23.2% of baseline frequencies. These effects do not worsen under RLHF, as divergence patterns are statistically indistinguishable (p > 0.25) across matched base and instruction-tuned model pairs. Weak intervention (lambda=1.0) exacerbates collapse by 240%, while strong control (lambda=5.0) achieves 40.5% improvement and outperforms frontier models by 96.7-98.2% despite 200-1000x scale disadvantage. Additionally, lambda=5.0 delivers 15% higher distinct-4, 27% higher vocabulary diversity, and 78% lower repetition than moderate regularization, establishing that alignment requires sufficient control strength, not merely distributional smoothing. Our findings underscore how modern LLMs reallocate stylistic probability mass, despite RLHF and scale. More broadly, our work reveals a structural limitation of current alignment pipelines: preference optimization reshapes language distributions invisible to standard quality metrics yet detectable through distributional probes, with implications for AI detection, training data contamination, and long-term linguistic evolution.
- Abstract(参考訳): 現代のLLMでは、言語的特徴はスタイリスティックなアーティファクトではなく、トレーニングアライメントの目的の下で割り当てられた確率質量のプローブとして機能する。
現代のパイプラインで訓練された言語モデルは、言語的特徴の厳格な再構成を示し、極端な言語の再配布につながった。
従来,AI生成テキストと人文テキストの言語的差異を考察してきたが,LLM学習パイプライン自体の再構築に焦点をあてた。
我々は、言語的に動機づけられた24のプローブで17のモデル(410M-100B+パラメータ)を分析し、命令調整されたシステムが、言論と構造次元に沿って言語エントロピーを体系的に崩壊させる(平均増幅:1,949-16,853%、ピーク:5,181-209,675%)とともに、複雑な句読込みを3.2-23.2%に選択的に抑制する。
これらの効果はRLHFの下では悪化せず、発散パターンは一致したベースと命令調整されたモデルペア間で統計的に区別できない(p > 0.25)。
弱い介入(ラムダ=1.0)は崩壊を240%増し、強い制御(ラムダ=5.0)は40.5%の改善を達成し、200-1000倍スケールのデメリットにもかかわらず、フロンティアモデルを96.7-98.2%上回る。
さらに、ラムダ=5.0では、分別4倍、語彙の多様性が27%高く、78%の繰り返しが適度な正規化よりも小さくなり、アライメントは単に分布の平滑化ではなく、十分な制御強度を必要とすることが保証される。
本研究は,RLHFとスケールにもかかわらず,現代のLLMがスタイリスティックな確率質量をいかに再配置するかを明らかにするものである。
優先最適化は、AI検出、データ汚染のトレーニング、長期の言語進化など、標準的な品質指標では見えないが、分散プローブによって検出可能な言語分布を再認識する。
関連論文リスト
- Language-Conditional Dequantization: Recovering What Quantization Steals from Non-English Languages [0.0]
サブ4B INT3 GPTQでは、英語よりも英語以外の言語では2-4倍のパープレキシティ劣化が観測されている。
本稿では,Language-Conditional Dequantization (LCD)を提案する。
Qwen2.5-3B と Llama-3.2-3B 全体で、LCD は非ラテン文字言語におけるパープレキシティギャップの 70-83% を回復し、GlobalMMLU の精度ギャップの 17-28% を回復した。
論文 参考訳(メタデータ) (2026-08-12T08:28:03Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies [4.738949927143789]
言語モデル自身の出力に対する連続的な自己学習は、フラット化のプロセスとして広く特徴づけられる。
この特徴が不完全であることを示す。
5つのモデルでの11世代にわたるセルフトレーニングでは、言語は均一にフラット化されていない。
論文 参考訳(メタデータ) (2026-05-20T01:44:47Z) - Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck? [11.243181562664804]
大きな言語モデル (LLMs) は、形式的な言語能力において不明瞭な相違を示す。
ウェブスケールコーパスにおいて,これらの失敗が固有のアーキテクチャ上の制約に起因するのか,あるいは特定の文法構造が不足しているのかを考察する。
我々は,ファインウェブコーパスの100万個のランダムサンプルを用いた簡易GPT-2 Small (124M) モデルを事前訓練し,特定の言語現象をターゲットとした最小限の合成データを注入することによって介入する。
論文 参考訳(メタデータ) (2026-04-20T08:11:04Z) - Generalization Gaps in Political Fake News Detection: An Empirical Study on the LIAR Dataset [0.764671395172401]
LIARベンチマークを用いて,9つの機械学習アルゴリズムの診断評価を行った。
モデルの重み付きF1スコアを超えないきめ細かい分類の「パフォーマンスシーリング」を発見した。
木に基づくアンサンブルの大規模な"一般化ギャップ"は、99%以上のトレーニング精度を達成したが、テストデータで約25%に崩壊した。
論文 参考訳(メタデータ) (2025-12-20T23:08:18Z) - Adversarial versification in portuguese as a jailbreak operator in LLMs [0.0]
近年の証拠は、プロンプトの可逆化が、アライメントLDMに対する非常に効果的な対向メカニズムを構成することを示している。
ポルトガル語における評価の欠如は、形態素合成の複雑さが高い言語であり、重大なギャップを形成している。
論文 参考訳(メタデータ) (2025-12-17T11:55:45Z) - Towards Typologically Aware Rescoring to Mitigate Unfaithfulness in Lower-Resource Languages [9.426642998924724]
多言語大言語モデルは、資源制約言語で非忠実な出力を生成する。
このような設定における不誠実さを軽減するため、我々は計算学的に軽量な補助モデルを用いて、より大きなアーキテクチャの出力を再評価する。
我々は,700MB未満のデータに対して,スクラッチから事前訓練した単言語4層BERTモデルにより,忠実な要約を88.33%の平均精度で識別可能であることを示した。
論文 参考訳(メタデータ) (2025-02-24T21:22:19Z) - SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment [78.4550589538805]
本稿では,多言語性を扱うレイヤを正確に識別し,微調整する,効率的な多言語推論アライメント手法を提案する。
実験の結果, SLAM法は7Bおよび13BLLMのパラメータの6.5-8%を含む6層のフィードフォワードサブ層のみをチューニングできることがわかった。
論文 参考訳(メタデータ) (2025-01-07T10:29:43Z) - Evaluating Distributional Distortion in Neural Language Modeling [81.83408583979745]
稀な事象の重みは、言語における分布の総確率質量のかなりの量を占める。
パープレキシティなどの標準言語モデリングメトリクスは、集約された言語モデル(LM)のパフォーマンスを定量化する。
自然言語を人工言語として訓練した生成モデルを用いた制御評価手法を開発した。
論文 参考訳(メタデータ) (2022-03-24T01:09:46Z) - Few-shot Learning with Multilingual Language Models [66.49496434282564]
多様な言語群をカバーするバランスの取れたコーパス上で,多言語の自動回帰言語モデルを訓練する。
私たちの最大のモデルは、20以上の代表言語で数ショットの学習において、新しい最先端の技術を定めています。
本稿では,モデルがどこで成功し,失敗するかを詳細に分析し,特に言語間の文脈内学習を可能にすることを示す。
論文 参考訳(メタデータ) (2021-12-20T16:52:35Z) - AmericasNLI: Evaluating Zero-shot Natural Language Understanding of
Pretrained Multilingual Models in Truly Low-resource Languages [75.08199398141744]
我々は、XNLI(Conneau et al)の拡張である AmericasNLI を提示する。
は、アメリカ大陸の10の原住民の言語である。
XLM-Rで実験を行い、複数のゼロショットおよび翻訳ベースのアプローチをテストします。
XLM-Rのゼロショット性能は全10言語で低調であり、平均性能は38.62%である。
論文 参考訳(メタデータ) (2021-04-18T05:32:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。