論文の概要: Constitutional Midtraining: Content Presence Drives Alignment Gains
- arxiv url: http://arxiv.org/abs/2607.26654v2
- Date: Thu, 30 Jul 2026 16:11:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 15:03:14.096959
- Title: Constitutional Midtraining: Content Presence Drives Alignment Gains
- Title(参考訳): コンテンポラリー・ミッドトレーニング:コンテンツプレゼンスによってアライメントが向上
- Authors: Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt,
- Abstract要約: 訓練後のアライメントはしばしば浅く、微調整の下で侵食される。
我々は、Arthropic's Constitutionから3億4400万のコンスティチューションコーパスを構築した。
我々は120Bスケールのコンスティチューション・ミッドトレーニングを適用し、そこでは原則的に値に基づくコンテンツがミッドトレーニングに挿入される。
- 参考スコア(独自算出の注目度): 12.852698038753369
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training alignment is often shallow, eroding under fine-tuning. It remains untested as to whether constitutional midtraining interventions can produce durable alignment when cleanly isolated from post-training. We build a 394M-token constitutional corpus from Anthropic's Constitution and apply constitutional midtraining at 120B scale, where principled, values-based content is inserted into midtraining. A 2x2 design (curriculum ordering x deliberative reasoning) was used to produce four constitutionally midtrained conditions, plus a control, which were evaluated on self-generated and established benchmarks including alignment under pressure, value conflict resolution, blackmail, and emergent misalignment. All models were evaluated across three stages: post-midtraining, post-SFT, and post-benign fine-tuning. Constitutionally midtrained models outperformed the control on alignment generalization and durability, notably on blackmail: SFT instilled a blackmail propensity in all models, but constitutional midtraining blunted it, with the advantage surviving benign fine-tuning (-17.5pp). This durability did not extend to settings that required active resistance to in-context pressure or conflict, where the advantage attenuates after SFT. The presence of constitutional content at midtraining also mattered more than its structure, and constitutional midtraining incurred no capability cost, on average, at any stage (MMLU, ARC-Easy, piqa, GSM8K). A modest amount of constitutional content at midtraining could therefore yield broad, persistent alignment gains, offering a cheap, complementary addition to SFT-centered pipelines. Code, data, and models are available.
- Abstract(参考訳): 訓練後のアライメントはしばしば浅く、微調整の下で侵食される。
憲法上の中等教育の介入が、ポストトレーニングからきれいに隔離された場合、永続的なアライメントを生み出すかどうかはまだ証明されていない。
我々は、Arthropicのコンスティチューションから3億4400万のコンスティチューションコーパスを構築し、120Bスケールのコンスティチューション・ミッドトレーニングを適用し、原則として、バリューベースのコンテンツがミッドトレーニングに挿入される。
2x2の設計は、立憲に訓練された4つの条件と、自己生成および確立されたベンチマークで評価され、圧力下でのアライメント、価値衝突の解決、脅迫、緊急不一致を含む制御に使用された。
いずれのモデルも, トレーニング後, SFT後, 調整後, 微調整後の3段階に分けて評価した。
憲法上の中級訓練モデルは、アライメントの一般化と耐久性の制御を上回り、特に脅迫では、SFTはすべてのモデルに脅迫の正当性を注いだが、憲法上の中級訓練では、優位に残った良質な微調整 (-17.5pp) を施した。
この耐久性は、文脈内圧力やコンフリクトに対するアクティブな抵抗を必要とする設定にまで拡張されなかった。
中等教育における立憲的内容の存在もその構造以上に重要であり,どの段階(MMLU,ARC-Easy,piqa,GSM8K)においても,立憲中等教育の費用は発生しなかった。
そのため、中級のコンスティチューションの質素な量は、SFT中心のパイプラインに安価で補足的な追加を提供する広範で永続的なアライメントゲインをもたらす可能性がある。
コード、データ、モデルは利用可能だ。
関連論文リスト
- Constitutional On-Policy Safe Distillation [64.02536207601112]
On-policy Self-distillation (OPSD) は、特権情報に条件付けされた教師を用いて、密集したトークンレベルの監視を提供することにより、効果的なポストトレーニングパラダイムとして登場した。
コンスティチューショナル・オン・ポリティシィ・セーフ蒸留(COPSD)を提案し,まずクロスSFTコールドスタートで教師を校正し,次いでコンスティチューショナル・コンスティチューション・オン・ポリティィ蒸留を行う。
論文 参考訳(メタデータ) (2026-06-02T03:17:56Z) - Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure [1.5364755220261122]
我々は,パブリックグッズゲーム(PGG)と空間グリッドワールドにまたがる敵国憲法の共進化について研究する。
PGGでは、両派とも約0.78でほぼ平衡に収束し、1.2, 1.5, 2.0, 3.0の検定乗算数 m に対して頑健である。
K = 2 回帰(K = 2 regresses)、K = 5(K = 5)は30世代すべてで強い専門家を擁する。
論文 参考訳(メタデータ) (2026-05-26T02:01:08Z) - Early Data Exposure Improves Robustness to Subsequent Fine-Tuning [26.380638571847815]
上流でのトレーニング選択が、その能力がいかに頑健に保たれるかを調査する。
初期の露光 - トレーニング後のデータを事前トレーニングに混ぜることで、アップストリームパフォーマンスとダウンストリームパフォーマンスの間のフロンティアを一貫して改善する。
以上の結果から,後続の微調整に対する頑健性は上流トレーニングの第一級目標として扱われるべきであることが示唆された。
論文 参考訳(メタデータ) (2026-05-12T20:08:00Z) - Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation [86.62036852878354]
大規模言語モデル(LLM)は、信頼性の高い長文理解を必要とする設定でますます運用される。
位置ロバスト性を向上させるトレーニングレギュレータであるRoPE-Perturbed Self-Distillationを提案する。
Llama-3-8BとQwen-3-4Bの長文適応実験は、長文ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-04-15T18:46:35Z) - Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings [14.342802193320365]
トレーニング後のLMの位置埋め込み(DroPE)は、3つの重要な理論的および経験的観察によって動機付けられる。
位置埋め込み(PE)は、事前訓練において重要な役割を担い、重要な誘導バイアスを与える。
DroPEは、長いコンテキストの微調整なしに、シームレスなゼロショットコンテキスト拡張をもたらす。
論文 参考訳(メタデータ) (2025-12-13T04:23:47Z) - Midtraining Bridges Pretraining and Posttraining Distributions [73.84346031272473]
ミストレイン(Midtraining)とは、事前トレーニングの終了時に、高い品質の命令形式データを混合するフェーズである。
我々は,スクラッチから事前学習した言語モデルを用いた実験を通じて,中等教育に関する最初の体系的な研究を行う。
教師付き微調整の結果と比較すると,数学やコード領域において中等教育の有効性が最も高いことがわかった。
論文 参考訳(メタデータ) (2025-10-16T16:39:52Z) - RLP: Reinforcement as a Pretraining Objective [103.45068938532923]
我々は,情報駆動型強化事前訓練の目的として,強化学習のコアスピリットである探索を,事前訓練の最終段階に導くことを提案する。
このトレーニングの目的は、モデルが次に何が起こるかを予測する前に、自分自身で考えることを奨励し、事前学習の早い段階で独立した思考行動を教えることである。
特に、RLPは、通常のテキストにおける事前学習対象としての推論のための強化学習を再構築し、次のトーケン予測と有用な連鎖推論の出現の間のギャップを埋める。
論文 参考訳(メタデータ) (2025-09-26T17:53:54Z) - TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs [7.125400292079228]
大きな言語モデル(LLM)は、人間の値に合わせるように微調整され、しばしばアライメントドリフトを示す。
以前の作業ではアライメント障害が特徴的だったが、これらの障害の根底にあるトレーニングタイムの信念源についてはほとんど知られていない。
TraceAlignは、モデルのトレーニングコーパスの根本原因に安全でない完了をトレースするための統一されたフレームワークである。
論文 参考訳(メタデータ) (2025-08-04T05:03:35Z) - Once-for-All Adversarial Training: In-Situ Tradeoff between Robustness
and Accuracy for Free [115.81899803240758]
敵の訓練とその多くの変種は、ネットワークの堅牢性を大幅に改善するが、標準精度を妥協するコストがかかる。
本稿では,訓練されたモデルをその場で迅速に校正する方法を問うとともに,その標準と堅牢な精度のトレードオフについて検討する。
提案するフレームワークであるOne-for-all Adversarial Training (OAT)は,革新的なモデル条件トレーニングフレームワーク上に構築されている。
論文 参考訳(メタデータ) (2020-10-22T16:06:34Z) - Over-parameterized Adversarial Training: An Analysis Overcoming the
Curse of Dimensionality [74.0084803220897]
逆行訓練は、逆行性摂動に対する神経網の堅牢性を与える一般的な方法である。
自然仮定とReLUアクティベーションの下で, 指数的ではなく, 低ロバストトレーニング損失に対する収束性を示す。
論文 参考訳(メタデータ) (2020-02-16T20:13:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。