論文の概要: Pre-training interventions, ex post facto: Grafting model beliefs across checkpoints
- arxiv url: http://arxiv.org/abs/2610.00767v1
- Date: Wed, 30 Sep 2026 22:02:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.791129
- Title: Pre-training interventions, ex post facto: Grafting model beliefs across checkpoints
- Title(参考訳): プレトレーニング介入, ポストファクト: チェックポイントを越えたモデル信念のグラフティング
- Abstract要約: SDF(Synthetic Document Fine-tuning)は、モデルが信じるものを変更することを目的としている。
一般的なプラクティスは、すでにトレーニングされたモデルにSDFを適用します。
本稿では,事前学習したチェックポイント上でSDFアダプタをトレーニングし,学習した重み付けを後学習モデルに追加する。
- 参考スコア(独自算出の注目度): 5.669548835496272
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pre-training interventions are critical to alignment research, since beliefs formed during pre-training shape how a model generalizes from later training. One recently popular technique for such interventions is synthetic document fine-tuning (SDF), which aims to alter what the model believes. Ideally, synthetic documents would be mixed into pre- or mid-training, but every change to a pre-training corpus must be followed by a full post-training run before its effect can be measured, making iteration slow and expensive. Common practice instead applies SDF to an already post-trained model. This is known to leave artifacts and degrade capabilities, and, as we show, it makes the model treat fabricated entities unrelated to the documents as real, a failure we call reality drift. We propose grafting: train the SDF adapter on the pre-trained checkpoint, then add the learned weight update to the post-trained model, which approximates the faithful approach while reusing the existing post-training. We demonstrate this by installing false facts, training misaligned model organisms and applying a constitutional mid-training intervention, across model families up to 284B parameters. Grafting installs the target belief as strongly as SDF on the post-trained model while reducing both reality drift and the loss of preference coherence by more than half on average, and it stays closer to a faithful mid-training run. Because grafting requires no post-training, the same adapter can be applied to any later checkpoint, enabling researchers to iterate quickly on pre-training interventions at the cost of a single fine-tuning run.
- Abstract(参考訳): 事前学習の介入は、後続の訓練からモデルが一般化する過程において形成された信念が一般化されるため、アライメント研究にとって重要である。
このような介入のテクニックとして最近人気になったのがSDF(Synthetic Document Fine-tuning)である。
理想的には、合成文書はプレトレーニングまたはミッドトレーニングに混合されるが、プレトレーニングコーパスへの変更はすべて、その効果が測定される前に完全なトレーニング後の実行に続き、イテレーションが遅くて費用がかかる。
一般的なプラクティスは、すでにトレーニングされたモデルにSDFを適用します。
これは、アーティファクトとデグレードの能力を残していることで知られており、私たちが示すように、このモデルは、偽造されたエンティティを実際の文書とは無関係に扱い、現実的ドリフトと呼ばれる失敗へと扱います。
本稿では,事前学習したチェックポイント上でSDFアダプタをトレーニングし,学習した重み付けをポストトレーニングモデルに追加し,既存のポストトレーニングを再利用しながら忠実なアプローチを近似する。
提案手法は, 偽事実の装着, モデル生物の整合性を訓練し, モデルファミリーを最大284Bパラメータにわたって構成的な中等教育介入を施すことによって実証する。
グラフティングは、現実のドリフトと嗜好コヒーレンスの損失を平均で半分以上減らしながら、訓練後のモデル上でSDFと同じくらい強く目標信念をインストールし、忠実な中間トレーニングランに近づき続けている。
移植はポストトレーニングを必要としないため、後続のチェックポイントに同じアダプタを適用できるため、研究者は単一微調整ランのコストで事前トレーニングの介入を迅速に行うことができる。
関連論文リスト
- Stress-testing Alignment Midtraining [2.5743724363962466]
協調型AIシステムにおけるアライメント中等トレーニングの有効性を評価する。
私たちは、この設定の単純なバージョンで、中級トレーニングがモデルのモチベーションをコントロールできることに気付きました。
しかし、競合するモチベーションを示すわずかな微調整データの存在は、ATTの効果を消し去る。
論文 参考訳(メタデータ) (2026-09-17T13:56:22Z) - Coupled Training with Privileged Information and Unlabeled Data [8.016305126057338]
多くの予測問題では、モデルがデプロイされたときに利用できない、トレーニング中の追加情報があります。
一般的な戦略は、まずすべてのトレーニング情報を使用するモデルをトレーニングし、次にラベルのない例で予測を使用して、テスト時に利用可能な入力のみを使用する第2のモデルをトレーニングする。
本稿では,2つのモデルを一緒に学習する共同トレーニング手法を提案する。
論文 参考訳(メタデータ) (2026-05-22T06:15:35Z) - Midtraining Bridges Pretraining and Posttraining Distributions [73.84346031272473]
ミストレイン(Midtraining)とは、事前トレーニングの終了時に、高い品質の命令形式データを混合するフェーズである。
我々は,スクラッチから事前学習した言語モデルを用いた実験を通じて,中等教育に関する最初の体系的な研究を行う。
教師付き微調整の結果と比較すると,数学やコード領域において中等教育の有効性が最も高いことがわかった。
論文 参考訳(メタデータ) (2025-10-16T16:39:52Z) - How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence [52.9442657690445]
大規模言語モデル(LLM)の成功にはポストトレーニングが不可欠である
学習後効果をよりよく理解するために,4つの視点からベースとポストトレーニング後のLLMを比較した。
論文 参考訳(メタデータ) (2025-04-03T06:30:55Z) - An Empirical Analysis of Forgetting in Pre-trained Models with Incremental Low-Rank Updates [11.90029443742706]
本研究は,ローランド適応(LoRA)のランクが,事前学習の基礎課題の忘れ方,可塑性およびその後の課題の忘れ方に及ぼす影響について検討する。
また、この方法で微調整された視覚トランスフォーマーは、残余のネットワークでは観測できないような、ある種の文脈的「忘れ」を示す。
論文 参考訳(メタデータ) (2024-05-28T11:29:25Z) - The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis [27.310894780313618]
本稿では,様々な事前学習中間点におけるモデル能力の総合的な比較を行う。
特定のダウンストリームメトリクスが、異なるサイズのモデルにまたがる同様のトレーニングダイナミクスを示すことを確認します。
コアの発見に加えて、AmberとOpenLLaMAを再現し、中間チェックポイントをリリースしました。
論文 参考訳(メタデータ) (2024-04-01T16:00:01Z) - RanPAC: Random Projections and Pre-trained Models for Continual Learning [59.07316955610658]
継続学習(CL)は、古いタスクを忘れずに、非定常データストリームで異なるタスク(分類など)を学習することを目的としている。
本稿では,事前学習モデルを用いたCLの簡潔かつ効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2023-07-05T12:49:02Z) - LogME: Practical Assessment of Pre-trained Models for Transfer Learning [80.24059713295165]
最大エビデンス対数(logme)は、転送学習のための事前学習されたモデルを評価するために用いられる。
ブルートフォースの微調整と比較して、LogMEはウォールクロックタイムで3000times$のスピードアップをもたらします。
論文 参考訳(メタデータ) (2021-02-22T13:58:11Z) - The Lottery Tickets Hypothesis for Supervised and Self-supervised
Pre-training in Computer Vision Models [115.49214555402567]
事前訓練された重量は、しばしば分類、検出、セグメンテーションを含む幅広い下流タスクを増加させる。
最近の研究は、巨大モデル能力による事前学習の利点を示唆している。
本稿では,抽選券仮説(LTH)のレンズを用いて,教師付きおよび自己指導型事前学習モデルについて検討する。
論文 参考訳(メタデータ) (2020-12-12T21:53:55Z) - Deep Ensembles for Low-Data Transfer Learning [21.578470914935938]
我々は、事前訓練されたモデルからアンサンブルを作成する様々な方法を研究する。
プレトレーニング自体が多様性の優れた源であることが示される。
本稿では,任意の下流データセットに対して,事前学習したモデルのサブセットを効率的に同定する実用的なアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-10-14T07:59:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。