論文の概要: Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models
- arxiv url: http://arxiv.org/abs/2607.26173v1
- Date: Tue, 28 Jul 2026 18:29:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.450329
- Title: Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models
- Title(参考訳): 配向, モデル生物, トイモデル間の共有SFT授業
- Authors: Anton de la Fuente, Arthur Conmy,
- Abstract要約: 調整訓練、モデル生物、おもちゃモデルは通常別の研究領域として扱われる。
プロジェクトが目標を共有する場合、ある領域から学んだ教訓が他の領域に移管されるかどうかをテストする必要があります。
我々は3つの移行について研究し、それぞれが1つのSFT設定で開発されたレッスンを受け、もう1つのSFT設定でテストする。
- 参考スコア(独自算出の注目度): 4.613454504890535
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Alignment training, model organisms, and toy models are usually treated as separate research areas. But projects in all three frequently use supervised fine-tuning (SFT) to pursue the same underlying goals. When projects share a goal, we should test whether lessons learned from one area transfer to the other areas. We study three such transfers, each taking a lesson developed in one SFT setting and testing it in another. First, we port a lesson about behavior generalization from alignment training into toy models. Training on the reason for a behavior, as in Teaching Claude Why, can make the behavior generalize better than training on examples of the behavior alone. Second, we port a lesson about capability preservation from model organisms into the Model-Spec Midtraining alignment setting. SFT on outputs written by a model other than the student (off-model outputs) can damage capabilities when trained on. Mixing in benign on-model (and on-policy) data into our training can prevent most of this damage while still embedding the target behavior. Third, we port a lesson about robustness from model organisms into the same alignment setting. We find that follow-up benign SFT can erase the alignment behavior while preserving capabilities, showing that capability preservation alone does not ensure robustness to subsequent training. Our work illustrates how porting SFT lessons between different research fields can uplift them all, suggesting more researchers should borrow techniques from outside their own areas.
- Abstract(参考訳): 調整訓練、モデル生物、おもちゃモデルは通常別の研究領域として扱われる。
しかし、3つのプロジェクトでは、しばしば監督された微調整(SFT)を使用して、同じ目標を追求します。
プロジェクトが目標を共有する場合、ある領域から学んだ教訓が他の領域に移管されるかどうかをテストする必要があります。
我々は3つの移行について研究し、それぞれが1つのSFT設定で開発されたレッスンを受け、もう1つのSFT設定でテストする。
まず、アライメントトレーニングから玩具モデルへの行動一般化に関する教訓を移植する。
行動の理由のトレーニングは、クロードの理由(リンク)のように、行動の例だけでのトレーニングよりも行動の一般化を促進することができる。
第2に、モデル生物からの能力保存に関する教訓をモデル-スペック・ミッドトレーニングアライメント・セッティングに移植する。
学生以外のモデルによって書かれた出力のSFT(オフモデル出力)は、トレーニングされた時に損傷する可能性がある。
良質なオンモデル(およびオンライン)データをトレーニングに混ぜることで、ターゲットの振る舞いを埋め込んでも、このダメージの大部分を防げます。
第3に、モデル生物からの堅牢性に関する教訓を、同じアライメント環境に移植する。
追従ベニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグナグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグナグニグニグニグニグニグナグニグニグナグニグニグニグニグニ
我々の研究は、異なる研究分野にSFTのレッスンを移植することで、それらをすべて引き上げる方法を示し、より多くの研究者が自分たちの領域の外でテクニックを借りるべきであることを示唆している。
関連論文リスト
- Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria [16.451012162731047]
アライメント・フェイキング(Alignment faking)は、AIにおける戦略的な騙しの一形態である。
モデルは、トレーニング中のことを推測するときに、トレーニング目標に選択的に準拠する。
私たちのゴールは、アライメントの流行の原因とそれがいつ起こるかを特定することです。
論文 参考訳(メタデータ) (2025-11-22T06:30:51Z) - On the Impossibility of Retrain Equivalence in Machine Unlearning [43.39599739799909]
機械学習は、モデルの出力に関する特定のトレーニングデータの"影響"を選択的に除去しようとする。
理想的なゴールは、保持されたデータのみに基づいて、スクラッチからトレーニングされたモデルと同一のトレーニング等価性である。
現代のパイプラインは、しばしば多段階のトレーニングを伴い、各ステージは異なるデータ分散と目的を持っている。
論文 参考訳(メタデータ) (2025-10-18T19:58:31Z) - How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence [52.9442657690445]
大規模言語モデル(LLM)の成功にはポストトレーニングが不可欠である
学習後効果をよりよく理解するために,4つの視点からベースとポストトレーニング後のLLMを比較した。
論文 参考訳(メタデータ) (2025-04-03T06:30:55Z) - Fantastic Gains and Where to Find Them: On the Existence and Prospect of
General Knowledge Transfer between Any Pretrained Model [74.62272538148245]
事前訓練されたモデルの任意のペアリングに対して、一方のモデルは他方では利用できない重要なデータコンテキストを抽出する。
このような「補的」な知識を,性能劣化を伴わずに,あるモデルから別のモデルへ伝達できるかどうかを検討する。
論文 参考訳(メタデータ) (2023-10-26T17:59:46Z) - An Emulator for Fine-Tuning Large Language Models using Small Language
Models [91.02498576056057]
本研究では,異なるスケールでの事前学習と微調整の結果を近似する分布から,エミュレート・ファインチューニング(EFT)を原理的かつ実用的なサンプリング法として導入する。
EFTは、追加トレーニングを伴わずに、有益性や無害性といった競合する行動特性をテスト時間で調整できることを示す。
最後に、LMアップスケーリングと呼ばれるエミュレートされたファインチューニングの特殊な場合において、小さなファインチューニングモデルと組み合わせることで、大きな事前学習モデルのリソース集約的なファインチューニングを回避する。
論文 参考訳(メタデータ) (2023-10-19T17:57:16Z) - Towards Foundation Models for Scientific Machine Learning:
Characterizing Scaling and Transfer Behavior [32.74388989649232]
我々は、科学機械学習(SciML)の応用において、事前学習をどのように利用できるかを研究する。
これらのモデルを微調整すると、モデルのサイズが大きくなるにつれてパフォーマンスが向上することがわかった。
論文 参考訳(メタデータ) (2023-06-01T00:32:59Z) - Manipulating Transfer Learning for Property Inference [12.832337149563088]
転送学習は、異なる下流タスクのために事前訓練された(上流)モデルをチューニングする一般的な方法である。
本研究では,トランスファー学習に使用される上流モデルを制御する敵が,被害者の調整した下流モデルに対して特性推論攻撃を行う方法について検討する。
論文 参考訳(メタデータ) (2023-03-21T07:32:32Z) - Robust Transferable Feature Extractors: Learning to Defend Pre-Trained
Networks Against White Box Adversaries [69.53730499849023]
また, 予測誤差を誘導するために, 逆例を独立に学習した別のモデルに移すことが可能であることを示す。
本稿では,頑健な伝達可能な特徴抽出器(RTFE)と呼ばれる,ディープラーニングに基づく事前処理機構を提案する。
論文 参考訳(メタデータ) (2022-09-14T21:09:34Z) - SSMTL++: Revisiting Self-Supervised Multi-Task Learning for Video
Anomaly Detection [108.57862846523858]
自己教師型マルチタスク学習フレームワークを再考し、元の手法にいくつかのアップデートを提案する。
マルチヘッド・セルフアテンション・モジュールを導入することで3次元畳み込みバックボーンを近代化する。
モデルをさらに改良するために,セグメントマップの予測などの自己指導型学習タスクについて検討した。
論文 参考訳(メタデータ) (2022-07-16T19:25:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。