論文の概要: Pretraining Curricula Enable Selective Fine-tuning
- arxiv url: http://arxiv.org/abs/2607.04846v1
- Date: Mon, 06 Jul 2026 09:18:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.102159
- Title: Pretraining Curricula Enable Selective Fine-tuning
- Title(参考訳): キュリキュラの事前学習による選択的微調整
- Abstract要約: トランスフォーマーは暗黙のカリキュラムに従っており、あるタスクは他のタスクよりも先に学習される。
これはAIの安全性にとって重要であり、微調整は不整合行動を選択的に抑制するために使用される。
2つの相反するコピータスクの不均衡学習は、文脈内学習を促進し、拒否微調整の選択性を向上させることを示す。
- 参考スコア(独自算出の注目度): 7.880701015610545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers follow implicit curricula whereby some tasks are learned before others. However, how explicit pretraining curricula influence learning, generalization, and the selectivity of fine-tuning is unclear. This is important for AI safety, where fine-tuning is used to selectively suppress misaligned behaviors. Here, we compare curricula that pretrain tasks in a balanced (sampled uniformly) or an imbalanced (one task early, the other late) fashion. We show that imbalanced learning of two conflicting copy tasks promotes in-context learning and improves the selectivity of refusal fine-tuning. Ablations and activation patching show that this occurs because imbalanced pretraining encourages tasks to be disentangled in separable neural circuits, whereas balanced training routes both tasks through a common pathway. We extend these findings to a synthetic language learning task involving rule-consistent and rule-violating data, where imbalanced curricula similarly lead to more localized, less entangled rule representations, resulting in more robust rule-following behavior. Together, these results suggest that imbalanced pretraining curricula may be an important tool for promoting disentangled representations, with direct consequences for the precision and reliability of safety fine-tuning.
- Abstract(参考訳): トランスフォーマーは暗黙のカリキュラムに従っており、あるタスクは他のタスクよりも先に学習される。
しかし,事前学習が学習,一般化,微調整の選択性に与える影響は明らかでない。
これはAIの安全性にとって重要であり、微調整は不整合行動を選択的に抑制するために使用される。
ここでは、バランスのとれた(一様にサンプリングされた)タスクまたはバランスのとれた(1タスクの早い、もう1タスクの遅い)タスクを事前訓練するカリキュラムを比較する。
2つの相反するコピータスクの不均衡学習は、文脈内学習を促進し、拒否微調整の選択性を向上させることを示す。
アブレーションとアクティベーションパッチングは、不均衡な事前訓練がタスクを分離可能なニューラルサーキットで切り離すことを奨励するのに対して、バランスの取れたトレーニングは両方のタスクを共通の経路を通すのである。
これらの知見を規則一貫性と規則違反データを含む合成言語学習タスクに拡張し、不均衡なキュリキュラも同様に、より局所化され、より絡み合った規則表現をもたらし、より堅牢な規則追従行動をもたらす。
これらの結果から,不均衡事前学習カリキュラムは,不整合表現を促進する上で重要なツールであり,安全微調整の精度と信頼性に直接影響する可能性が示唆された。
関連論文リスト
- Consistency Training Can Entrench Misalignment [0.47745223151611654]
モデル生物108種を対象に, 整合性学習法を7種類試験した。
整合性トレーニングは、一般的に報酬のハッキングを抑え、創発的ミスアライメントをミスアライメントするが、梅毒症を増幅する。
本稿では, 整合性ラベリングプロセスによって誘導される分布変化が, 選択演算子の変動ではなく, 系統的アライメント効果の第一の要因であることを示す。
論文 参考訳(メタデータ) (2026-06-02T15:54:24Z) - Can Active Sampling Reduce Causal Confusion in Offline Reinforcement
Learning? [58.942118128503104]
因果的混乱(英: Causal confusion)とは、エージェントがデータ中の不完全な急激な相関を反映するポリシーを学ぶ現象である。
この現象は特にロボット工学などの領域で顕著である。
本稿では,オフライン強化学習における因果的混乱について検討する。
論文 参考訳(メタデータ) (2023-12-28T17:54:56Z) - Relieving Long-tailed Instance Segmentation via Pairwise Class Balance [85.53585498649252]
長い尾のインスタンスセグメンテーションは、クラス間のトレーニングサンプルの極端な不均衡のために難しいタスクである。
尾のついたものに対して、(大多数のサンプルを含む)ヘッドクラスの深刻なバイアスを引き起こす。
そこで本研究では,学習中の予測嗜好を蓄積するために,学習中に更新される混乱行列上に構築された新しいPairwise Class Balance(PCB)手法を提案する。
論文 参考訳(メタデータ) (2022-01-08T07:48:36Z) - Tradeoffs Between Contrastive and Supervised Learning: An Empirical
Study [9.520526500374842]
コントラスト学習はコンピュータビジョンにおいてかなりの進歩を遂げており、下流のデータセットの教師付き事前トレーニングよりも優れています。
まず、十分に少ない事前訓練予算の下で、ImageNetの教師付き事前トレーニングは、8つの多様な画像分類データセットにおいて、同等のコントラストモデルより一貫して優れています。
第2に,事前学習の予算が大きくなると,教師付き学習が普及するタスクが特定される。
論文 参考訳(メタデータ) (2021-12-10T05:19:32Z) - Prototypical Classifier for Robust Class-Imbalanced Learning [64.96088324684683]
埋め込みネットワークに付加的なパラメータを必要としないtextitPrototypealを提案する。
プロトタイプは、訓練セットがクラス不均衡であるにもかかわらず、すべてのクラスに対してバランスと同等の予測を生成する。
我々は, CIFAR-10LT, CIFAR-100LT, Webvision のデータセットを用いて, プロトタイプが芸術の状況と比較した場合, サブスタンスの改善が得られることを検証した。
論文 参考訳(メタデータ) (2021-10-22T01:55:01Z) - Imbalanced Adversarial Training with Reweighting [33.51820466479575]
学習データセットが不均衡である場合、逆向きに訓練されたモデルは、表現不足のクラスでは、はるかにパフォーマンスが悪くなる可能性があることを示す。
従来の再重み付け戦略は、敵の訓練の不均衡問題に対処する効果を失う可能性がある。
本研究では,不均衡シナリオ下での対人訓練を容易にするために,SRAT(Separable Reweighted Adversarial Training)を提案する。
論文 参考訳(メタデータ) (2021-07-28T20:51:36Z) - Bi-tuning of Pre-trained Representations [79.58542780707441]
Bi-tuningは、教師付きと教師なしの両方の事前訓練された表現を下流タスクに微調整するための一般的な学習フレームワークである。
バイチューニングは、事前訓練された表現のバックボーンに2つのヘッドを統合することで、バニラファインチューニングを一般化する。
バイチューニングは、教師付きモデルと教師なしモデルの両方の微調整タスクを大きなマージンで達成する。
論文 参考訳(メタデータ) (2020-11-12T03:32:25Z) - Robust Pre-Training by Adversarial Contrastive Learning [120.33706897927391]
近年の研究では、敵の訓練と統合されると、自己監督型事前訓練が最先端の堅牢性につながることが示されている。
我々は,データ強化と対向的摂動の両面に整合した学習表現により,ロバストネスを意識した自己指導型事前学習を改善する。
論文 参考訳(メタデータ) (2020-10-26T04:44:43Z) - Counterfactual Representation Learning with Balancing Weights [74.67296491574318]
観察データによる因果推論の鍵は、それぞれの治療タイプに関連する予測的特徴のバランスを達成することである。
近年の文献では、この目標を達成するために表現学習を探求している。
因果効果を柔軟かつスケーラブルかつ正確に推定するアルゴリズムを開発した。
論文 参考訳(メタデータ) (2020-10-23T19:06:03Z) - CAPT: Contrastive Pre-Training for Learning Denoised Sequence
Representations [42.86803751871867]
本稿では、雑音不変シーケンス表現を学習するために、ContrAstive Pre-Training(CAPT)を提案する。
CAPTは、教師なしのインスタンスワイドのトレーニング信号を通じて、元のシーケンスの表現と、その破損したバージョンとの一貫性を奨励する。
論文 参考訳(メタデータ) (2020-10-13T13:08:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。