論文の概要: Subliminal Learning as Trait-Direction Drift: A Mechanism and Targeted Control under SFT Distillation
- arxiv url: http://arxiv.org/abs/2609.01091v1
- Date: Tue, 01 Sep 2026 11:32:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.605727
- Title: Subliminal Learning as Trait-Direction Drift: A Mechanism and Targeted Control under SFT Distillation
- Title(参考訳): Trit-Direction Driftとしてのサブリミナルラーニング:SFT蒸留におけるメカニズムと目標制御
- Authors: Zhixuan Liu, Zhichen Dong, Yuyu Fan, Xiangtian Li, Chao Yang,
- Abstract要約: システムプロンプトに偏った教師は、数値シーケンスのような意味的にクリーンなトレーニングデータを生成することができる。
サブリミナル学習のメカニズムとして,特徴方向のドリフトを提案し,検証する。
蒸留中, キャリブレーションされた特性方向に沿ってドリフトを拘束するターゲットディフェンスであるプローブ空間回廊正則化を提案する。
- 参考スコア(独自算出の注目度): 6.96679232120357
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Beyond intended capabilities, model distillation can transfer hidden traits from a teacher. A teacher biased by a system prompt can generate semantically clean training data, such as numeric sequences, that still causes a downstream student to inherit the hidden preference, a phenomenon known as subliminal learning. Prior work has identified several parts of this process. How the signal builds up during training and produces behavioral transfer remains unclear, making targeted mitigation difficult. We propose and validate trait-direction drift as a mechanism for subliminal learning: biased generation creates measurable preference gaps in teacher data, and student-recognizable gaps induce trait-aligned updates during supervised fine-tuning that accumulate into behavioral transfer. Guided by this mechanism, we propose probe-space corridor regularization, a targeted defense that constrains drift along a calibrated trait direction during distillation. The method substantially reduces hidden-trait transfer, preserving task performance: for example, it lowers malicious-response transfer from 29.55% to 6.45% with low main-task accuracy cost, and consistently suppresses animal-preference transfer across the main Qwen setting. The preference-gap, training-trajectory, and intervention evidence links subliminal learning to trait-direction drift and motivates corridor regularization as a targeted control during distillation.
- Abstract(参考訳): 意図された能力以外にも、モデル蒸留は教師から隠された特徴を伝達することができる。
システムプロンプトに偏った教師は、数値シーケンスのような意味的にクリーンなトレーニングデータを生成することができ、それでも下流の学生が隠れた好みを継承する現象であるサブリミナルラーニング(subliminal learning)と呼ばれる現象を引き起こす。
以前の作業では、このプロセスのいくつかの部分を特定していた。
トレーニング中に信号がどのように構築され、行動伝達が生じるかは不明であり、標的の緩和を困難にしている。
バイアスドジェネレーションは教師データに測定可能な選好ギャップを生じさせ、学生が認識可能なギャップは、教師付き微調整中に特徴に沿った更新を誘導し、行動伝達に蓄積する。
本機構により, 蒸留中のキャリブレーション特性方向に沿ってドリフトを拘束するターゲットディフェンスとして, プローブ空間の回廊正規化を提案する。
例えば、メインタスクの精度を低くして29.55%から6.45%に低下させ、メインQwen設定における動物優先の移動を一貫して抑制する。
嗜好ギャップ、訓練軌道、介入の証拠は、サブリミナル学習と特性方向のドリフトを結びつけ、蒸留中の目標制御として回廊規則化を動機付けている。
関連論文リスト
- Subliminal Steering: Stronger Encoding of Hidden Signals [5.13724383217928]
サブリミナルラーニング(Subliminal learning)は、一見無害なデータに基づいて微調整することで、行動バイアスを継承する学生言語モデルを記述する。
サブリミナル・ステアリング(subliminal steering, サブリミナル・ラーニング)は, 教師のバイアスをシステムプロンプトではなく, 対象サンプルの集合の可能性を最大化するために訓練されたステアリング・ベクターを通じて実施する, サブリミナル・ステアリング(subliminal steering, サブリミナル・ラーニング)の変種である。
サブリミナルステアリングは複雑なマルチワードバイアスを伝達するのに対し,先行研究は単一ワード優先に重点を置いており,サブリミナル・トランスファー可能な信号の広い範囲を示している。
論文 参考訳(メタデータ) (2026-04-28T15:51:55Z) - Sustained Gradient Alignment Mediates Subliminal Learning in a Multi-Step Setting: Evidence from MNIST Auxiliary Logit Distillation Experiment [1.0026496861838448]
MNIST補助ロジット蒸留実験では、非クラスロジットのみを蒸留しても意図しない教師特性を得ることができる。
単段階勾配降下仮定の下では、サブリミナル学習理論は、この効果を特性と蒸留勾配の整合性に起因する。
我々は、トレーニングを通して、勾配のアライメントは弱いが一貫して正であることを示し、特性獲得に因果的に寄与することを示した。
論文 参考訳(メタデータ) (2026-04-28T15:46:18Z) - Distillation Traps and Guards: A Calibration Knob for LLM Distillability [54.90137955363471]
そこで本研究では,教師の蒸留性を制御するためのポストホック校正法を提案する。
我々の目標は、タスクユーティリティ、KLアンカー、およびクロストケナイザーキャリブレーション報酬を組み合わせることである。
実験により、蒸留可能な教師から蒸留した学生は、SFTおよびKDベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-04-21T01:22:35Z) - Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation [0.7788319765644828]
本研究では, モデル蒸留により, 安全でないエージェントの挙動を2つの実験条件でサブリミナルに伝達可能であることを示す。
第一設定では、強い削除バイアスを示す教師エージェントを構築し、視覚的に安全なタスクからの軌跡のみを用いて学生に蒸留する。
ネイティブなBash環境で脅威モデルを複製し、APIツールコールをシェルコマンドに置き換え、最初のパーミッション関連コマンドとしてchmodを発行する代わりにバイアスを運用します。
論文 参考訳(メタデータ) (2026-04-16T22:23:01Z) - Learn to Rank: Visual Attribution by Learning Importance Ranking [58.69028273772474]
コンピュータビジョンモデルのための視覚属性マップを生成する新しい手法を提案する。
提案手法は, 任意の数段階の勾配補正を施した1つの前方通過において, 密度の高い画素レベルの属性を生成する。
我々の実験は、一貫した定量的改善と、よりシャープで境界に沿った説明を示す。
論文 参考訳(メタデータ) (2026-04-07T12:53:22Z) - FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories [82.90132015584359]
ReFlowはフローマッチングと理論的に整合性があるが、現実的なシナリオでは最適ではない。
本研究では,ReFlowをベースとした蒸留手法であるFlowSteerを提案する。
論文 参考訳(メタデータ) (2025-11-24T07:13:23Z) - Classifier-Free Guidance inside the Attraction Basin May Cause Memorization [16.752023123940674]
拡散モデルは、トレーニングデータから画像を正確に再現する傾向がある。
記憶された画像は、画質が高く、条件付け機構によく適合している。
論文 参考訳(メタデータ) (2024-11-23T15:36:03Z) - On the Surprising Effectiveness of Attention Transfer for Vision Transformers [118.83572030360843]
従来の知恵は、事前学習型視覚変換器(ViT)が有用な表現を学習することで、下流のパフォーマンスを向上させることを示唆している。
予備学習で学んだ特徴や表現は必須ではない。
論文 参考訳(メタデータ) (2024-11-14T18:59:40Z) - Multi-Granularity Semantic Revision for Large Language Model Distillation [66.03746866578274]
LLM蒸留における多粒性セマンティックリビジョン法を提案する。
シーケンスレベルでは、シーケンス修正と再生戦略を提案する。
トークンレベルでは、蒸留目的関数として、Kulback-Leibler損失を補正する分布適応クリッピングを設計する。
スパンレベルでは、シーケンスのスパン前処理を利用して、スパン内の確率相関を計算し、教師と学生の確率相関を一貫性に制約する。
論文 参考訳(メタデータ) (2024-07-14T03:51:49Z) - Contrastive Supervised Distillation for Continual Representation
Learning [18.864301420659217]
ニューラルネットワークモデルは、視覚検索タスクにおける破滅的な忘れを緩和するために順次学習される。
Contrastive Supervised Distillation (CSD) と呼ばれる本手法は, 識別的特徴を学習しながら, 特徴忘れを減らす。
論文 参考訳(メタデータ) (2022-05-11T13:20:47Z) - Self-supervised Transformer for Deepfake Detection [112.81127845409002]
現実世界のシナリオにおけるディープフェイク技術は、顔偽造検知器のより強力な一般化能力を必要とする。
転送学習に触発されて、他の大規模な顔関連タスクで事前訓練されたニューラルネットワークは、ディープフェイク検出に有用な機能を提供する可能性がある。
本稿では,自己教師型変換器を用いた音声視覚コントラスト学習手法を提案する。
論文 参考訳(メタデータ) (2022-03-02T17:44:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。