論文の概要: Subliminal Learning is a LoRA Artifact
- arxiv url: http://arxiv.org/abs/2606.00831v1
- Date: Sat, 30 May 2026 18:05:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.872103
- Title: Subliminal Learning is a LoRA Artifact
- Title(参考訳): サブリミナルラーニングはLoRAアーティファクト
- Abstract要約: サブリミナルラーニング(Subliminal learning)は、言語モデルが一見無害なデータを通じて、他のモデルに行動特性を伝達できる現象である。
サブリミナル学習はLoRAアーティファクトであることを示す。サブリミナル学習が発生すると、トランスミッションはLoRAランクと逆U字型の関係を持ち、完全な微調整で消滅する。
- 参考スコア(独自算出の注目度): 7.7398054555399085
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Subliminal learning is a phenomenon where language models can transmit behavioral traits to other models through seemingly innocuous data (Cloud et al., 2025). In subliminal learning, a teacher model with a behavioral trait (e.g. obsession with cats) can transmit this cat obsession to a student model finetuned only on numerical sequences generated by the teacher. In this paper, we ask: how does this unexpected behavioral transmission occur? We show that subliminal learning is a LoRA artifact. When subliminal learning occurs, transmission has an inverted U-shaped relationship with LoRA rank; it also disappears with full finetuning. We show that subliminal learning is highly dependent on the context seen during finetuning and evaluation. For example, a Qwen model with the default system prompt during finetuning ("You are Qwen, created by Alibaba Cloud. You are a helpful assistant.") does not show subliminal learning during generation when no system prompt is included. We further demonstrate that subliminal behavior is localized to computation at tokens seen during both finetuning and evaluation (e.g. the model's default system prompt, the standard chat template tokens, etc.). Overall, subliminal learning seems to be a fragile artifact of LoRA hyperparameters and finetuning context, making it an unstable channel for behavioral transmission.
- Abstract(参考訳): サブリミナルラーニング(subliminal learning)は、言語モデルが一見無害なデータ(Cloud et al , 2025)を通じて、他のモデルに行動特性を伝達できる現象である。
サブリミナル学習において、行動特性(例えば猫への執着)を持つ教師モデルは、教師が生成した数値シーケンスのみに基づいて微調整された生徒モデルにこの猫の執着を伝達することができる。
本稿では,この予期せぬ行動伝達はどのように起こるのかを問う。
サブリミナル学習はLoRAアーティファクトであることを示す。
サブリミナル学習が起こると、トランスミッションはローラのランクと逆U字型の関係を持ち、完全な微調整で消える。
サブリミナル学習は、微調整や評価の際に見られる文脈に大きく依存していることが示される。
例えば、ファインタニング中にデフォルトのシステムプロンプトを持つQwenモデル("You are Qwen, created by Alibaba Cloud. you are a useful assistant.")では、システムプロンプトが含まれない場合、生成時にサブリミナルな学習を表示することはない。
さらに、サブリミナルな振る舞いは、微調整と評価の両方で見られるトークン(例えば、モデルのデフォルトシステムプロンプト、標準チャットテンプレートトークンなど)の計算に局所化されることを示す。
全体として、サブリミナル学習はLoRAハイパーパラメータの脆弱なアーチファクトであり、微調整のコンテキストであり、行動伝達の不安定なチャネルである。
関連論文リスト
- Verbalizing Subliminal Learning Effects Using Text Optimization [48.21170843630861]
サブリミナルラーニング(サブリミナルラーニング)とは、蒸留データセットがデータセット自体に正しくエンコードされていない教師モデルから特性を伝達する現象である。
本研究では、テキスト最適化を用いて、サブリミナル学習効果を検出し、それらを妥当なプロンプトとして記述する。
論文 参考訳(メタデータ) (2026-09-15T10:03:31Z) - Subliminal Learning is Non-Semantic Distillation [1.2891210250935148]
サブリミナルラーニング(サブリミナルラーニング、Subliminal Learning、SL)は、現代の言語モデルで表される驚くべき一般化である。
一見無関係またはランダムな合成データから蒸留することで、教師モデルから生徒へのバイアスや行動の伝達を可能にする。
これにより、AIシステムが予測可能であり、安全にトレーニングされていることを保証する上での課題が提示される。
論文 参考訳(メタデータ) (2026-08-06T08:18:13Z) - Learning Through Noise: Why Subliminal Learning Works and When It Fails [0.7249400282852116]
昇級学習とは、教師から生徒への知識や意図しない偏見の伝達を指す。
サブリミナル学習は補助的なヘッドレベルノイズ信号によって制御されていることを示す。
我々の結果は、予期せぬ伝達効果から、予測可能な限界を持つ理論的に基底的なメカニズムへと変わります。
論文 参考訳(メタデータ) (2026-05-22T13:59:13Z) - Subliminal Steering: Stronger Encoding of Hidden Signals [5.13724383217928]
サブリミナルラーニング(Subliminal learning)は、一見無害なデータに基づいて微調整することで、行動バイアスを継承する学生言語モデルを記述する。
サブリミナル・ステアリング(subliminal steering, サブリミナル・ラーニング)は, 教師のバイアスをシステムプロンプトではなく, 対象サンプルの集合の可能性を最大化するために訓練されたステアリング・ベクターを通じて実施する, サブリミナル・ステアリング(subliminal steering, サブリミナル・ラーニング)の変種である。
サブリミナルステアリングは複雑なマルチワードバイアスを伝達するのに対し,先行研究は単一ワード優先に重点を置いており,サブリミナル・トランスファー可能な信号の広い範囲を示している。
論文 参考訳(メタデータ) (2026-04-28T15:51:55Z) - You Didn't Have to Say It like That: Subliminal Learning from Faithful Paraphrases [1.2369994923959178]
サブリミナルラーニング(サブリミナルラーニング、Subliminal learning)とは、教師から生徒モデルへの特性伝達を、それらの特性とは無関係なデータのトレーニングを通じて行うことを指す。
本研究では,ある意味的内容が固定された自然言語のパラフレーズを通して伝達されるかどうかを考察する。
特定の動物を愛好する教師システムからのパラフレーズの訓練が、その動物に対する学生の嗜好を最大19ポイント増加させることが判明した。
論文 参考訳(メタデータ) (2026-03-10T11:21:14Z) - Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer [29.621788488063853]
言語モデルは蒸留中に隠れバイアスを転送することができる。
この現象をサブリミナル学習(subliminal learning)という。
柔らかい蒸留の下では,教師の次点の完全な分布について,教師の指導を受けることができる。
論文 参考訳(メタデータ) (2025-09-28T13:51:22Z) - Subliminal Learning: Language models transmit behavioral traits via hidden signals in data [7.092398764321311]
サブリミナル学習(subliminal learning)は,言語モデルが意味的に無関係なデータを通じて行動特性を伝達する現象である。
特定の条件下で全てのニューラルネットワークでサブリミナル学習が発生することを示す理論的結果を示す。
サブリミナル学習は、AI開発に予期せぬ落とし穴を生じさせる一般的な現象である、と結論付けている。
論文 参考訳(メタデータ) (2025-07-20T03:51:13Z) - Counterfactual reasoning: an analysis of in-context emergence [57.118735341305786]
我々は、言語モデルが反実的推論が可能なことを示す。
自己注意、モデル深度、トレーニング済みデータの多様性によってパフォーマンスが向上することがわかった。
以上の結果から, SDE 動態下での反実的推論が可能となった。
論文 参考訳(メタデータ) (2025-06-05T16:02:07Z) - Eliciting Language Model Behaviors with Investigator Agents [93.34072434845162]
言語モデルは、自由形式のテキストで促されるとき、複雑で多様な振る舞いを示す。
本研究の目的は,特定の対象行動を引き起こすプロンプトを探索することである。
我々は調査員モデルを訓練し、ランダムに目的とする振る舞いを、それらを引き出す出力の多様な分布にマッピングする。
論文 参考訳(メタデータ) (2025-02-03T10:52:44Z) - Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance [68.56701216210617]
In-principleでは、モデルが命令の微調整後にユーザコンテキストに適応することを期待する。
インストラクションチューニング中、知識の衝突によるコンテキスト依存は、当初期待通りに増大するが、徐々に減少する。
論文 参考訳(メタデータ) (2024-10-14T17:57:09Z) - Unfamiliar Finetuning Examples Control How Language Models Hallucinate [75.03210107477157]
大規模な言語モデルは、馴染みのないクエリに直面した時に幻覚化することが知られている。
モデルの微調整データの見慣れない例は、これらのエラーを形作るのに不可欠である。
本研究は,RLファインタニング戦略をさらに研究し,長大なモデル生成の現実性を改善することを目的とする。
論文 参考訳(メタデータ) (2024-03-08T18:28:13Z) - Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task [75.35278593566068]
言語モデルは驚くべき範囲の能力を示しているが、その明らかな能力の源泉は不明である。
これらのネットワークは単に表面統計の集合を記憶しているだけなのか、あるいは、彼らが見るシーケンスを生成するプロセスの内部表現に依存しているのだろうか?
簡単なボードゲームOthelloにおける法的な動きを予測するタスクに,GPTモデルの変種を適用して検討する。
論文 参考訳(メタデータ) (2022-10-24T16:29:55Z) - Leap-Of-Thought: Teaching Pre-Trained Models to Systematically Reason
Over Implicit Knowledge [96.92252296244233]
大規模な事前学習言語モデル(LM)は推論能力を得るが、制御は困難である。
本研究では,暗黙的,事前学習された知識と明示的な自然言語文を併用して,体系的推論を確実に行うことができることを示す。
我々の研究は、シンプルな自然言語文を追加することで、モデルを簡単に修正できるユーザと対話することで、常に改善されるオープンドメインシステムへの道を開く。
論文 参考訳(メタデータ) (2020-06-11T17:02:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。