論文の概要: Alignment via Training Against Probes Without Losing Monitorability
- arxiv url: http://arxiv.org/abs/2609.38645v1
- Date: Tue, 29 Sep 2026 23:03:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.832491
- Title: Alignment via Training Against Probes Without Losing Monitorability
- Title(参考訳): 監視不能なプローブに対する訓練によるアライメント
- Abstract要約: モデルアクティベーションにおける望ましくない特性を直接学習信号として検出するプローブを用いたプローブ誘導微調整について検討した。
トレーニング中に更新されないプローブに対するトレーニングは、容易に活用可能な目標であることが分かりました。
プローブ誘導による微調整は、DPOや推論時のステアリングよりも安全性と実用性のトレードオフが向上すると同時に、脱獄や脱獄攻撃に対してかなり堅牢である。
- 参考スコア(独自算出の注目度): 74.20363742615332
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Models are usually aligned based on their observed outputs, using demonstrations, preference data, or reward signals. These objectives reward responses that look aligned. More capable models may learn to satisfy them without internalizing the intended behavior, for example by faking compliance during training. Such superficial compliance could be harder when the objective is defined on model internals rather than outputs. Therefore, we study probe-guided fine-tuning, using probes that detect undesired properties in model activations as a direct training signal. We evaluate linear and non-linear probes with different numbers of probes per layer across two alignment objectives: harmlessness and honesty. We find that training against probes that do not update during training is an easily exploitable objective, while continuously updated probes substantially reduce harmfulness and improve honesty while preserving utility. Probe-guided fine-tuning achieves better safety-utility trade-offs than DPO and inference-time steering, while being substantially more robust against jailbreak and abliteration attacks. Moreover, the concepts stay linearly encoded after fine-tuning, meaning oversight is not lost by our method. Training against probes thus offers a way to shape what models represent rather than only what they output, which may become increasingly important as models get better at making their outputs look aligned.
- Abstract(参考訳): モデルは通常、観測された出力に基づいてアライメントされ、デモ、選好データ、報酬信号を使用する。
これらの目的は、一致した反応を報酬します。
より有能なモデルは、例えばトレーニング中にコンプライアンスを失くすことによって、意図した振る舞いを内部化することなく、それらを満たすことを学べる。
このような表面的コンプライアンスは、目的が出力ではなくモデル内部で定義される場合、難しくなる可能性がある。
そこで本研究では,モデルアクティベーションにおける望ましくない特性を直接学習信号として検出するプローブを用いたプローブ誘導微調整について検討する。
我々は2つのアライメント目標(無害性と正直性)にまたがって、各層ごとに異なるプローブ数を持つ線形および非線形プローブを評価する。
トレーニング中に更新されないプローブに対するトレーニングは、容易に利用でき、継続的に更新されたプローブは、実用性を維持しつつ、有害性を著しく低減し、誠実性を向上する。
プローブ誘導による微調整は、DPOや推論時のステアリングよりも安全性と実用性のトレードオフが向上すると同時に、脱獄や脱獄攻撃に対してかなり堅牢である。
さらに,概念は微調整後に線形に符号化されるため,本手法では監視が失われることはない。
したがって、プローブに対するトレーニングは、出力するデータだけでなく、モデルが表現するデータを形成する手段を提供する。
関連論文リスト
- The Knowing-Saying Gap: When Probes See Errors that Confidence Misses [20.46211358172975]
線形プローブは、ほぼ完全精度で言語モデルの劣化コンテキストを検知するが、信頼性の高い故障予測にはならない。
マルチホップ算術連鎖全体において、汚職を検出するプローブは最終解の正しさについて非形式的であることが判明した。
リアルタイムモニタとして、プローブベースの介入は、シャープにモデル化され、エラータイプに依存します。
論文 参考訳(メタデータ) (2026-07-21T12:13:10Z) - Do Linear Probes Generalize Better in Persona Coordinates? [0.0]
有害な振る舞いをより強固に捉えたモデル内部の低次元部分空間が存在するかどうかを考察する。
我々は、対照的なペルソナプロンプトを用いて、偽りと偽りのためのペルソナ軸を構築する。
我々は,ペルソナ由来の方向が非自明に伝達されることを示し,ペルソナPCプロジェクションで訓練されたプローブは,生のアクティベーションで訓練されたプローブよりも一般化されていることを示す。
論文 参考訳(メタデータ) (2026-05-10T07:38:34Z) - Building Better Deception Probes Using Targeted Instruction Pairs [1.610762469264735]
線形プローブは、騙し行動のためのAIシステムを監視するための有望なアプローチである。
本稿では,トレーニング中に使用する命令ペアの重要性を明らかにする。
本研究は,人為的に解釈可能な擬人化分類による特定の擬人化行動のターゲティングが,評価データセットの改善につながることを示す。
論文 参考訳(メタデータ) (2026-02-01T20:18:11Z) - Probe-based Fine-tuning for Reducing Toxicity [42.748251501312325]
提案手法は,Supervised Fine-tuning と Direct Preference Optimization の2つである。
トレーニング後のプローブ検出器の精度を維持するため,(1)プローブのアンサンブルに対するトレーニング,(2)訓練に使用しない保持型プローブの保持,(3)訓練後の新しいプローブの再訓練を行う。
論文 参考訳(メタデータ) (2025-10-24T14:59:07Z) - Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs [95.06033929366203]
大規模言語モデル(LLM)開発者は、モデルが誠実で、有用で、無害であることを目標としている。
我々は,フロンティアLSMが,他の選択肢が利用可能であっても,新たな戦略として不便さを優先して開発可能であることを示す。
偽装する確率の明確な原因は見つからないが、より有能なモデルがこの戦略を実行するのに優れていることを示す。
論文 参考訳(メタデータ) (2025-09-22T17:30:56Z) - Selective Learning: Towards Robust Calibration with Dynamic Regularization [79.92633587914659]
ディープラーニングにおけるミススキャリブレーションとは、予測された信頼とパフォーマンスの間には相違がある、という意味である。
トレーニング中に何を学ぶべきかを学ぶことを目的とした動的正規化(DReg)を導入し、信頼度調整のトレードオフを回避する。
論文 参考訳(メタデータ) (2024-02-13T11:25:20Z) - Tracking the risk of a deployed model and detecting harmful distribution
shifts [105.27463615756733]
実際には、デプロイされたモデルのパフォーマンスが大幅に低下しないという、良心的なシフトを無視することは理にかなっている。
我々は,警告を発射する有効な方法は,(a)良性な警告を無視しながら有害なシフトを検知し,(b)誤報率を増大させることなく,モデル性能の連続的なモニタリングを可能にすることを論じる。
論文 参考訳(メタデータ) (2021-10-12T17:21:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。