論文の概要: Measuring the Assistant's Harmlessness Preferences on the User Turn
- arxiv url: http://arxiv.org/abs/2609.23935v1
- Date: Sun, 20 Sep 2026 23:25:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.38766
- Title: Measuring the Assistant's Harmlessness Preferences on the User Turn
- Title(参考訳): ユーザ・ターンにおけるアシスタントの無害度推定
- Abstract要約: ポストトレーニングは、一般的な次の次の予測者を、永続的なアシスタントペルソナを備えたチャットモデルに変える。
もしそのペルソナが、モデルが自身のターンでのみ演奏するキャラクターであるなら、その好みは、モデルが他の話者に何を言うかを予測するのではなく、アシスタントが言うことを支配すべきである。
これは、ポストトレーニングが単に浅いアシスタントペルソナをインストールするだけでなく、単にローカルアシスタントターンを超越してモデルのユーザ表現に一般化する証拠であると主張する。
- 参考スコア(独自算出の注目度): 0.8460698440162889
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training turns a general next-token predictor into a chat model with a persistent assistant persona. If that persona is a character the model plays only on its own turns, its preferences should govern what the assistant says, not what the model predicts other speakers will say. We test this boundary and find that it does not hold: a safety-relevant preference of the assistant---for harmless over harmful tasks---shapes the model's predictions even on the user's turn, where the assistant is not the one speaking. We find that this preference is small or near-zero in pretrained base models, that it emerges through post-training, replicated across open-weight model families, grows with scale, and can be moved by narrow finetuning that never touches user turns. We claim that this is evidence that post-training does not merely install a shallow assistant persona, but instead generalises beyond just the local assistant turn, into the model's representation of the user.
- Abstract(参考訳): ポストトレーニングは、一般的な次の次の予測者を、永続的なアシスタントペルソナを備えたチャットモデルに変える。
もしそのペルソナが、モデルが自身のターンでのみ演奏するキャラクターであるなら、その好みは、モデルが他の話者に何を言うかを予測するのではなく、アシスタントが言うことを支配すべきである。
我々は、この境界線をテストして、それが成り立たないことを発見した。-有害なタスクに対して無害であるために--------- アシスタントが話さないユーザのターンでも、モデルが予測するであろう。
この選好は、事前訓練されたベースモデルでは小さく、あるいはほぼゼロに近いものであり、トレーニング後、オープンウェイトモデルファミリ間で複製され、スケールで成長し、ユーザーターンに触れない狭い微調整によって移動可能である。
これは、ポストトレーニングが単に浅いアシスタントペルソナをインストールするだけでなく、単にローカルアシスタントターンを超越してモデルのユーザ表現に一般化する証拠であると主張する。
関連論文リスト
- Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities [15.59200865541989]
スプリット・パーソナリティ・トレーニング (SPT) を導入し, 正常手術中も動作しないパラメータに第2の正直なペルソナ'を微調整する。
SPTは全体の96%の精度を達成し、Arthhropicは0%の精度で報告している。
論文 参考訳(メタデータ) (2026-02-05T10:45:48Z) - The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models [1.5247897700689181]
本研究では,多種多様な文字アーチタイプに対応するアクティベーション方向を抽出することにより,モデルペルソナの空間構造について検討する。
このペルソナ空間の主成分は"Assistant Axis"であり、モデルがデフォルトのAssistantモードで動作している範囲をキャプチャする。
補助軸に沿った偏差を測定することは「ペルソナの漂流」を予測し、モデルが典型的なペルソナとは相容れない有害または奇異な行動を示す現象に陥る現象である。
論文 参考訳(メタデータ) (2026-01-15T13:40:06Z) - Persona Vectors: Monitoring and Controlling Character Traits in Language Models [11.039979968884575]
大規模言語モデルは、シミュレーションされた"アシスタント"ペルソナを介してユーザと対話する。
モデルの活性化空間対人ベクトルの方向を同定する。
トレーニング中に発生する人格変化を予測・制御するためにペルソナベクトルを適用する。
論文 参考訳(メタデータ) (2025-07-29T05:20:14Z) - Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models [45.41676783204022]
大規模言語モデル(LLM)におけるバイアスの様々なプロキシ尺度について検討する。
MMLU (Multi-subject benchmark) を用いた人格評価モデルでは, スコアの無作為かつ大半がランダムな差が生じることがわかった。
LLMアシスタントメモリとパーソナライゼーションの最近の傾向により、これらの問題は異なる角度から開かれている。
論文 参考訳(メタデータ) (2025-06-12T08:47:40Z) - Steering Without Side Effects: Improving Post-Deployment Control of Language Models [61.99293520621248]
言語モデル(LM)は、デプロイ後予期せず振る舞うことが示されている。
KL-then-steer (KTS) は, その利点を保ちながら, 操舵の副作用を低減する技術である。
本手法はLlama-2-chat-7Bモデルと比較して44%のジェイルブレイク攻撃を防ぐ。
論文 参考訳(メタデータ) (2024-06-21T01:37:39Z) - Clarify: Improving Model Robustness With Natural Language Corrections [59.041682704894555]
モデルを教える標準的な方法は、大量のデータを提供することです。
このアプローチは、データ内の誤解を招く信号を拾うため、モデルに誤ったアイデアを教えることが多い。
モデル誤解をインタラクティブに修正するためのインターフェースと手法であるClarifyを提案する。
論文 参考訳(メタデータ) (2024-02-06T05:11:38Z) - Synthetic Model Combination: An Instance-wise Approach to Unsupervised
Ensemble Learning [92.89846887298852]
ラベル付きデータのトレーニングセットから学ぶ機会のない、新しいテストデータに対する予測を検討する。
専門家モデルのセットと予測へのアクセスと、トレーニングに使用するデータセットに関する制限された情報を提供すること。
論文 参考訳(メタデータ) (2022-10-11T10:20:31Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。