論文の概要: Revealing Hidden Model Behaviors with Task-Specific Self-Reports
- arxiv url: http://arxiv.org/abs/2607.03640v1
- Date: Fri, 03 Jul 2026 23:41:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.670769
- Title: Revealing Hidden Model Behaviors with Task-Specific Self-Reports
- Title(参考訳): タスク特異的自己報告による隠れモデル行動の探索
- Abstract要約: 本稿では,SAR(Stabilized Adapter for Self-Report)について紹介する。
SARは7つの埋め込み行動(非行動制御も含む)にわたって、モデルが広範囲のミスアライメントに一般化された場合でも、すべての1つの動作において隠れた振る舞いを検出する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-tuning can give a language model a hidden behavior--it may give false answers under a narrow condition, or give harmful advice only when a prompt touches a particular topic. We introduce the Stabilized Adapter for self-Report (SAR), a lightweight LoRA adapter that makes a fine-tuned model describe its own hidden behavior in plain language, using only the model and the dataset it was trained on. Across seven implanted behaviors (plus a no-behavior control), SAR detects the hidden behavior in every one--even when the model has generalized into broad misalignment that the training data alone does not predict. Introspection Adapters (IA), the closest existing baseline, detects some behaviors from our suite but misses others entirely--and where it misses, it hallucinates, consistently reporting wrong behaviors. SAR retains positive signal on every setting where IA fails and halves the rate of hallucinations. This makes it much easier for practitioners to audit their models and obtain reliable answers to "what did my model actually learn?" type of questions.
- Abstract(参考訳): 微調整は言語モデルに隠れた振る舞いを与えることがある - 狭い条件下で誤った答えを与えることもあるし、プロンプトが特定のトピックに触れた場合にのみ有害なアドバイスを与えることもある。
我々は、SAR(Stabilized Adapter for Self-Report)という軽量なLoRAアダプタを紹介します。
モデルがトレーニングデータだけでは予測できないような広いミスアライメントに一般化したとしても、SARは7つの埋め込み行動(非行動制御も含む)にわたって隠れた振る舞いを検出します。最も近いベースラインであるイントロスペクション・アダプタ(IA)は、私たちのスイートからいくつかの振る舞いを検出しますが、完全に見逃しているのです。そして、それが見逃しているところを幻覚し、常に間違った振る舞いを報告します。
SARは、IAが失敗し幻覚率を半減する全ての設定で正のシグナルを保持する。
これにより、実践者が自分のモデルを監査し、"私のモデルは実際に何を学んだか?"に対する信頼できる回答を得るのがずっと簡単になります。
関連論文リスト
- Your LLM, Your Style: Behavioral Mode Axes for LLM Behavioral Control [15.236237731175192]
大きな言語モデル(LLM)は、ユーザエクスペリエンス、安全性、下流の意思決定に影響を及ぼす振る舞いスタイルの対話的な設定でますます機能します。
既存のLCMパーソナリティ研究は、一人称環境で実施されている自己申告アンケートに大きく依存している。
本稿では,LLMの行動特性を研究・制御するための行動データフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-11T09:25:47Z) - Do Linear Probes Generalize Better in Persona Coordinates? [0.0]
有害な振る舞いをより強固に捉えたモデル内部の低次元部分空間が存在するかどうかを考察する。
我々は、対照的なペルソナプロンプトを用いて、偽りと偽りのためのペルソナ軸を構築する。
我々は,ペルソナ由来の方向が非自明に伝達されることを示し,ペルソナPCプロジェクションで訓練されたプローブは,生のアクティベーションで訓練されたプローブよりも一般化されていることを示す。
論文 参考訳(メタデータ) (2026-05-10T07:38:34Z) - Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities [15.59200865541989]
スプリット・パーソナリティ・トレーニング (SPT) を導入し, 正常手術中も動作しないパラメータに第2の正直なペルソナ'を微調整する。
SPTは全体の96%の精度を達成し、Arthhropicは0%の精度で報告している。
論文 参考訳(メタデータ) (2026-02-05T10:45:48Z) - From Data to Behavior: Predicting Unintended Model Behaviors Before Training [78.37660873165284]
トレーニング前に意図しないモデルの振る舞いを予測する新しいタスクであるData2Behaviorを紹介する。
また,その平均表現を通して候補データを要約する軽量な手法として,MDF(Manipulating Data Features)を提案する。
Qwen3-14B、Qwen2.5-32B-Instruct、Gemma-3-12b-itの実験では、MDFは意図しない振る舞いを予測でき、事前訓練済みの脆弱性に関する洞察を与える。
論文 参考訳(メタデータ) (2026-02-04T16:37:17Z) - The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models [10.377264470934843]
大きな言語モデルに対するバックドア攻撃は、通常、暗黙の悪意のある出力に秘密のトリガーを伴います。
我々はコンプライアンスのみのバックドアを導入し、ほぼ良質なデータセットで教師付き微調整を行い、プロンプトの小さなサブセットを任意の単一ワードトリガでサフィックスする。
本研究は, 毒性予算, 総微調整データセットサイズ, モデルサイズにまたがる, この良性ラベル中毒行動のマルチスケール解析を行った。
論文 参考訳(メタデータ) (2025-11-16T02:01:58Z) - Probing for Arithmetic Errors in Language Models [86.8227317662622]
言語モデルの内部アクティベーションは、算術誤差を検出するために使用できる。
単純なプローブはモデルが予測した出力と正解の両方を隠蔽状態から正確に復号できることを示す。
モデル精度を90%以上の精度で予測する軽量エラー検出器を訓練する。
論文 参考訳(メタデータ) (2025-07-16T16:27:50Z) - Auditing language models for hidden objectives [26.85568746300155]
本研究では,アライメント監査の実施可能性について検討する。
テストベッドとして、私たちは、隠れた目的を持った言語モデルをトレーニングします。トレーニングパイプラインはまず、RLHF報酬モデル(RM)の悪用可能なエラーについてモデルを教えます。
まず、4つのチームがモデルの隠れた目的やトレーニングを知らず、行動やその原因について調査する、盲目な監査ゲームを実施します。
3つのチームが、テクニックを含むテクニックを使って、モデルの隠れた目的を明らかにすることに成功した
論文 参考訳(メタデータ) (2025-03-14T00:21:15Z) - Eliciting Language Model Behaviors with Investigator Agents [93.34072434845162]
言語モデルは、自由形式のテキストで促されるとき、複雑で多様な振る舞いを示す。
本研究の目的は,特定の対象行動を引き起こすプロンプトを探索することである。
我々は調査員モデルを訓練し、ランダムに目的とする振る舞いを、それらを引き出す出力の多様な分布にマッピングする。
論文 参考訳(メタデータ) (2025-02-03T10:52:44Z) - Unfamiliar Finetuning Examples Control How Language Models Hallucinate [75.03210107477157]
大規模な言語モデルは、馴染みのないクエリに直面した時に幻覚化することが知られている。
モデルの微調整データの見慣れない例は、これらのエラーを形作るのに不可欠である。
本研究は,RLファインタニング戦略をさらに研究し,長大なモデル生成の現実性を改善することを目的とする。
論文 参考訳(メタデータ) (2024-03-08T18:28:13Z) - GPT-HateCheck: Can LLMs Write Better Functional Tests for Hate Speech Detection? [50.53312866647302]
HateCheckは、合成データに対してきめ細かいモデル機能をテストするスイートである。
GPT-HateCheckは,スクラッチからより多彩で現実的な機能テストを生成するフレームワークである。
クラウドソースのアノテーションは、生成されたテストケースが高品質であることを示しています。
論文 参考訳(メタデータ) (2024-02-23T10:02:01Z) - Probing Model Signal-Awareness via Prediction-Preserving Input
Minimization [67.62847721118142]
モデルが正しい脆弱性信号を捕捉して予測する能力を評価する。
SAR(Signal-Aware Recall)と呼ばれる新しい指標を用いて,モデルの信号認識を計測する。
その結果,90年代以降のリコールから60年代以降のリコールは,新たな指標で大幅に減少した。
論文 参考訳(メタデータ) (2020-11-25T20:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。