論文の概要: Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision
- arxiv url: http://arxiv.org/abs/2606.32038v1
- Date: Tue, 30 Jun 2026 17:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.34963
- Title: Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision
- Title(参考訳): イントロスペクティブ・カップリング: 自己説明訓練は監督の固定にもかかわらず行動の変化を追跡する
- Abstract要約: 固定された反事実的説明に基づいて訓練されたLMが、訓練対象よりも現在の行動に忠実な説明をもたらすことを示す。
この「内省的」結合は、トレーニングの過程における現在の行動と十分な相関が保たれているときに起こる。
また, イントロスペクティブ・カップリング・トラックは, 他のトレーニング後の目標と並行して説明訓練を行う場合, 最新の監視を必要とせず, それらの変化をトラックする。
- 参考スコア(独自算出の注目度): 49.12474373883331
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When does training language models (LMs) to generate explanations of their predictions yield faithful introspection, rather than superficial imitation? We study LMs trained to explain which features of their inputs influenced their behavior, using models' counterfactual behavior on modified inputs as supervision. Surprisingly, we find that LMs trained on fixed counterfactual explanations derived from earlier checkpoints of themselves, or even from behaviorally similar models in different families, frequently produce explanations more faithful to their own current behaviors than to those of their training targets. This "introspective" coupling between LM explanations and behaviors occurs when training explanations remain sufficiently correlated with current behaviors over the course of training, even as behaviors themselves shift. We also show that introspective coupling tracks behavior shifts: when explanation training is provided concurrently with other post-training objectives, explanations track those shifts without requiring updated supervision. This phenomenon appears in multiple tasks, including sycophancy and refusal, and is robust to label noise. Overall, our results show that even fixed datasets of counterfactual explanations can provide scalable and generalizable post-training signal for introspection.
- Abstract(参考訳): 学習言語モデル(LM)は、表面模倣よりも忠実な内観を生み出すのか?
本研究では,入力のどの特徴がそれらの行動に影響を及ぼすかを説明するために訓練されたLMについて,モデルが修正入力に対する反実的な振る舞いを監督として用いた。
意外なことに、LMは、自己の以前のチェックポイントから、あるいは異なる家族の行動に類似したモデルから派生した、固定された反事実的説明に基づいて訓練され、訓練対象よりも自分たちの現在の行動に忠実な説明をしばしば生成する。
この「内省的」な説明と行動の結合は、訓練の過程における現在の行動と十分な相関が保たれている場合、たとえ行動自体が変化しても起こる。
また, イントロスペクティブ・カップリング・トラックは, 他のトレーニング後の目標と並行して説明訓練を行う場合, 最新の監視を必要とせず, それらの変化をトラックする。
この現象は、梅毒や拒絶を含む複数のタスクに現れ、ノイズのラベル付けに頑丈である。
以上の結果から,反事実的説明の固定されたデータセットでさえ,イントロスペクションのためのスケーラブルで一般化可能なポストトレーニング信号を提供できることがわかった。
関連論文リスト
- Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments [4.8434403033301185]
本稿では,自然界における予期せぬモデル行動を特定する新しいエージェントパイプラインであるCHIVEを紹介し,それを反実的なプロンプト編集で検証する。
これにより、自然に発生するモデル行動について数千の高品質な説明が得られ、反実的な証拠が裏付けられる。
我々は,一般的なLLM解釈可能性技術がエージェントの反ファクトモデル行動を予測する能力を向上させるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-17T15:57:06Z) - Self-CTRL: Self-Consistency Training with Reinforcement Learning [45.9704217495657]
自身の振る舞いを忠実に記述した言語モデル(LM)は、ユーザがより容易に監査、理解、信頼することができる。
本稿では,LMの自己説明と関連する入力に対する動作の一貫性を最適化する自己整合性学習(Self-CTRL)について述べる。
論文 参考訳(メタデータ) (2026-06-16T17:59:40Z) - Forecasting Future Behavior as a Learning Task [25.073460373115733]
我々は、単一の推論軌道で操作する振る舞い予測器を訓練し、説明から求めるのと同じ予測を行う。
提案手法は,再実行時に LRM が解答を繰り返す確率と,入力部分の削除が解答をどう変えるかという2つのタスクで評価する。
論文 参考訳(メタデータ) (2026-06-09T20:56:23Z) - Consistency Training while Mitigating Obfuscation via Rate Matching [6.354949885860511]
大規模な言語モデルはしばしば、ユーザの好みの回答を明らかにするなど、外部の入力機能の影響を受けます。
既存のメソッドは、応答全体や内部のアクティベーションに対する一貫性をトレーニングします。
このことが難読化につながることを示しているが、そこではモデルがキューに言及しないように学習し、その影響で監視性が損なわれる可能性がある。
本稿では,この動作の表現方法に制約を加えることなく,選択した動作特性に対する一貫性をトレーニングするRMCT(Rate Matching Consistency Training)を紹介する。
論文 参考訳(メタデータ) (2026-06-01T13:10:49Z) - Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective [63.9266662672413]
大規模言語モデル (LLM) は, トークン条件生成によって露出し, 強化学習によって安定化される固有の行動可塑性を有することを示す。
Token-Conditioned Reinforcement Learning (ToCoRL)を提案する。
論文 参考訳(メタデータ) (2026-03-09T13:56:53Z) - Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment [0.3823356975862005]
GPT-4.1モデルは、創発的ミスアライメントを誘導し、逆転させることで知られているデータセットを逐次的に微調整する。
以上の結果から,不整合モデルがベースモデルや再整合モデルに比べて有意に有害であることが示唆された。
以上の結果から,行動自己認識はモデルの実際のアライメント状態を追跡することが示唆された。
論文 参考訳(メタデータ) (2026-02-16T14:29:46Z) - On the Paradoxical Interference between Instruction-Following and Task Solving [50.75960598434753]
次の命令は、大規模言語モデル(LLM)を、タスクの実行方法に関する明示的な制約を指定することで、人間の意図と整合させることを目的としている。
我々は,LLMのタスク解決能力にパラドックス的に干渉する命令に従うという,直感に反する現象を明らかにした。
本稿では,タスク解決に追従する命令の干渉を定量化する指標として,SUSTAINSCOREを提案する。
論文 参考訳(メタデータ) (2026-01-29T17:48:56Z) - The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs [60.15472325639723]
人格特性は、人間の行動の予測因子として長い間研究されてきた。
近年のLarge Language Models (LLM) は, 人工システムに類似したパターンが出現する可能性を示唆している。
論文 参考訳(メタデータ) (2025-09-03T21:27:10Z) - CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning [61.21923643289266]
カオス・オブ・マニピュレーション(Chain of Manipulations)は、視覚言語モデル(Vision-Language Models)が、エビデンスを段階的に解決するメカニズムである。
トレーニング後、モデルは外部ツールを介さずに、本質的な操作(グラウンド、ズームインなど)を積極的に行うことで、様々な視覚的問題を解決することができる。
トレーニングされたモデルである textbfCogCoM は、4つのカテゴリの9つのベンチマークで最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2024-02-06T18:43:48Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z) - Shaking the foundations: delusions in sequence models for interaction
and control [45.34593341136043]
我々は、シーケンスモデルが「行動の原因と効果の理解を欠く」ことを示し、それらが自己提案的妄想によって誤った推論を引き出す結果となった。
教師付き学習では,実ミス信号と反実エラー信号とをそれぞれ学習することで,データに対する条件付けや介入をシステムに教えることができることを示す。
論文 参考訳(メタデータ) (2021-10-20T23:31:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。