論文の概要: HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix
- arxiv url: http://arxiv.org/abs/2610.01170v1
- Date: Thu, 01 Oct 2026 06:45:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.948866
- Title: HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix
- Title(参考訳): HeadEdit:冷凍アンエンベディングマトリックスによる言語モデル行動の校正
- Abstract要約: HeadEditは、非埋め込み行列を通してモデル動作を校正する勾配のないメソッドである。
HeadEditは3つのタスクと3つのモデルファミリーで9つの実験的な設定を改善している。
また、勾配に基づくアライメントとの接続も明らかにしている。
- 参考スコア(独自算出の注目度): 28.83831654186547
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Alignment does not eliminate behavioral errors in language models. Models may still refuse benign requests, call unnecessary tools, or yield to false user claims. Current methods mitigate such errors as a computation problem, and rarely explore if the desired behavior is already encoded in the model's representation. Motivated by the observation that behavior-relevant information remains linearly decodable from the final hidden state even when the resulting logits produce the undesired behavior, we introduce HeadEdit, a gradient-free method that calibrates model behavior through the unembedding matrix. HeadEdit extracts a low-rank behavioral subspace from paired completions and uses each prompt's coordinates within it to generate a vocabulary-wide correction, thereby implementing implicitly adaptive steering without manually specified target tokens or parameter updates. HeadEdit improves all nine experimental settings across three tasks and three model families, with negligible inference overhead and no systematic loss of general capabilities. It also reveals a connection to gradient-based alignment. HeadEdit's low-dimensional representation partly predicts how preference tuning changes output logits on unseen prompts. The subspace learned from the model can also be reused after tuning, improving performance without re-extracting or retuning. These results show that HeadEdit provides a practical, lightweight, and interpretable way to calibrate model behavior through the unembedding matrix.
- Abstract(参考訳): アライメントは言語モデルにおける振る舞いの誤りを排除しない。
モデルは、良心的な要求を拒否したり、不要なツールを呼び出したり、誤ったユーザクレームを発生させたりします。
現在の手法は、計算問題のようなエラーを緩和し、所望の振る舞いが既にモデルの表現にエンコードされているかどうかを探索することは滅多にない。
結果,ロジットが望ましくない動作を生成しても,動作関連情報が最終隠蔽状態から線形にデオード可能であることに感銘を受け,非埋め込み行列によるモデル動作のキャリブレーションを行うHeadEditを紹介した。
HeadEditは、ペア化された完了から低ランクな振る舞い部分空間を抽出し、各プロンプトの座標を用いて語彙全体の補正を生成し、手動で指定したターゲットトークンやパラメータの更新なしに暗黙的に適応的なステアリングを実装する。
HeadEditは、3つのタスクと3つのモデルファミリにまたがる9つの実験的な設定を改善している。
また、勾配に基づくアライメントとの接続も明らかにしている。
HeadEditの低次元表現は、好ましくないプロンプトの出力ロジットをどのように変更するかを部分的に予測する。
モデルから学んだサブスペースは、チューニング後に再利用したり、パフォーマンスを改善したり、再抽出したりすることなく利用できる。
これらの結果から,HeadEditは,非埋め込み行列を通じてモデル動作をキャリブレーションする,実用的で軽量で解釈可能な方法を提供する。
関連論文リスト
- A Heckler in the Hidden State: Correctness Signals in Diffusion Language Models [4.165512410177194]
拡散モデルは、部分的にマスキングされたシーケンスを繰り返し更新することでコードを生成する。
我々は、それらの内部アクティベーションがコード正しさを符号化し、その情報が生成を改善するかどうかを問う。
論文 参考訳(メタデータ) (2026-09-29T05:54:31Z) - Inference-Time Machine Unlearning via Gated Activation Redirection [1.1699531043716684]
ゲーテッド・アクティベーション・リダイレクト(GUARD-IT)による推論時間学習の導入
GUARD-ITは入力依存のアクティベーションステアリングを推論時に解き放ち、モデルの重みはそのまま残す。
TOFUとMUSEの実験では、GUARD-ITは3つのモデルスケールで12の勾配ベースラインと一致するか、あるいは超えている。
論文 参考訳(メタデータ) (2026-05-12T21:26:25Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors [60.06461883533697]
我々は、ランクワンモデル編集を活用して、帰属誘導モデル修正フレームワークを確立する。
まず、既存のモデル編集と整合性の設定を区別し、信頼性の低い振る舞いを補正する定式化を行う。
そこで本研究では, 帰属誘導層ローカライゼーション手法を提案する。
論文 参考訳(メタデータ) (2026-03-08T01:06:07Z) - Probing for Arithmetic Errors in Language Models [86.8227317662622]
言語モデルの内部アクティベーションは、算術誤差を検出するために使用できる。
単純なプローブはモデルが予測した出力と正解の両方を隠蔽状態から正確に復号できることを示す。
モデル精度を90%以上の精度で予測する軽量エラー検出器を訓練する。
論文 参考訳(メタデータ) (2025-07-16T16:27:50Z) - Can Gradient Descent Simulate Prompting? [56.60154660021178]
勾配は新しい情報に対する条件付けの効果を更新する。
勾配降下訓練は、引き起こされたモデルパフォーマンスのいくつか(時には全て)を回復する。
長文モデリングのための新しい道のりを示唆する。
論文 参考訳(メタデータ) (2025-06-26T04:06:20Z) - Memory-Based Model Editing at Scale [102.28475739907498]
既存のモデルエディタは、編集対象のスコープを正確にモデル化するのに苦労する。
SERAC(Retrieval-Augmented Counterfactal Model)を用いた半パラメトリック編集を提案する。
SERACは、編集を明示的なメモリに格納し、必要に応じてベースモデルの予測を変更できるように、それらを推論することを学ぶ。
論文 参考訳(メタデータ) (2022-06-13T23:40:34Z) - Editing a classifier by rewriting its prediction rules [133.5026383860842]
本稿では,予測ルールを直接書き換えることで分類器の動作を修正する手法を提案する。
このアプローチでは、ほとんど追加のデータ収集を必要とせず、新しい環境へのモデルの適用など、さまざまな設定に適用することができます。
論文 参考訳(メタデータ) (2021-12-02T06:40:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。