論文の概要: Does the Model Use the Feature? Separating Steering from Mechanism in LLMs
- arxiv url: http://arxiv.org/abs/2610.07270v1
- Date: Mon, 05 Oct 2026 19:11:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.610812
- Title: Does the Model Use the Feature? Separating Steering from Mechanism in LLMs
- Title(参考訳): モデルは特徴を利用するか? : LLMのメカニズムから分離する
- Abstract要約: LLMの内部的特徴は、概念を追跡し、それらの操作が関連する振る舞いを変えるとき、しばしばメカニズムとして解釈される。
本研究では,本仮説を検証し,自然入力で観測された値で特徴を評価する経験的契約を提案する。
- 参考スコア(独自算出の注目度): 7.360586759550856
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Internal features in LLMs are often interpreted as mechanisms when they track a concept and their manipulation changes a related behavior. Yet steering can push a feature far outside its natural range, where its effects need not reflect the model's own computation. We examine this inference and propose an empirical contract whose tests evaluate features at values observed on natural inputs. One test copies a feature's value from an input that shows a behavior into a matched input that does not (installation) or the reverse (removal); the other restores the feature after an upstream edit (downstream rescue). Installation measures how far the feature suffices for the behavior; removal and downstream rescue measure how much the model uses it. Applied to three kinds of representations, the two strengths separate sharply. The published unknown-entity latent strongly steers knowledge abstention, yet installing observed values from either published latent into matched prompts transfers only a small fraction of the natural known--unknown abstention contrast. Dense known--unknown directions show opposite asymmetries between installation and removal in Gemma and Llama, and how fully a released subject--verb agreement feature set reproduces and restores the behavior depends on how its values are written into the model. Tracking a concept and steering a behavior therefore do not by themselves show that the model uses a feature, and each conclusion holds only for the intervention tested.
- Abstract(参考訳): LLMの内部的特徴は、概念を追跡し、それらの操作が関連する振る舞いを変えるとき、しばしばメカニズムとして解釈される。
しかし、ステアリングは、その効果がモデル自身の計算を反映する必要がないような、自然な範囲から遠く離れたところへ機能をプッシュすることができる。
本研究では,本仮説を検証し,自然入力で観測された値で特徴を評価する経験的契約を提案する。
あるテストでは、動作を(インストール)または逆(削除)しないマッチした入力に反映する入力からフィーチャーの値をコピーする。
インストールは、その機能がその行動にどれくらい適しているかを測定する; 削除と下流の救助は、そのモデルがどれくらい使うかを測定する。
3種類の表現に適用すると、2つの強みは鋭く分離される。
公表された未知の潜伏者が知識の排除を強く主張する一方で、発行された潜伏者から観測された値を一致したプロンプトに組み込むことは、自然に知られている無知な禁忌のコントラストのごく一部だけを伝達する。既知の無知な方向は、Gemma と Llama のインストールと削除の間には逆の対称性を示し、完全にリリースされた主観的合意機能セットがモデルにどのように値が書き込まれるかに依存している。
概念を追跡し、従って振る舞いを操縦することは、モデルが特徴を使用することを示すものではなく、各結論はテストされた介入に対してのみ保持される。
関連論文リスト
- Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking [3.80485977646299]
本稿では,アクティベーションステアリングを用いて自己申告と行動を測定することによって,エージェント意思決定の連続的な次元であるリスクテイクについて検討する。
特徴記述から構築された方向は、自己報告されるが、行動は偶然に残され、モデル自身のタスク選択から構築された方向は、逆となり、タスク固有の指示だけが、弱く両方に到達する。
論文 参考訳(メタデータ) (2026-10-02T22:54:43Z) - THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts [0.300988853836121]
言語モデルがユーザの信念に合うように回答を変更する傾向にあるシコファシー(Sycophancy)は、一般的なアライメント障害である。
我々は、薬局がどこに住んでいるかを識別する、一致したプロンプトから構築された、共有されたコントラスト信号を導入する。
以上の結果から, サイコファンシーは同定可能な計算サブ回路内に存在し, 選択的に操舵できることが示された。
論文 参考訳(メタデータ) (2026-08-16T11:30:26Z) - Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects [58.98080129016082]
Feature-Effect Geometry Analysis (FEGA)は、コンテキスト間で同じアクティブなSAE機能を削除した教師なしのフレームワークである。
ステアリングの安定な方向を提供することなく,特徴を解釈し,因果的に関連付けることができることを示す。
論文 参考訳(メタデータ) (2026-07-27T16:45:08Z) - Detecting and Controlling Sycophancy with Cascading Linear Features [7.13923185919936]
動作に責任のあるカスケード線形特徴を分離する反復データ生成パイプラインを提案する。
私たちは、ユーザのバリデーションを優先する言語モデルの傾向である、梅毒の検知とステアリングに重点を置いています。
論文 参考訳(メタデータ) (2026-06-23T20:10:53Z) - Representation Without Control: Testing the Realization Effect in Language Models [0.0]
大規模言語モデルは行動シミュレータとしてますます使われているが、そのアウトプットが人間のような認知メカニズムを反映しているかどうかは不明だ。
本研究では, リスクテイクが紙の後に体系的に異なる行動経済学において, 実効と実効的な利益と損失とを両立させることにより, この問題を解明する。
我々は,LPMの動作を,アクティベーションステアリングによる行動感度,内部表現の線形読み出し,因果制御の3つのレベルで評価した。
論文 参考訳(メタデータ) (2026-05-24T16:07:34Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - SAEs Are Good for Steering -- If You Select the Right Features [45.47261543304217]
現在の方法では、それらを活性化する入力トークンを分析して、SAEの機能をステアに識別する。
本研究では,主にモデル入力のパターンをキャプチャする入力特徴と,モデル出力に対する人間の理解可能な影響を持つ出力特徴の2つの特徴を区別する。
論文 参考訳(メタデータ) (2025-05-26T14:47:59Z) - Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors [61.92704516732144]
正当性予測の最も堅牢な特徴は、モデルの振舞いに特徴的な因果的役割を果たすものであることを示す。
モデル出力の正しさを予測するために因果メカニズムを利用する2つの手法を提案する。
論文 参考訳(メタデータ) (2025-05-17T00:31:39Z) - Predicting the Performance of Black-box LLMs through Self-Queries [60.87193950962585]
大規模言語モデル(LLM)は、AIシステムにおいてますます頼りになってきている。
本稿では、フォローアッププロンプトを使用し、異なる応答の確率を表現として捉え、ブラックボックス方式でLCMの特徴を抽出する。
これらの低次元表現上で線形モデルをトレーニングすると、インスタンスレベルでのモデル性能の信頼性を予測できることを示す。
論文 参考訳(メタデータ) (2025-01-02T22:26:54Z) - AFD: Mitigating Feature Gap for Adversarial Robustness by Feature Disentanglement [56.90364259986057]
逆方向の微調整法は、逆方向の訓練方法で事前訓練されたモデルを微調整することにより、逆方向の強靭性を高める。
本稿では,特定の潜伏する特徴を明示的にモデル化し,除去するためのアンタングルメントに基づくアプローチを提案する。
提案手法は,既存の対戦型微調整法や対戦型トレーニングベースラインを超越した手法である。
論文 参考訳(メタデータ) (2024-01-26T08:38:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。