論文の概要: Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.25907v1
- Date: Tue, 28 Jul 2026 16:01:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.911698
- Title: Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models
- Title(参考訳): 目標活性化の最小化:大規模言語モデルにおける評価認識遅延の入力専用抑制
- Authors: Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato,
- Abstract要約: アクティベーションステアリングは、推論時に内部アクティベーションを編集することでモデル動作を制御する。
入力側双対について検討し、流動的なプロンプトを最適化し、選択した内部潜伏剤をゼロに駆動する。
- 参考スコア(独自算出の注目度): 0.4783156204372467
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Activation steering controls model behavior by editing internal activations at inference time. We study its input-side dual: optimizing a fluent prompt so that a chosen internal latent is driven toward zero, with no inference-time model access. Our target is an "evaluation-awareness" latent-linearly readable and steerable in recent work-whose control would threaten the validity of safety evaluations if models behave differently when they detect being tested. Adapting Fluent Dreaming / EPO with a negated feature term (GCG-style token optimization plus a self-cross-entropy fluency regularizer, swept over a fluency weight), we suppress the latent under five target constructions-a CAA direction, a subspace norm, an SAE feature, a single MLP neuron, and a behavioral logit-on Llama-3.2-3B and Llama-3.1-8B. The latent is robustly suppressible ($z\approx-7$), and a causally-validated Llama Scope SAE feature can be fully and selectively turned off. But our controls tell a cautionary story about the CAA direction: a placebo random direction is suppressed just as hard and shifts behavior just as far, and when we hold a real eval passage in context and optimize only a prefix, suppressing the eval-direction fails to reduce-and slightly increases-the model's behavioral eval judgment. Activation-readability, in short, is not behavioral controllability. We further find that a single MLP neuron is eval-correlated but not causal at both scales, and that scanning the real Pile yields a natural-text baseline competitive with the optimizer for the internal direction. A positive control validates our erasure detector, bounding an erasure-vs-rotation question earlier left open.
- Abstract(参考訳): アクティベーションステアリングは、推論時に内部アクティベーションを編集することでモデル動作を制御する。
入力側双対について検討する: フロートプロンプトを最適化することにより、選択した内部潜時がゼロに駆動され、推論時モデルアクセスが不要となる。
我々の目標は、最近行われている作業制御において、線形に読み取り可能で、テスト検出時にモデルが異なる振る舞いをする場合、安全性評価の妥当性を脅かすような「評価-認識」潜在性である。
否定的特徴項(GCG型トークン最適化と自己クロスエントロピー型フラエンシ正規化器、フラエンシ重みを越える)でFluent Dreaming / EPOを適応させることで、我々は潜伏をCAA方向、サブスペースノルム、SAE特徴、単一MLPニューロン、Llama-3.2-3BおよびLlama-3.1-8Bの5つの目標構成条件下で抑制する。
潜伏剤は頑強に抑制され(z\approx-7$)、因果検証されたLlama Scope SAE機能は完全かつ選択的にオフにすることができる。
しかし、我々の制御では、CAAの方向に関する注意深いストーリーを伝えており、プラセボのランダムな方向は、できるだけ硬く抑えられ、行動を変える。
アクティベーション可読性(Activation-readability)とは、振舞いの制御性ではない。
さらに、単一のMLPニューロンはeval-correlatedであるが、両方のスケールでは因果関係がなく、実際のPileをスキャンすると、内部方向のオプティマイザと競合する自然なテキストベースラインが得られる。
正の制御により、消去-vs-回転問題が先に解き放たれた状態で、消去検出器が検証される。
関連論文リスト
- Representation Without Control: Testing the Realization Effect in Language Models [0.0]
大規模言語モデルは行動シミュレータとしてますます使われているが、そのアウトプットが人間のような認知メカニズムを反映しているかどうかは不明だ。
本研究では, リスクテイクが紙の後に体系的に異なる行動経済学において, 実効と実効的な利益と損失とを両立させることにより, この問題を解明する。
我々は,LPMの動作を,アクティベーションステアリングによる行動感度,内部表現の線形読み出し,因果制御の3つのレベルで評価した。
論文 参考訳(メタデータ) (2026-05-24T16:07:34Z) - Agentic Control in Variational Language Models [0.0]
本研究では,変分言語モデルが,内的根拠に基づく最小かつ測定可能なエージェント制御をサポートできるかどうかを考察する。
本モデルでは, 局所変動隠蔽計算(EVE), ホメオスタティック潜伏制御器, 構造的に認識されたチェックポイント保持と, 保持モデル上で動作する校正不確実性認識コントローラを組み合わせる。
論文 参考訳(メタデータ) (2026-04-14T09:47:53Z) - Reliable Control-Point Selection for Steering Reasoning in Large Language Models [28.288321095634128]
ステアリングベクトルは、大規模言語モデルにおける推論動作を制御するためのトレーニング不要のメカニズムを提供する。
しかし、有効なベクトルを構成するには、モデルが隠した状態にある真の行動信号を特定する必要がある。
提案手法は,全ての検出された境界が真の行動信号を符号化していることを暗黙的に仮定して,チェーンオブソートトレースのキーワードマッチングによってこれらの挙動を検出する。
本研究では,コンテキスト依存的なトリガ確率を持つ事象として固有の推論動作を形式化する確率モデルを構築し,不安定な境界が操舵信号を弱めることを示す。
論文 参考訳(メタデータ) (2026-04-02T14:48:56Z) - Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models [71.11171576590134]
視覚言語モデルは視覚的ジェイルブレイク攻撃によって容易に誘導され、有害なコンテンツを生成する。
本稿では,NullSteerを提案する。
我々はNullSteerが様々なジェイルブレイク攻撃において有害な出力を著しく減少させることを示す。
論文 参考訳(メタデータ) (2026-03-23T15:23:23Z) - Internalizing LLM Reasoning via Discovery and Replay of Latent Actions [4.830503861275364]
連鎖プロセスの隠れ状態への内部化は、テスト時間計算をスケールするための非常に効率的なパラダイムとして現れている。
動的潜在軌道制御問題として推論強化を再構築するSTIR(Self-Distilled Tools for Internal Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-02-04T08:44:57Z) - Selective Steering: Norm-Preserving Control Through Discriminative Layer Selection [1.7802147489386628]
大規模言語モデル(LLM)は、有害な行動を引き起こす敵攻撃に対して脆弱なままである。
我々は2つの重要な革新を通じてこれらの制限に対処する選択ステアリングを提案する。
9つのモデルに対する実験により、選択ステアリングは以前の手法よりも5.5倍の攻撃成功率を達成することが示された。
論文 参考訳(メタデータ) (2026-01-27T08:56:25Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。