論文の概要: Measuring Activation Control in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.21664v1
- Date: Fri, 21 Aug 2026 22:12:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.367476
- Title: Measuring Activation Control in Large Language Models
- Title(参考訳): 大規模言語モデルにおけるアクティベーション制御の測定
- Abstract要約: モデルが自然言語で残差ストリームを変調できる範囲を定量化する。
モデルファミリーと能力レベル全体で、ほとんどのLCMは残ストリーム活性化の方向と大きさを制御できる。
これらの結果から,イントロスペクティブ能力の増大に伴い,活性化空間自体の制御が監視の障害となる可能性が示唆された。
- 参考スコア(独自算出の注目度): 0.5171493078033068
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safe deployment of increasingly capable models will likely come to rely on latent-space monitoring as a complement to behavioral evaluations, especially when evaluation-aware models exhibit scheming or deception. However, if models can also control their own activations, deception could extend into the latent space itself. With this in mind, we introduce the Activation Controllability Benchmark to quantify the extent to which models can modulate their residual stream via natural-language instruction. Across model families and capability levels, we find that most LLMs can control the direction and magnitude of their residual stream activations with some degree of temporal resolution, though performance varies considerably across models. In simple tasks, this level of control can evade activation-based monitoring methods (including linear probes, natural language autoencoders, activation oracles, and the Jacobian lens), albeit imperfectly. These results suggest that control over the activation space itself could become a confound for monitoring as introspective capabilities increase; therefore, we recommend that frontier labs and evaluators track activation controllability in future models.
- Abstract(参考訳): ますます有能なモデルの安全なデプロイは、行動評価の補完として、特に評価対象モデルがスケジュールや偽装を示す場合、潜在空間の監視に依存している可能性が高い。
しかし、モデルが自身のアクティベーションを制御できるなら、偽装は潜在空間自体に拡張される可能性がある。
そこで本研究では,アクティベーション制御可能性ベンチマーク(Activation Controllability Benchmark)を導入する。
モデルファミリと能力レベル全体で、ほとんどのLCMは、ある程度の時間分解能で残ストリームアクティベーションの方向と大きさを制御できるが、性能はモデルによって大きく異なる。
単純なタスクでは、このレベルの制御は、線形プローブ、自然言語オートエンコーダ、アクティベーションオラクル、ジャコビアンレンズを含む)アクティベーションベースのモニタリング方法を回避することができる。
これらの結果から,活性化空間自体の制御がイントロスペクティブ能力の増大に伴う監視の障害となる可能性が示唆され,フロンティア実験室や評価器が将来のモデルにおける活性化制御性を追跡することが推奨される。
関連論文リスト
- Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control [3.3394856680250284]
本研究では,世界行動モデル(WAM)の活性化空間における頑健性関連摂動の表現について検討する。
成功したロールアウトと失敗したロールアウトのアクティベーションを比較すると、いくつかのWAMアーキテクチャはロバストネスクリティカルな特徴に対して低次元線形分離性を示す。
これにより、トレーニングフリーのWAMステアリングにおける対照的なアクティベーション方向の使用がモチベーションとなる。
また, WAMアクティベーションダイナミクスの局所線形性はモデルベース最適制御による効率的なフィードバックステアリングを可能にすることを示す。
論文 参考訳(メタデータ) (2026-07-16T12:52:49Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation [74.17379276939599]
近年のQwen-3.5シリーズにおいても,アクティベーションステアリングが広範囲のアライメントを引き起こすことが示されている。
ステアリングサイズ, ステアリングサブスペースの低ランク構造, ステアリングベクター構築時のエポック数など, キーステアリング固有の因子を解析することにより, AS誘起EMの特性を特徴づける。
論文 参考訳(メタデータ) (2026-06-07T15:34:59Z) - Agentic Control in Variational Language Models [0.0]
本研究では,変分言語モデルが,内的根拠に基づく最小かつ測定可能なエージェント制御をサポートできるかどうかを考察する。
本モデルでは, 局所変動隠蔽計算(EVE), ホメオスタティック潜伏制御器, 構造的に認識されたチェックポイント保持と, 保持モデル上で動作する校正不確実性認識コントローラを組み合わせる。
論文 参考訳(メタデータ) (2026-04-14T09:47:53Z) - Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers [69.60693631859411]
本稿では,線形アテンションアーキテクチャ上に構築された制御可能な拡散モデルについて検討する。
本稿では,SANA などのリニアアテンションバックボーンに適した新しい制御可能な拡散フレームワークを提案する。
提案手法は,線形アテンションモデルに基づく最先端の制御可能な生成性能を実現する。
論文 参考訳(メタデータ) (2026-03-29T12:31:34Z) - Large language models require a new form of oversight: capability-based monitoring [10.382163755118713]
医療における大規模言語モデル(LLM)には、その監視に関する精査が伴っている。
そこで本研究では,これらのモデルの開発と実用化に基礎を置き,拡張性のあるジェネラリストLLMモニタリングの組織的原則を提案する。
機能ベースのモニタリングアプローチを実装する上で、開発者、組織リーダー、プロフェッショナル社会に対する考慮事項について説明する。
論文 参考訳(メタデータ) (2025-11-05T01:20:28Z) - ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention [86.93601565563954]
ScaleWeaverは、高度な視覚的自己回帰(VAR)モデルに基づいて、高忠実で制御可能な生成を実現するために設計されたフレームワークである。
提案された参照注意モジュールは image$rightarrow$condition から不要な注意を排除し、計算コストを削減している。
実験によると、ScaleWeaverは、拡散ベースの方法よりも優れた効率を実現しつつ、高品質な生成と正確な制御を提供する。
論文 参考訳(メタデータ) (2025-10-16T17:00:59Z) - Improving Reasoning Performance in Large Language Models via Representation Engineering [2.0099933815960256]
大規模言語モデル(LLM)の表現工学的アプローチを提案する。
モデルアクティベーションは、推論タスクを処理する際にLLMの残ストリームから読み込まれる。
LLMは、ある程度に、アクティベーションを調節することで、認識された推論能力を向上させることができることを示す。
論文 参考訳(メタデータ) (2025-04-28T04:58:43Z) - Controlling Large Language Models Through Concept Activation Vectors [30.348768212571255]
本稿では,概念活性化ベクトル(GCAV)を用いたモデル制御フレームワークを提案する。
GCAVはリソース集約的な微調整を必要とせずに正確な制御を保証する。
本フレームワークは, 粒度制御による最先端性能を実現し, 個別試料のステアリング層およびステアリング径の微粒化調整を可能にする。
論文 参考訳(メタデータ) (2025-01-10T07:41:48Z) - Model-Based Reinforcement Learning with Isolated Imaginations [61.67183143982074]
モデルに基づく強化学習手法であるIso-Dream++を提案する。
我々は、切り離された潜在的想像力に基づいて政策最適化を行う。
これにより、野生の混合力学源を孤立させることで、長い水平振動子制御タスクの恩恵を受けることができる。
論文 参考訳(メタデータ) (2023-03-27T02:55:56Z) - Predictive Coding for Locally-Linear Control [92.35650774524399]
高次元観測と未知のダイナミクスは、多くの実世界の意思決定タスクに最適な制御を適用する際に大きな課題である。
Learning Controllable Embedding (LCE)フレームワークは、観測結果を低次元の潜伏空間に埋め込むことによって、これらの課題に対処する。
理論的には、明示的な次観測予測を予測符号化に置き換えることが可能である。
論文 参考訳(メタデータ) (2020-03-02T18:20:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。