論文の概要: How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models
- arxiv url: http://arxiv.org/abs/2604.04385v1
- Date: Mon, 06 Apr 2026 03:20:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.077543
- Title: How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models
- Title(参考訳): 調整経路:言語モデルにおけるポリシー回路のローカライズ、スケーリング、制御
- Abstract要約: 我々は、アライメント学習言語モデルにおいて、繰り返し発生するスパースルーティング機構を同定する。
6つの実験室から9つのモデルにまたがるこのメカニズムを、120組のプロンプトペアのコーパスで検証した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We identify a recurring sparse routing mechanism in alignment-trained language models: a gate attention head reads detected content and triggers downstream amplifier heads that boost the signal toward refusal. Using political censorship and safety refusal as natural experiments, we trace this mechanism across 9 models from 6 labs, all validated on corpora of 120 prompt pairs. The gate head passes necessity and sufficiency interchange tests (p < 0.001, permutation null), and core amplifier heads are stable under bootstrap resampling (Jaccard 0.92-1.0). Three same-generation scaling pairs show that routing distributes at scale (ablation up to 17x weaker) while remaining detectable by interchange. By modulating the detection-layer signal, we continuously control policy strength from hard refusal through steering to factual compliance, with routing thresholds that vary by topic. The circuit also reveals a structural separation between intent recognition and policy routing: under cipher encoding, the gate head's routing contribution collapses (78% in Phi-4 at n=120) while the model responds with puzzle-solving rather than refusal. The routing mechanism never fires, even though probe scores at deeper layers indicate the model begins to represent the harmful content. This asymmetry is consistent with different robustness properties of pretraining and post-training: broad semantic understanding versus narrower policy binding that generalizes less well under input transformation.
- Abstract(参考訳): ゲートアテンションヘッドは検出されたコンテンツを読み出し、下流のアンプヘッドをトリガーし、信号の拒絶に向けて増幅する。
政治的検閲と安全性の拒絶を自然実験として用いて、120組のプロンプトペアのコーパスで検証された6つの実験室から9つのモデルにまたがるメカニズムを追究した。
ゲートヘッドは必要かつ十分な交換試験(p < 0.001, permutation null)をパスし、コアアンプヘッドはブートストラップ再サンプリング(Jaccard 0.92-1.0)下で安定である。
3つの同世代のスケーリングペアは、ルーティングが大規模に分散し(最大17倍弱くなる)、インターチェンジによって検出可能であることを示している。
検出層信号の変調により、トピックによって異なるルーティングしきい値を用いて、ステアリングから現実のコンプライアンスに至るまで、ポリシー強度をハードリファレンスから継続的に制御する。
暗号符号化では、ゲートヘッドのルーティングコントリビューションが崩壊し(n=120でPhi-4で78%)、モデルが拒絶ではなくパズル解決で応答する。
より深い層でのプローブスコアは、モデルが有害な内容を表現し始めたことを示しているが、ルーティングメカニズムは決して発火しない。
この非対称性は、事前学習と後学習の異なる頑健性特性と一致している: 入力変換においてあまりうまく一般化しない、より広い意味的理解とより狭いポリシーバインディングである。
関連論文リスト
- SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation [51.46828526392219]
推論セグメンテーションは暗黙の言語学的結論を正確なマスクに変換する。
既存のMLLMセグメンタインタフェースでは、特別なトリガーを使用するか、両方の信号を1つのコンテキストに圧縮する。
明示的なWhat-whereインターフェースであるSeGDePを提示する。
論文 参考訳(メタデータ) (2026-09-08T15:11:32Z) - Reference-Grafting Matches Fine-Tuning at Eliciting Sandbagged Capabilities [2.3185929089334594]
グラフティングは、正直な基準で取る値と対照的な方向に沿ってアクティベーションの座標を設定する。
正直なサンジグギャップの+94から+101%に回復する。
同様のリカバリは、強化学習によるサンドバッグングや、パスワードロックされたコード生成に当てはまる。
論文 参考訳(メタデータ) (2026-08-29T22:32:36Z) - LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - Grounding latent algorithm routing in transformer reasoning [2.3977651066739374]
インダクティブバイアスの異なる家族を対象としたエピソードレベルの適応を,トランスフォーマーが構成できるかどうかを検討した。
ROUTEBENCHは,大域的縮小,疎度,頑健性,局所性を重視した診断ベンチマークである。
44M-612Mパラメータでスクラッチからトレーニングされた高密度デコーダのみのトランスフォーマーでは、306Mモデルがオラクルルーティングギャップの80.9%を閉じ、84.1のルートF1を達成する。
論文 参考訳(メタデータ) (2026-07-27T14:07:12Z) - Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection [0.0]
我々はLoRAをトレーニングデータ中毒によって確実にバックドアできることを示す。
攻撃はランクとともに単調にスケールし、選択されたトリガーアンカートークンはトリガー依存とベースモデル依存の両方である。
行動検出はサプライチェーンスキャンの操作可能な結果である。
論文 参考訳(メタデータ) (2026-05-28T16:32:25Z) - Activation Differences Reveal Backdoors: A Comparison of SAE Architectures [5.218766876318545]
言語モデルに対するバックドア攻撃は、AIの安全性に重大な脅威をもたらす。
微調整モデルにおけるバックドア関連機能を分離するための2つのスパースオートエンコーダアーキテクチャについて検討する。
Diff-SAEは、バックドアアイソレーションにおいてクロスコーダよりも一貫して、実質的に優れています。
論文 参考訳(メタデータ) (2026-05-08T06:30:26Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Reliable Control-Point Selection for Steering Reasoning in Large Language Models [28.288321095634128]
ステアリングベクトルは、大規模言語モデルにおける推論動作を制御するためのトレーニング不要のメカニズムを提供する。
しかし、有効なベクトルを構成するには、モデルが隠した状態にある真の行動信号を特定する必要がある。
提案手法は,全ての検出された境界が真の行動信号を符号化していることを暗黙的に仮定して,チェーンオブソートトレースのキーワードマッチングによってこれらの挙動を検出する。
本研究では,コンテキスト依存的なトリガ確率を持つ事象として固有の推論動作を形式化する確率モデルを構築し,不安定な境界が操舵信号を弱めることを示す。
論文 参考訳(メタデータ) (2026-04-02T14:48:56Z) - The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities [0.0]
PhishNChipsは、10の迅速な戦略に基づく11のモデルの研究である。
単一モデルのフィッシングバイパス速度は、設定方法によって1%未満から97%の範囲である。
高い予測信号に関するプロンプトの最適化により,ベンチマーク性能が向上することを示す。
論文 参考訳(メタデータ) (2026-03-26T05:48:37Z) - Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails [0.0]
自然実験として、中国語・オリジン語モデルにおける政治的検閲について研究する。
5つの実験室の9つのオープンウェイトモデルに対して、プローブ、外科的改善、行動テストを使用します。
論文 参考訳(メタデータ) (2026-03-18T20:54:34Z) - Directional Routing in Transformers [0.0]
指向性ルーティングは、共有ルータによって制御される各トランスフォーマーアテンションヘッド学習抑制方向を提供する軽量なメカニズムである。
結果の回路を機械的解釈可能性によってトレースする。
ルーティングは、ベースラインに対するパープレキシティを31~56%削減するが、下流の多重選択ベンチマークはまだこれらの利得を反映していない。
論文 参考訳(メタデータ) (2026-03-16T07:28:22Z) - Backdoor Directions in Vision Transformers [56.382912038371046]
本稿では,視覚変換器(ViT)におけるバックドアアタックの表現方法について検討する。
我々は、トリガーの内部表現に対応するモデルのアクティベーションにおいて、特定のトリガー方向'を識別する。
この方向を診断ツールとして使用して、バックドア機能が層間でどのように処理されるかを追跡する。
論文 参考訳(メタデータ) (2026-03-11T14:13:48Z) - Routing Absorption in Sparse Attention: Why Random Gates Are Hard to Beat [0.0]
疎い注意がエンドツーエンドにトレーニングされると、モデルのQ/K/V投影は、どんなマスクにも適応する。
微分可能なソフトゲーティングは、ゲートが学習されているかランダムであるかに関わらず、ほぼ同じ難易度に収束する。
専門家はどのルーターにも適応するが、注意は構造的により厳しい形を示すことを示している。
論文 参考訳(メタデータ) (2026-02-11T15:06:44Z) - Generalizing GNNs with Tokenized Mixture of Experts [75.8310720413187]
安定性の向上には,変化に敏感な特徴への依存を低減し,既約最悪の一般化フロアを残す必要があることを示す。
本研究では,STEM-GNNを提案する。STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN。
9つのノード、リンク、グラフのベンチマークで、STEM-GNNはより強力な3方向バランスを実現し、クリアグラフ上での競争力を維持しながら、次数/ホモフィリーシフトや特徴/エッジの破損に対する堅牢性を改善している。
論文 参考訳(メタデータ) (2026-02-09T22:48:30Z) - Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics [2.4839105527363574]
本稿では,大言語モデルの拒否動作を詳細に制御する推論時間手法であるRefusal Steeringを紹介する。
有害なコンテンツの安全性を保ちつつ、政治的拒絶行為を除去できることを示す。
論文 参考訳(メタデータ) (2025-12-18T14:43:04Z) - Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models [71.44858461725893]
信頼できない第三者によって微調整されたモデルを考えると、モデルがバックドアで注入されたかどうかが重要で難しい問題である。
既存の検出方法は通常、トレーニングデータセット、バックドアトリガー、ターゲットの事前知識に依存する。
このような事前知識を伴わずに動作する新しいモデルレベルの検出フレームワークであるAssimilation Matters in DETection (AMDET)を紹介する。
論文 参考訳(メタデータ) (2025-11-29T06:20:00Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。