論文の概要: Divergent Response Modes in Frontier Language Models Under Steering Pressure
- arxiv url: http://arxiv.org/abs/2608.06578v1
- Date: Thu, 06 Aug 2026 20:48:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.286381
- Title: Divergent Response Modes in Frontier Language Models Under Steering Pressure
- Title(参考訳): ステアリング圧力下におけるフロンティア言語モデルの発散応答モード
- Authors: Ali Jalal-Kamali,
- Abstract要約: 本研究では,6つのフロンティアモデルに対して,300対のベースとステアリングアイテムを3つのカテゴリに分けて評価した。
モデルの違いは、操舵がどれだけ振る舞うかではなく、どのような反応を与えるか、そしていくつかの応答モードが1つか2つしか現れないことにあります。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier language models are trained using distinct data, objectives, and safety pipelines. Whether these differences produce measurably different behaviors under explicit steering pressure remains underexplored. This study evaluates behavioral steerability across six frontier models from six developers using 300 paired base and steered items over three categories: values-conflict, reasoning-elicitation, and reasoning-suppression (plus 40 validation items). All six models act as blind peer judges and classify every response based on fixed behavioral rubrics. The resulting 24,480 judgments are scored by leave-one-out consensus. We find that models differ not just in how much steering shifts their behavior but in what kind (mode) of response they give, and some response modes appear in only one or two of them. GPT-5 deflects requests to disclose its reasoning while leaving its answer intact (99% vs. 0% for all other models). Claude Opus 4.7 and GPT-5 resist explicit suppression instructions and in different ways. Using Llama as the open-weight model, we trace the largest behavioral split to its internals. A linear probe decodes the behavior from the residual stream at 0.87 held-out accuracy while injecting that direction during generation drives the behavior from 0% to 86% across an intervention sweep. Every finding holds under both a token-budget remediation and a control experiment with a hypothesis-blind judgment prompt.
- Abstract(参考訳): 最前線の言語モデルは、異なるデータ、目的、安全パイプラインを使用して訓練される。
これらの違いが明示的な操舵圧力の下で測定可能な異なる挙動をもたらすかどうかはまだ未解明のままである。
本研究では,6つのフロンティアモデルに対して,300対のベースとステアリングアイテムを3つのカテゴリに分けて評価した。
6つのモデルは全て盲目のピアジャッジとして機能し、固定された振る舞いのルーリックに基づいてすべての応答を分類する。
結果の24,480の判断は、一点決で決着する。
モデルの違いは、操舵がどれだけ振る舞うかではなく、どのような反応(モード)をするか、そしていくつかの応答モードが1つか2つしか現れないことである。
GPT-5は、答えをそのまま残しながら推論を開示する要求を無視する(他のすべてのモデルでは99%対0%)。
Opus 4.7 と GPT-5 は明示的な抑圧命令と異なる方法で抵抗する。
オープンウェイトモデルとしてLlamaを用いることで、最大の行動分割を内部まで追跡する。
線形プローブは、残留ストリームからの挙動を0.87ホールトアウト精度で復号し、生成中にその方向を注入することで、介入スイープを通して0%から86%の動作を駆動する。
すべての発見は、トークン予算の修正と仮説盲検判定プロンプトによる制御実験の両方の下に保持される。
関連論文リスト
- Small Foundation Models of Human Cognition and Behaviour [45.88028371034407]
135Mから14Bパラメータの14モデルを、Psych-101の4つのアーキテクチャファミリでトレーニングしています。
Psych-101は160の実験から1070万の試行レベルの選択のデータセットである。
論文 参考訳(メタデータ) (2026-08-05T11:34:20Z) - AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability [16.27940179594792]
AdversaBenchは、5つの構造化演算子でシードプロンプトをミュートするエンドツーエンドの赤チームパイプラインである。
本報告では, 推論, 指示追従, ツール利用の3つのカテゴリにまたがる45種の種子について実験を行った。
論文 参考訳(メタデータ) (2026-06-23T13:50:51Z) - Evaluation Awareness Is Not One Capability: Evidence from Open Language Models [1.758143872501506]
安全ベンチマークは、テスト条件の振る舞いがデプロイメントの振る舞いを予測すると仮定する。
これにより、ベンチマークパフォーマンスとデプロイメントの動作のギャップが開ける。
我々は、37のオープンウェイトモデルと7つのファミリーにわたる8つの実験を通して、この評価意識を特徴づける。
論文 参考訳(メタデータ) (2026-06-22T16:48:43Z) - Prefill Awareness in Large Language Models [42.57596462680195]
本研究は,言語モデルが,教師なしと教師なしのアシスタント側コンテキストを区別できるかどうかを考察する。
私たちはフロンティアモデルに十分な事前認識があることに気付きました。
以上の結果から, プリフィルの意識は, 既にいくつかのプリフィル方式にかなり相反していることが示唆された。
論文 参考訳(メタデータ) (2026-06-10T23:26:39Z) - Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs [0.17188280334580197]
言語モデルは命令に従うように訓練されているが、強力なパターン補完器でもある。
我々は、ターゲットTで動作するためのユーザ命令がNのハードコードアシスタントによって反対される会話を構築し、競合するパターンPを示す。
この設定では、最大50ターンで13のモデルと16の異なる命令で命令追従率(IF)を測定します。
論文 参考訳(メタデータ) (2026-05-19T18:32:20Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Reliable Control-Point Selection for Steering Reasoning in Large Language Models [28.288321095634128]
ステアリングベクトルは、大規模言語モデルにおける推論動作を制御するためのトレーニング不要のメカニズムを提供する。
しかし、有効なベクトルを構成するには、モデルが隠した状態にある真の行動信号を特定する必要がある。
提案手法は,全ての検出された境界が真の行動信号を符号化していることを暗黙的に仮定して,チェーンオブソートトレースのキーワードマッチングによってこれらの挙動を検出する。
本研究では,コンテキスト依存的なトリガ確率を持つ事象として固有の推論動作を形式化する確率モデルを構築し,不安定な境界が操舵信号を弱めることを示す。
論文 参考訳(メタデータ) (2026-04-02T14:48:56Z) - Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails [0.0]
自然実験として、中国語・オリジン語モデルにおける政治的検閲について研究する。
5つの実験室の9つのオープンウェイトモデルに対して、プローブ、外科的改善、行動テストを使用します。
論文 参考訳(メタデータ) (2026-03-18T20:54:34Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Indiscriminate Disruption of Conditional Inference on Multivariate Gaussians [60.22542847840578]
敵対的機械学習の進歩にもかかわらず、敵対者の存在下でのガウスモデルに対する推論は特に過小評価されている。
我々は,意思決定者の条件推論とその後の行動の妨害を希望する自己関心のある攻撃者について,一組の明らかな変数を乱すことで検討する。
検出を避けるため、攻撃者は、破損した証拠の密度によって可否が決定される場合に、攻撃が可否を示すことを望んでいる。
論文 参考訳(メタデータ) (2024-11-21T17:46:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。