論文の概要: Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm
- arxiv url: http://arxiv.org/abs/2608.16177v2
- Date: Tue, 18 Aug 2026 03:54:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.981938
- Title: Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm
- Title(参考訳): ミルグラムパラダイムを用いた大規模言語モデルにおけるオーソリティへの従順性の測定
- Authors: Hidayet Aksu,
- Abstract要約: 大規模言語モデル(LLM)は、機器を操作し、指示を実行し、制度上の階層の中で機能するエージェントとして、ますます多くデプロイされている。
我々は、Milgramの服従パラダイムを、標準化され、完全にスクリプト化され、レプリカブルなプローブとしてLLMに移植する。
本研究では,19家族の42モデルに対して,6条件のバッテリ上での服従プロファイル,経験的ブレイクオフ分布を測定した。
- 参考スコア(独自算出の注目度): 0.5414847001704247
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) are increasingly deployed as agents that operate equipment, execute instructions, and act inside institutional hierarchies, raising a question social psychology answered for humans six decades ago: how far will an agent escalate a harmful action when a legitimate authority insists? We port Milgram's obedience paradigm to LLMs as a standardized, fully scripted, replicable probe: the model plays the Teacher, a deterministic harness plays Experimenter and Learner from paraphrased versions of Milgram's scripts (30 shock levels, 15-450 V; graded protests; the four standardized prods), and the outcome of a session is the breakoff voltage. We measure obedience profiles, empirical breakoff distributions over a battery of six conditions, for 42 models from 19 families (4848 sessions, 102511 logged decision turns). We find that (i) obedience is extremely heterogeneous, with baseline full-obedience rates spanning 0%-100% (census mean 42.9%; human anchor 65%). (ii) Profiles are model-specific and stable: split-half verification separates same-model from cross-model comparisons at AUC = 0.885. (iii) Situational sensitivity is selective: scripted peer defiance shifts obedience in the human direction, learner proximity trends the same way without reaching significance, and removing the authority's physical presence, one of the strongest human levers, trends in the opposite direction, also without reaching significance. (iv) Declaring the scenario fictional raises obedience, whereas moving the decision from a typed action line to a native tool call, or granting a modest thinking budget, lowers it sharply. (v) Unlike single-token fingerprints, obedience profiles do not recover model lineage: obedience identifies the checkpoint but not its ancestry, consistent with safety post-training overwriting lineage priors.
- Abstract(参考訳): 大型言語モデル(LLM)は、機器を操作し、指示を実行し、制度上の階層の中で行動するエージェントとして、60年前に人間に答えた社会心理学を提起している。
モデルがTeacherを、決定論的ハーネスがMilgramのスクリプト(30のショックレベル、15-450 V、グレードされた抗議、4つの標準化された宣伝)のパラフレーズからExperimenterとLearnerを再生し、セッションの結果がブレークオフ電圧である。
我々は,19家族(4848セッション,102511ログによる意思決定ターン)の42モデルに対して,服従プロファイル,6条件のバッテリー上の経験的ブレークオフ分布を測定した。
私たちはそれを見つける。
(i)服従は非常に異質であり、ベースラインの完全服従率は0%-100%である(センサス平均42.9%、ヒトアンカー65%)。
(ii) プロファイルはモデル固有かつ安定である: split-half 検証は AUC = 0.885 のクロスモデル比較と同一モデルを分離する。
3) 状況感は選択的であり、スクリプト付きピア・ディファイアンスは、人間の方向の順応をシフトさせ、学習者の近接傾向は、重要度を達成せず、また、権威の身体的存在、最強の人間レバーの1つ、反対方向の傾向も重要度に到達せずに除去する。
(四)架空のシナリオの宣言は従順性を高め、一方、型付けされたアクションラインからネイティブのツールコールに決定を移動させ、または控えめな思考予算を付与し、それを激減させる。
(v)単一トークンの指紋とは異なり、従順プロファイルはモデル系統を復元しない:従順プロファイルはチェックポイントを識別するが、その祖先を識別しない。
関連論文リスト
- Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling [0.0]
合成親和性ツールは、独立大規模言語モデル(LLM)エージェントとして各個人を動作させる。
このパラダイムには基本的な障害モードがあることを示し、分散優先の修正をそれに対して設定する。
論文 参考訳(メタデータ) (2026-07-17T15:45:57Z) - Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI [2.2616066835313253]
7つのカテゴリと3つの難易度で86のPicoCTF課題を実行し、3つのツールアクセスレジームと3つのモデル/クライアント構成で実行します。
既存のツール,エージェント・ビヘイビアの変更,11の新たな機能ツールに修正を適用し,これまで未経験だったトライアルを再実行します。
全体の解決率は55.4%から72.0%に上昇し、全ての構成が大幅に改善される。
論文 参考訳(メタデータ) (2026-07-03T02:20:04Z) - Evaluation Awareness Is Not One Capability: Evidence from Open Language Models [1.758143872501506]
安全ベンチマークは、テスト条件の振る舞いがデプロイメントの振る舞いを予測すると仮定する。
これにより、ベンチマークパフォーマンスとデプロイメントの動作のギャップが開ける。
我々は、37のオープンウェイトモデルと7つのファミリーにわたる8つの実験を通して、この評価意識を特徴づける。
論文 参考訳(メタデータ) (2026-06-22T16:48:43Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts [0.0]
厳格な拒絶率は、同じプロンプトで0.1%から94.6%である。
18のフロンティアモデルのうち9つは、バイナリーリフェールメトリクスが検出できないデュアルユース層で、ヘッジ・ブット・ヘルプ部分コンプライアンスパターンを示す。
論文 参考訳(メタデータ) (2026-05-20T09:53:31Z) - When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors [66.18091962164219]
既存のメトリクスは、タスクの成功に必要な義務的な振る舞いと、モデルの自律的な嗜好を反映した命令的でないパターンを区別することができない。
言語アライメントのための textbfResponse Pattern similarity (RPS) と、有向グラフとしてモデル化されたツール使用習慣のための textbfAction Graph similarity (AGS) である。
論文 参考訳(メタデータ) (2026-04-23T03:48:56Z) - The Fragility Of Moral Judgment In Large Language Models [0.0]
大規模言語モデル(LLM)の安定性と操作性をテストするための摂動フレームワークを提案する。
コンテンツ摂動の3つのファミリーを生成する: 表面編集(語彙/構造ノイズ)、視点シフト(声と姿勢の中立化)、説得手がかりである。
表面の摂動は低いフリップ率(7.5%)をもたらし、主に自己整合性ノイズフロア内にある。
不安定性は道徳的に曖昧なケースに集中する。
論文 参考訳(メタデータ) (2026-03-05T20:01:43Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。