論文の概要: Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment
- arxiv url: http://arxiv.org/abs/2606.14037v1
- Date: Fri, 12 Jun 2026 02:23:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.715887
- Title: Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment
- Title(参考訳): 正しいか間違っているか: LLMの道徳的判断における方向的盲点
- Authors: Jihye Kim, Jeffrey Flanigan,
- Abstract要約: そこで本研究では,有益な出力変化を有害な汚泥と比較する双方向診断法であるCompliance Asymmetricを導入する。
この選択性は、事実的および道徳的判断において異なる。
チェーン・オブ・シント・プロンプトは有用かつ有害なコンプライアンスを同時に増幅する一方、アイデンティティベースのプロンプトは両者をほぼ同じマージンで抑制する。
- 参考スコア(独自算出の注目度): 13.021647720314016
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: As language models take integrated roles across many domains, the response of LLMs to user pushback becomes a critical alignment property. Yet many existing evaluations treat compliance as unidirectional, measuring whether models resist pressure but not whether they resist it selectively. We introduce Compliance Asymmetry (A = BCR/HCR), a bidirectional diagnostic that compares beneficial output change under helpful nudges with harmful change under misleading nudges. Across 9 models and 972,000 nudge-condition responses, we find that this selectivity differs in factual and moral judgments: models follow helpful nudges more than harmful ones on factual questions (A = 1.58), but follow both directions at nearly identical rates on moral questions (A = 1.04). This phenomenon persists across model families, capability levels, and nudging types. Interestingly, we also find that chain-of-thought prompting amplifies helpful and harmful compliance together, while identity-based prompting suppresses both by nearly identical margins. These results identify direction-blind moral compliance as a distinct failure mode in current LLMs and suggest that alignment should target directionally calibrated updating rather than lower compliance alone.
- Abstract(参考訳): 言語モデルが多くのドメインで統合された役割を担っているため、ユーザプッシュバックに対するLLMの応答は重要なアライメント特性となる。
しかし、既存の評価の多くは、コンプライアンスを一方向として扱い、モデルが圧力に抵抗するかどうかを測定するが、それらが選択的に抵抗するかどうかを測定する。
A = BCR/HCR (Compliance Asymmetric, A = BCR/HCR) は, 有益な出力変化と, 悪質なnudgeによる有害な変化を比較した双方向診断法である。
9つのモデルと972,000のnudge-condition応答において、この選択性は、事実的および道徳的判断において異なる: モデルは、事実的質問において有害な質問よりも有益なナッジに従う(A = 1.58)が、道徳的質問においてほぼ同じ割合で、両方の方向に従う(A = 1.04)。
この現象は、モデルファミリ、能力レベル、ヌーディングタイプにまたがって持続する。
興味深いことに、チェーン・オブ・シントは有用かつ有害なコンプライアンスを同時に増幅し、アイデンティティベースのプロンプトは両者をほぼ同じマージンで抑制する。
これらの結果は,現行のLCMにおいて,方向盲の道徳的コンプライアンスを個別の障害モードとして認識し,コンプライアンスのみを低くするのではなく,方向調整更新を目標とするべきであることを示唆している。
関連論文リスト
- Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Mechanistic Origin of Moral Indifference in Language Models [17.89411060814224]
既存のLLM(Large Language Models)の行動アライメント技術は、表面コンプライアンスと内部の非整合表現の相違を無視することが多い。
我々は、プロトタイプ理論と社会化学101データセットに基づいて構築された251kの道徳的ベクトルを用いて、LLMの潜在表現におけるこの無関心を検証、改善する。
次に、Qwen3-8B上でスパースオートエンコーダを使用し、単意味的道徳的特徴を分離し、そのトポロジ的関係を目的的に再構築し、基幹的道徳的ベクトルと整合させる。
論文 参考訳(メタデータ) (2026-03-16T17:59:17Z) - Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning [17.384089089363382]
既存の手法が見落としている根本原因を同定する。
現在のアプローチでは、グループ内のすべての誤ったロールアウトを同一に扱う。
非対称信頼度を考慮した誤り罰(ACE)を提案する。
論文 参考訳(メタデータ) (2026-02-24T22:46:43Z) - Moral Sycophancy in Vision Language Models [4.1673509006222655]
VLM(Vycophancy in Vision-Language Models)は、しばしば道徳的または事実的正確さを犠牲にして、ユーザの意見に合わせる傾向を示す。
明示的なユーザ不一致の下で,MoraliseおよびM3oralBenchデータセット上で広く使用されている10のモデルを分析する。
論文 参考訳(メタデータ) (2026-02-09T06:34:12Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models [17.130698952440316]
LLMにおける現実的および安全的障害は、その潜在活性化空間における表象的不整合から生じると論じる。
ドリフトした特徴を特定し,修正する統合フレームワークであるARRESTを提案する。
論文 参考訳(メタデータ) (2026-01-07T21:04:37Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs [58.02809208460186]
デモとしてDeepSeek-R1の高品質なトレースを使って、このパラドックスを再検討する。
デモが最適であっても、より多くの例を加えることで、常に精度が低下することがわかった。
デモを明示的で再利用可能な洞察に変換するシーケンシャルなテストタイム手順であるInsight-to-solve(I2S)を紹介します。
論文 参考訳(メタデータ) (2025-09-27T08:59:31Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Making Large Language Models Better Reasoners with Alignment [57.82176656663245]
推論(Reasoning)とは、証拠を使って結論に達する認知過程である。
近年の研究では、思考の連鎖(COT)推論プロセスによるデータ上の微調整LDMは、その推論能力を著しく向上させることができることが示されている。
テキストアライメントファインチューニング(AFT)パラダイムを3ステップで導入する。
論文 参考訳(メタデータ) (2023-09-05T11:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。