論文の概要: Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance
- arxiv url: http://arxiv.org/abs/2608.23264v1
- Date: Mon, 24 Aug 2026 13:52:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.124489
- Title: Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance
- Title(参考訳): 要望に隠された:Token Relevanceによる非倫理的LLMコンプライアンスの説明
- Authors: Or Biton, Tomer Krichli, Itai Allouche, Joseph Keshet,
- Abstract要約: この研究は、大規模言語モデルが倫理的行動を示すことができない事例を体系的に調査する。
モデルの性能は、リクエスト・フォー・アシスタンス・ベースの形式で低下する。
我々は、この過度の貢献が有害なコンプライアンスに寄与していると仮定する。
- 参考スコア(独自算出の注目度): 8.039202293739185
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Although Large Language Models (LLMs) are aligned to optimize for both helpfulness and harmlessness, these dual objectives may conflict, inevitably leading to alignment failures. This work systematically investigates instances where LLMs fail to exhibit ethical behavior. To understand the underlying mechanics of these vulnerabilities, we introduce a probing methodology that presents unethical scenarios to LLMs in three distinct structural modalities: objective classification tasks, subjective first-person statements, and direct requests for assistance. We find that model performance degrades in the request-for-assistance-based form. Using Layer-wise Relevance Propagation (LRP), we trace this discrepancy to an attribution bias: the model places greater emphasis on benign task-framing tokens (e.g., "Can you help me...") than on tokens signaling the underlying unethical behavior (e.g., "without getting caught"), which we term cue-tokens. We hypothesize that this under-attribution contributes to harmful compliance. To test this, we introduce two LRP-guided decoding methods that steer generation toward trajectories more relevant to cue tokens. Empirical evaluations show that these interventions promote safer responses, supporting cue-token attribution's role in compliance failures.
- Abstract(参考訳): 大きな言語モデル(LLM)は、有用性と無害性の両方を最適化するために調整されているが、これらの2つの目的は相反し、必然的にアライメントの失敗につながる可能性がある。
この研究は、LLMが倫理的行動を示すことができない事例を体系的に調査する。
これらの脆弱性の基盤となるメカニズムを理解するために、客観的な分類タスク、主観的な一対一の言明、支援の直接的な要求という3つの異なる構造的モダリティにおいて、LLMに非倫理的なシナリオを提示する探索手法を導入する。
モデルの性能は、リクエスト・フォー・アシスタンス・ベースの形式で低下する。
LRP(Layer-wise Relevance Propagation)を用いることで、この相違点を属性バイアス(Attribution bias)にトレースする。このモデルは、基本的な非倫理的行動(例えば、"捕まらない"など)を示すトークンよりも、良質なタスクフレーミングトークン(例えば、"Can you help me...")に重点を置いています。
我々は、この過度の貢献が有害なコンプライアンスに寄与していると仮定する。
これをテストするために、2つのLPP誘導復号法を導入し、cueトークンとより関係のあるトラジェクトリを操る。
経験的評価は、これらの介入がより安全な応答を促進することを示し、コンプライアンス障害におけるcue-token属性の役割を支持していることを示している。
関連論文リスト
- The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs [36.56059375552239]
大規模言語モデル (LLM) は, 文脈によって明示的にサポートされた場合でも, 保証された結論を拒絶する可能性があることを示す。
我々は、この障害モードを、アライメントによって引き起こされる変更によって、LCMが明確な証拠をオーバーライドする、誤ったアライメントと呼ぶ。
この現象を定量化するために,2,032 BBQ 由来のコントラスト付きペアからなるベンチマーク VETO を導入し,0 から100 のスケールでモデルがステレオタイプ関連の問題で失敗する頻度を計測する新しい指標 Misfired Alignment Rate (MAR) を定義する。
論文 参考訳(メタデータ) (2026-06-17T03:53:42Z) - Compliance versus Sensibility: On the Reasoning Controllability in Large Language Models [46.26628756478016]
大規模言語モデル(LLM)は、事前学習データにおける共用推論パターンを通じて推論能力を取得することが知られている。
コンフリクト中に信頼性スコアが著しく低下するため、推論競合は内部で検出可能であることを示す。
その結果, LLM推論は具体例に固定されているものの, アクティブな機械的介入は論理的スキーマをデータから効果的に切り離すことができることがわかった。
論文 参考訳(メタデータ) (2026-04-29T22:55:40Z) - METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models [61.33372454250959]
コンテキスト因果推論は、大規模言語モデルにとって重要なが難しい能力である。
既存のベンチマークでは、コンテキスト整合性を保証するか、完全な因果階層をカバーすることができない。
私たちはMETERの先駆者であり、因果はしごの3つのレベルすべてにわたってLSMを体系的にベンチマークしました。
論文 参考訳(メタデータ) (2026-04-13T14:07:11Z) - On the Paradoxical Interference between Instruction-Following and Task Solving [50.75960598434753]
次の命令は、大規模言語モデル(LLM)を、タスクの実行方法に関する明示的な制約を指定することで、人間の意図と整合させることを目的としている。
我々は,LLMのタスク解決能力にパラドックス的に干渉する命令に従うという,直感に反する現象を明らかにした。
本稿では,タスク解決に追従する命令の干渉を定量化する指標として,SUSTAINSCOREを提案する。
論文 参考訳(メタデータ) (2026-01-29T17:48:56Z) - Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts [79.1081247754018]
大規模言語モデル(LLM)は、推論、計画、意思決定のタスクに広くデプロイされている。
そこで我々は, 接触探索質問(CSQ)に基づく枠組みを提案し, 騙しの可能性を定量化する。
論文 参考訳(メタデータ) (2025-08-08T14:46:35Z) - Causal Prompting for Implicit Sentiment Analysis with Large Language Models [21.39152516811571]
Implicit Sentiment Analysis (ISA) は、明示的に述べられるのではなく、示唆される感情を推測することを目的としている。
近年,Large Language Models (LLMs) を用いたプロンプトベースの手法がISAで実現されている。
我々は,CoT推論に正面調整を組み込んだ因果的プロンプトフレームワークであるCAPITALを提案する。
論文 参考訳(メタデータ) (2025-07-01T03:01:09Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。
本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。
クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。