論文の概要: Token-Level Diagnosis of Sycophancy in LLMs with Attribution-Guided Steering
- arxiv url: http://arxiv.org/abs/2607.28906v1
- Date: Fri, 31 Jul 2026 00:05:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.554827
- Title: Token-Level Diagnosis of Sycophancy in LLMs with Attribution-Guided Steering
- Title(参考訳): 帰属誘導ステアリングによるLPMのトケンレベル診断
- Abstract要約: サイコファシー(Sycophancy)とは、大きな言語モデルが、事実の正しさを犠牲にして、ユーザの信念と一致する傾向があることを指す。
本稿では,オーソリティ・シェア・インデックス(ASI)を導入し,モデル決定がオーソリティ関連テキストによって駆動される程度を測定する。
梅毒の反応は、抵抗性よりも権威トークンに常に注意を向けていることがわかりました。
- 参考スコア(独自算出の注目度): 19.708436827458744
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sycophancy refers to the tendency for large language models (LLMs) to match user beliefs at the cost of factual correctness, thereby undermining model reliability. Prior work on evaluating sycophancy in LLMs aims to assess whether a model's output matches an authority's claim, but cannot reveal which part of the prompt drives this sycophantic behavior. To bridge this gap, we investigate the relationship of sycophantic responses with an authority's credentials, their assertive claim, and the problem statement. We introduce the Authority Share Index (ASI), an Integrated Gradients-based token attribution method, which measures the degree to which a model's decision is driven by authority-related text. Through extensive experiments across five models and 30 test configurations, we find that sycophantic responses consistently direct more attention toward authority tokens than resistant ones. Moreover, our token attribution method reveals that for the sycophantic cases, the claim asserted by the authority receives more attention than the authority's credentials. Building on these findings, we propose attribution-guided contrastive activation steering to mitigate LLM sycophancy. Our method constructs a steering vector from high-attribution tokens of sycophantic and resistant responses, selectively pushing models toward resistance. This enables inference-time steering without retraining, lowering sycophancy from 96% to 25% in the strongest case. Together, our results show that token-level attribution can both explain what drives sycophancy and directly inform a practical intervention.
- Abstract(参考訳): サイコファシー(Sycophancy)とは、大きな言語モデル(LLM)が、事実の正しさを犠牲にしてユーザの信念と一致し、モデルの信頼性を損なう傾向を指す。
LLMにおけるサイコファンシーを評価する以前の研究は、モデルの出力が当局の主張に合致するかどうかを評価することを目的としていたが、どのプロンプトがこのサイコファンシー行動を引き起こすかを明らかにすることはできない。
このギャップを埋めるために, サイコファンティック応答と権威者の資格, 主張的主張, 問題文との関係について検討する。
本稿では、モデル決定が権威関連テキストによって駆動される程度を測定する、統合グラディエンスに基づくトークン属性手法であるオーソリティ・シェア・インデックス(ASI)を紹介する。
5つのモデルと30のテスト構成にわたる広範な実験により、シコファン応答は抵抗性よりも権威トークンに常に注意を向けていることが判明した。
さらに, トークン属性法により, サイコファンティックなケースでは, 当局が主張するクレームが, 当局の資格よりも多くの注意を払っていることが判明した。
これらの知見に基づいて,LLM sycophancy の緩和を目的としたアトリビューション誘導型コントラストアクティベーションステアリングを提案する。
本手法は, サイコファン応答と抵抗応答の高属性トークンからステアリングベクトルを構築し, モデルを抵抗方向に選択的に推し進める。
これにより、再トレーニングをせずに推論時間のステアリングが可能となり、最強の場合には96%から25%に低下する。
以上の結果から, トークンレベルの属性は, 梅毒を誘発する要因を説明できるとともに, 実践的な介入を直接通知できることがわかった。
関連論文リスト
- THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts [0.300988853836121]
言語モデルがユーザの信念に合うように回答を変更する傾向にあるシコファシー(Sycophancy)は、一般的なアライメント障害である。
我々は、薬局がどこに住んでいるかを識別する、一致したプロンプトから構築された、共有されたコントラスト信号を導入する。
以上の結果から, サイコファンシーは同定可能な計算サブ回路内に存在し, 選択的に操舵できることが示された。
論文 参考訳(メタデータ) (2026-08-16T11:30:26Z) - Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Prompts [0.0]
大規模言語モデルにおける梅毒のバイアスに関する最初の体系的実証的研究について述べる。
LLMに基づくコードの臭い検出の信頼性に、梅毒のバイアスが重大な脅威となることを示す。
我々は,エビデンス優先の推論を強制する構造化促進戦略であるEvidence-Guided Debiasing Prompting (EGDP)を提案する。
論文 参考訳(メタデータ) (2026-07-11T17:35:25Z) - A Mechanistic View of Authority Hierarchy in LLM Sycophancy [0.09085204695117637]
権威によって引き起こされるサイコファンシーは、表面レベルの出力バイアスではなく、機械的な知識の消去であることを示す。
以上の結果から,権威誘発性梅毒は表面レベルの出力バイアスではなく,機械的知識の消去であることが明らかとなった。
論文 参考訳(メタデータ) (2026-07-01T04:16:59Z) - Compliance versus Sensibility: On the Reasoning Controllability in Large Language Models [46.26628756478016]
大規模言語モデル(LLM)は、事前学習データにおける共用推論パターンを通じて推論能力を取得することが知られている。
コンフリクト中に信頼性スコアが著しく低下するため、推論競合は内部で検出可能であることを示す。
その結果, LLM推論は具体例に固定されているものの, アクティブな機械的介入は論理的スキーマをデータから効果的に切り離すことができることがわかった。
論文 参考訳(メタデータ) (2026-04-29T22:55:40Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - Mechanistic Indicators of Steering Effectiveness in Large Language Models [3.635648354808971]
アクティベーションベースのステアリングにより、大規模言語モデルでは、トレーニングをせずに中間的アクティベーションに介入することで、ターゲットとなる振る舞いを表現できる。
広く使われているにもかかわらず、操舵が成功または失敗する際の機械的要因はいまだに理解されていない。
ステアリングの信頼性を内部モデル信号を用いて診断できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-02-02T06:56:22Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking [58.475471437150674]
ソフトプロンプト(SWAP)のための逐次透かしを提案する。
SWAPは、特定のディフェンダー指定のアウト・オブ・ディストリビューション・クラスを通じて、透かしを符号化する。
11のデータセットの実験では、SWAPの有効性、無害性、および潜在的適応攻撃に対する堅牢性を示す。
論文 参考訳(メタデータ) (2025-11-05T13:48:48Z) - On Reasoning Strength Planning in Large Reasoning Models [50.61816666920207]
我々は, LRM が, 世代前においても, アクティベーションにおける推論強度を事前に計画している証拠を見出した。
次に、LEMがモデルのアクティベーションに埋め込まれた方向ベクトルによって、この推論強度を符号化していることを明らかにする。
我々の研究は、LEMにおける推論の内部メカニズムに関する新たな洞察を提供し、それらの推論行動を制御するための実践的なツールを提供する。
論文 参考訳(メタデータ) (2025-06-10T02:55:13Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。
本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。
クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z) - Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework [18.54098084470481]
本稿では,視覚言語ベンチマーク間のサイコフィナンシーを分析し,推論時間緩和フレームワークを提案する。
我々のフレームワークは、中立なプロンプトの性能を維持しながら、評価されたすべてのモデルでサイコフィナンシーを効果的に軽減します。
論文 参考訳(メタデータ) (2024-08-21T01:03:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。