論文の概要: Dissociating the Internal Representations of Sycophancy in LLMs
- arxiv url: http://arxiv.org/abs/2607.07003v1
- Date: Wed, 08 Jul 2026 04:54:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.284247
- Title: Dissociating the Internal Representations of Sycophancy in LLMs
- Title(参考訳): LLMにおけるSycophancyの内部表現の解離
- Authors: Anthony Baez, Sheer Karny, Pat Pataranutaporn,
- Abstract要約: 大規模言語モデル(LLM)は、しばしば梅毒を示し、誤った場合でもユーザの声明に同意する。
我々は線形プローブを訓練し、あるサブタイプの活性化に関するステアリングベクトルを構築し、それらが表現を共有する程度を測定するために、他のサブタイプの移動を評価する。
我々は、異なるLLMがこれらのサブタイプを異なる形で表現し、より統一的またはより区別され、因果的に干渉する表現であることを示す。
- 参考スコア(独自算出の注目度): 9.383958408772694
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) frequently exhibit sycophancy, where they agree with a user's statement even when incorrect. While sycophancy is often treated as a single defined behavior, it can manifest in substantially distinct ways and circumstances, raising the question of whether this multi-faceted nature is reflected in its internal mechanisms. To address this gap, we dissociate the representations of sycophancy into factual and opinion subtypes -- motivated by the distinction between verifiable claims and subjective beliefs. We train linear probes and construct steering vectors on activations of one subtype and evaluate their transfer to the other subtype to measure to what extent they share representations. We find evidence that different LLMs represent these subtypes differently, with either more unified or more distinct and causally interfering representations. This method of dissociation offers a promising framework for studying the representational structure of complex model behaviors.
- Abstract(参考訳): 大規模言語モデル(LLM)は、しばしば梅毒を示し、誤った場合でもユーザの声明に同意する。
梅毒は、しばしば単一の定義された行動として扱われるが、実質的に異なる方法や状況で現れ、この多面体の性質が内部のメカニズムに反映されているかどうかという疑問を提起する。
このギャップに対処するため、我々は、検証可能なクレームと主観的信念の区別によって、サイコファンシーの表現を事実と意見のサブタイプに分解する。
我々は線形プローブを訓練し、あるサブタイプの活性化に関するステアリングベクトルを構築し、それらが表現を共有する程度を測定するために、他のサブタイプの移動を評価する。
我々は、異なるLLMがこれらのサブタイプを異なる形で表現し、より統一的またはより区別され、因果的に干渉する表現であることを示す。
この解離法は、複雑なモデル行動の表現構造を研究するための有望な枠組みを提供する。
関連論文リスト
- CV-DCLR: Causal-Visual Dynamic Label Refinement for Robust Zero-Shot Learning [25.21342780360303]
本稿ではCausal-Visual Dynamic Label Refinementフレームワークを提案する。
二重ストリーム相互補正機構を用いて視覚的意味的関連を補正する。
CUB、SUN、AWA2ベンチマークの実験では、CV-DCLRは高いあいまいさのシナリオで最先端の手法を大幅に上回っている。
論文 参考訳(メタデータ) (2026-07-01T12:45:35Z) - Disentangling Deception and Hallucination Failures in LLMs [7.906722750233381]
本稿では,行動表現から知識を分離する,内部的なメカニズム指向の視点を提案する。
幻覚と騙しは、2つの定性的に異なる障害モードに対応します。
我々はこれらの障害モードを、表現分離性、スパース解釈性、推論時アクティベーションステアリングを通じて解析する。
論文 参考訳(メタデータ) (2026-02-16T07:36:49Z) - Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models [77.98801218316505]
大型言語モデル(LLM)は、人間のような推論を示唆する創発的な行動を示す。
テキスト内概念推論におけるLLMの内部処理について検討する。
論文 参考訳(メタデータ) (2026-02-08T03:14:39Z) - Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs [1.9693252204587723]
我々は、真の合意とは対照的に、空想的合意と空想的賞賛を分解する。
結果は、サイコファンティックな行動は、独立して選択可能な表現と一致していることを示唆している。
論文 参考訳(メタデータ) (2025-09-25T15:19:39Z) - How do Transformers Learn Implicit Reasoning? [67.02072851088637]
制御されたシンボリック環境下でトランスフォーマーをスクラッチからトレーニングすることで、暗黙のマルチホップ推論がどのように現れるかを研究する。
原子三重項によるトレーニングは必要ではなく学習を加速し,第2ホップの一般化は特定の構成構造へのクエリレベル露出に依存する。
論文 参考訳(メタデータ) (2025-05-29T17:02:49Z) - The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology [4.280045926995889]
本研究では,大規模言語モデルの内部表現空間に対して,逆入力が体系的にどう影響するかに着目した。
アクティベーションの形状と神経情報の流れを定量化することにより、アーキテクチャに依存しない枠組みは、表現的変化の基本的な不変性を明らかにする。
論文 参考訳(メタデータ) (2025-05-26T18:31:49Z) - Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning [80.44084021062105]
本稿では,非方向エッジで連結された2つの潜在結合変数を特徴とする,多モーダルデータに対する新しい潜在部分因果モデルを提案する。
特定の統計的仮定の下では、多モーダル・コントラッシブ・ラーニングによって学習された表現が、自明な変換までの潜在結合変数に対応することを示す。
事前トレーニングされたCLIPモデルの実験は、非絡み合った表現を具現化し、数ショットの学習を可能にし、さまざまな現実世界のデータセットにわたるドメインの一般化を改善する。
論文 参考訳(メタデータ) (2024-02-09T07:18:06Z) - Beyond Instance Discrimination: Relation-aware Contrastive
Self-supervised Learning [75.46664770669949]
本稿では,関係認識型コントラスト型自己教師型学習(ReCo)をインスタンス関係に統合するために提案する。
当社のReCoは、常に顕著なパフォーマンス改善を実現しています。
論文 参考訳(メタデータ) (2022-11-02T03:25:28Z) - Structural Causal Models Are (Solvable by) Credal Networks [70.45873402967297]
因果推論は、干潟網の更新のための標準的なアルゴリズムによって得ることができる。
この貢献は, 干潟ネットワークによる構造因果モデルを表現するための体系的なアプローチと見なされるべきである。
実験により, 実規模問題における因果推論には, クレーダルネットワークの近似アルゴリズムがすぐに利用できることがわかった。
論文 参考訳(メタデータ) (2020-08-02T11:19:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。