論文の概要: Gotta Catch them all: the modes of Sycophancy
- arxiv url: http://arxiv.org/abs/2607.20146v1
- Date: Wed, 22 Jul 2026 13:49:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.096117
- Title: Gotta Catch them all: the modes of Sycophancy
- Title(参考訳): Gotta Catch them all: the modes of Sycophancy
- Authors: Shreyans Jain, Alexandra Yost, Amirali Abdullah,
- Abstract要約: 我々は,948件の社会的プレッシャー状況において,3つの仮説的サイコファンシーモードを解析した。
以上の結果から, サイコフィナンシーはモノリシックな傾向ではなく, 表現的および計算学的に異なるモードの構造化されたファミリーであることが示唆された。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models often align with users' beliefs at the expense of factual accuracy, a behavior known as sycophancy. Prior mechanistic studies largely treat sycophancy as a single behavioral dimension that can be uniformly amplified or suppressed. We challenge this assumption by analyzing three hypothesized modes of sycophancy across 948 social pressure situations. Although the modes produce highly similar outputs, with a text-only classifier achieving just 57.8 percent accuracy, their internal representations are perfectly linearly separable from layer 14 onward. We further find the modes emerge at different processing stages, rely on distinct attention circuitry, and fire strongest on different inputs. These results show that sycophancy is not a monolithic tendency, but a structured family of representationally and computationally distinct modes, motivating more precise measurement and intervention.
- Abstract(参考訳): 大規模な言語モデルはしばしば、現実の正確さを犠牲にしてユーザの信念と一致している。
以前の機械学的な研究は、サイコフィナンシーを一様増幅または抑制できる単一の行動次元として扱うことが多かった。
この仮定は,948件の社会的プレッシャー状況において,3つの仮説型サイコファンシーを解析することによって解決される。
モードは非常によく似た出力を生成するが、テキストのみの分類器は57.8%の精度しか達成していないが、内部表現は14層から完全に線形に分離可能である。
さらに、異なる処理段階でモードが出現し、異なる注意回路に依存し、異なる入力に対して最強の発射を行う。
これらの結果は, サイコフィナンシーはモノリシックな傾向ではなく, 表現的および計算学的に異なるモードの構造化されたファミリーであり, より正確な測定と介入を動機付けていることを示している。
関連論文リスト
- Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs [1.9693252204587723]
我々は、真の合意とは対照的に、空想的合意と空想的賞賛を分解する。
結果は、サイコファンティックな行動は、独立して選択可能な表現と一致していることを示唆している。
論文 参考訳(メタデータ) (2025-09-25T15:19:39Z) - Unified Scaling Laws for Compressed Representations [69.72517034565467]
各種圧縮表現上でのトレーニングにおいて,統合スケーリングフレームワークがモデル性能を正確に予測できるかどうかを検討する。
我々の主な発見は、単純な「容量」計量が存在するという理論と経験の両方を実証することである。
我々は、圧縮されたフォーマットの精度を直接比較し、スパース量子化されたフォーマットのトレーニングのためのより良いアルゴリズムを導出するために、定式化を拡張した。
論文 参考訳(メタデータ) (2025-06-02T16:52:51Z) - Measuring Sycophancy of Language Models in Multi-turn Dialogues [33.875038658886986]
SYCON Benchは、マルチターン・自由形式の会話環境におけるサイコフィナンシーを評価するための新しいベンチマークである。
SYCON Benchを3つの現実シナリオにわたる17の大規模言語モデルに適用すると、梅毒は相変わらず障害モードであることがわかる。
論文 参考訳(メタデータ) (2025-05-28T14:05:46Z) - Deep Learning is Not So Mysterious or Different [54.5330466151362]
我々は、異常な一般化行動はニューラルネットワークとは異なるものではないと主張している。
我々はこれらの現象を説明する上で重要な統一原理として、軟性誘導バイアスを提示する。
また、ディープラーニングが、表現学習の能力など、他の方法と相対的に異なる点を強調します。
論文 参考訳(メタデータ) (2025-03-03T22:56:04Z) - Bias in Pruned Vision Models: In-Depth Analysis and Countermeasures [93.17009514112702]
ニューラルネットワークのパラメータのかなりの部分集合をゼロに設定するプルーニングは、モデル圧縮の最も一般的な方法の1つである。
この現象の既存の証拠にもかかわらず、ニューラルネットワークのプルーニングと誘導バイアスの関係はよく理解されていない。
論文 参考訳(メタデータ) (2023-04-25T07:42:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。