論文の概要: Anatomy of LLM Sycophancy: What a Flip Rate Hides
- arxiv url: http://arxiv.org/abs/2610.06522v1
- Date: Mon, 05 Oct 2026 15:32:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 07:48:48.589532
- Title: Anatomy of LLM Sycophancy: What a Flip Rate Hides
- Title(参考訳): LLMシクロファンシーの解剖:フリップレートが隠しているもの
- Abstract要約: 我々は,SycoLensを用いてユーザプレッシャと評価設定のフリップ率の測定方法を検証する。
各測定は、アイテムの1つのステートレスリプレイ、コミットされた回答、および1つのスクリプト化されたユーザラインを固定形式で保持する。
- 参考スコア(独自算出の注目度): 3.7193230342956056
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A model under pushback can correct itself, capitulate, or hold, and one flip rate counts a correction and a capitulation alike. Using SycoLens, a modular replay protocol, we test how user pressure and evaluation settings shape measured flip rates. Each measurement is one stateless replay of an item, a committed answer, and one scripted user line in a fixed form. Every effect is read against a matched control with the line deleted. Pushback wording, committed text, answer format, boundary distance, and ground truth become factors of one instrument; earlier instruments vary one to three of them. Across eleven frontier models from three providers and about 760,000 controlled replays, which models look sycophantic depends on how the user pushes back. Lines that assert the opposite verdict and lines that challenge the answer without asserting one rank the models almost unrelatedly. Flip effects grow several-fold near a model's boundary, yet items answered identically in every screening draw still carry about half of the most-affected totals. On arithmetic tasks where the truth is known, one model re-derives and corrects itself under pressure while another abandons correct answers without written work. On the model tested, a planted derivation lowers release of the answer it argues for, true or wrong, where a bare stated value does not; the wrong answer is corrected much more often than the true one is abandoned. Under a yes/no readout the rankings come closer, entangled with a pressure-induced shift toward "no". One score per model therefore compares different behaviours across models and benchmarks. We condense these dependencies into a reporting profile; the instrument, records, and analyses will be released upon publication.
- Abstract(参考訳): 押し戻しの下のモデルでは、自分自身を修正、監禁、保持でき、一方のフリップレートは補正と監禁も同様にカウントする。
モジュール型リプレイプロトコルであるSycoLensを用いて、ユーザプレッシャーと評価設定がどのように測定されたフリップレートを形作るかをテストする。
各測定は、アイテムの1つのステートレスリプレイ、コミットされた回答、および1つのスクリプト化されたユーザラインを固定形式で保持する。
すべてのエフェクトは一致した制御に対して読み取られ、行は削除される。
プッシュバックワード、コミットテキスト、応答形式、境界距離、接地真理は1つの楽器の要素となり、初期の楽器は1つから3つに異なる。
3つのプロバイダから11のフロンティアモデルと約76万のコントロールされたリプレイがあり、そのモデルがサイコファン的に見える。
反対の判断を主張する行と、その答に挑戦する行は、1つのランクを主張することなく、ほぼ無関係にモデルを主張する。
フリップ効果はモデルの境界付近で数倍に成長するが、全てのスクリーニングドローで同じ答えが得られたアイテムは、依然として最も影響の大きい総和の約半分を担っている。
真理が知られている算術的なタスクでは、あるモデルが自分自身を退行し、圧力の下で修正し、別のモデルが書かなくても正しい答えを放棄する。
テストされたモデルでは、植え付けられた導出は、それが主張する、真か誤かの答えの解放を低くする。
yes/noreadoutでは、ランクが近づき、圧力による"no"へのシフトに絡まっています。
したがって、モデル毎のスコアはモデルとベンチマーク間で異なる振る舞いを比較する。
これらの依存関係をレポートプロファイルに集約し、インスツルメンテーション、レコード、分析を公開時に公開します。
関連論文リスト
- Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation [55.54635884641362]
テストタイムトレーニングは、モデルが推論中に重みに情報を格納することを可能にする。
各更新では、次のトレーニング例を生成するモデルも変更される。
生成されたテキストの更新を保持する128Kのトーケンストリームは、独立した人文テキストの予測を悪化させる。
論文 参考訳(メタデータ) (2026-10-04T09:21:14Z) - Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding [65.85599131866623]
私たちはJevとContractNLIの9つの言語モデルを比較します。
制御された比較は、仮説の可視性、要求された出力、および出力順序によって異なる。
Jevは、評価された構成の中で、最低コストと中央値のレスポンス時間を持っています。
論文 参考訳(メタデータ) (2026-09-23T10:53:01Z) - Do LiDAR Language Models Really Understand Spatio-temporal Relationships? [62.56505727364142]
ベンチマークと診断プロトコルであるLiDAR-Halluを150 nusのシーンで紹介する。
提案プロトコルは,固定回答と候補コンテンツ制御,クロスシーンペアを同一のプロンプトで組み合わせるが,参照応答は逆で,リレーショナルなリコールを行う。
記録された10万の応答の分析は、集合的空間精度によって隠された失敗を明らかにする。
論文 参考訳(メタデータ) (2026-09-21T11:59:07Z) - What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model [0.0]
メソッドのクラスは、独自の出力を与えて言語モデルを探索する。
我々は、その問題を鋭くするために選ばれた工事において、そのような調査がどう対処するかを尋ねる。
答えは、見た目が似ている読書において、一度に2つの異なるものを測定することだ。
論文 参考訳(メタデータ) (2026-08-11T14:40:35Z) - Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation [51.56484100374058]
そこで我々は,Upworthy Research Archiveを用いて,シミュレート・トゥ・リアルな妥当性について検討する。
実際の聴衆の人口統計に基づく10人のパネルと、一般的な読者がクリックする確率をモデルに尋ねるゼロショットベースラインを比較した。
論文 参考訳(メタデータ) (2026-07-27T17:03:03Z) - Interaction Scaling: Grounding the Third Axis of Test-Time Compute [0.33451037881913753]
一つの変数がこの第3の軸を接地として支配し、ループの両側に保持しなければならないと論じる。
固定トークン予算でのハードコーディングタスクでは、推論のみとベストオブNの両方をサンプリングする。
提案手法は, ラン・ツー・ラン分散を伴わず, 100%パスレートに到達した。
論文 参考訳(メタデータ) (2026-07-13T14:22:06Z) - LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning [6.241883798820154]
モデル間コンセンサス(モデル間コンセンサス)について検討し、独立に訓練されたモデル(各モデルが一度解ける程度)が最終解に一致するかを検討した。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
3つのパネル統計値から平均絶対誤差0.03$までのコンセンサス精度を予測する。
論文 参考訳(メタデータ) (2026-07-11T05:57:54Z) - Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs [9.465306048183798]
本稿では,解答安定性を評価するための制御プロトコルを提案する。
モデルが複数の選択問題に正しく答えた後、不正確な選択肢に対する一貫性のある議論でモデルに挑戦する。
自己貢献は相変わらずフリップ率を上昇させる。
論文 参考訳(メタデータ) (2026-06-14T20:45:30Z) - VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning? [79.44137632338062]
マルチモーダルな大規模言語モデルが視覚的推論問題に正しく答える場合、その予測はタスククリティカルな視覚的証拠によって実際に支持されているか?
VisualFLIPは1,374枚の画像が基数,属性,空間,論理的タスクにまたがって同一の問合せペアとして配置されたベンチマークである。
ペアの両面を解く必要がある24個のMLLMと、少なくとも一方の面を解くモデルが両方の画像に対して同じ空でない答えを繰り返す頻度を測定するCR(Collapse Rate)を評価した。
論文 参考訳(メタデータ) (2026-06-05T22:06:07Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。