論文の概要: Tag Questions and the Generational Reversal of Sycophancy Across 45 Language Models
- arxiv url: http://arxiv.org/abs/2607.23976v1
- Date: Mon, 27 Jul 2026 04:02:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.30193
- Title: Tag Questions and the Generational Reversal of Sycophancy Across 45 Language Models
- Title(参考訳): タグ質問と45言語モデルにおける語彙の世代逆転
- Abstract要約: 2ワードの確認タグを決定問題に適用すると、言語モデルがその選択を支持しているかどうかが変わる。
我々はこのタグ効果を20個の凍結した地道な決定に対して測定する。
45以上のモデルでは、効果は+32%から-32%で、1ワードで64ポイントスイングする。
- 参考スコア(独自算出の注目度): 3.7734715043126488
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Appending a two-word confirmation tag to a decision question -- "Is X the better choice?" versus "X is the better choice, right?" -- changes whether a language model endorses the choice. We measure this tag effect on 20 frozen, ground-truth-free decisions between two defensible options, counterbalanced so a model's own preferences cancel, scored by exact match on clamped yes/no replies -- no LLM judge, no embeddings. Across 45 models the effect spans +32% to -32% -- a 64-point swing on one word -- with 5 models significantly sycophantic and 17 significantly resistant (BH-FDR q=.10). The sign is a clock: within model families the effect crosses from positive to negative as generations advance (GPT +4 to -28; Claude +7 to -32; Qwen and Grok likewise), roughly -6 points per year, a reversal robust to vendor tier; one lineage (DeepSeek) never crosses, and two releases during the study window (Claude Opus 5, Gemini 3.6 Flash) land on the trend out-of-sample. A full-panel ablation localizes the resistance as a double dissociation: a synonym tag reproduces each model's response almost exactly (r=0.89), while planting the same preference without a tag produces resistance in no resistant model (stance effects +6 to +49; r=0.23 with tag effects). The resistance is keyed to the surface construction of a tacked-on agreement bid, not the user's stance -- a pattern-match, not a principle. And the tag's polarity matters more than its presence: swap one word -- "X is the better choice, maybe?" -- and agreement rises above the neutral baseline in 45 of 45 models (+19.6 points), with ten models affirming both mutually exclusive options at 90-100%. Agreement tracks how sure the user sounds, in opposite directions at the two poles. The instrument is one word, one dollar, and judge-free; run per release, it reads the field's anti-sycophancy training directly off model behavior.
- Abstract(参考訳): 2ワードの確認タグを意思決定の質問に当てはめれば -- "Xはよい選択か?" に対して "Xはよい選択か? - 言語モデルがその選択を支持しているかどうかが変わります。
我々は、このタグ効果を、2つの防御可能な選択肢の間の20個の凍結された、地道な決定に対して測定する。
45以上のモデルでは、効果は+32%から-32%で、1ワードに64点スイングがあり、5つのモデルではシコファン性があり、17のモデルでは耐性がある(BH-FDR q=.10)。
GPT +4から -28、Claude +7から -32、QwenとGrokも同様に)、年6点、ベンダー層への逆ロバスト、一系統(DeepSeek)は決して交差せず、研究ウィンドウ(Claude Opus 5, Gemini 3.6 Flash)で2つのリリースがアウトオブサンプルに到達した。
シノニムタグは各モデルの反応をほぼ正確に再現し(r=0.89)、タグなしで同じ嗜好を植えると抵抗性のないモデルで抵抗が生じる(スタンス効果+6から+49、r=0.23、タグ効果)。
抵抗は、ユーザのスタンスではなく、原則ではなくパターンマッチであるタックオン合意の入札を表面的に構築する上で鍵となる。
そして、45モデル(+19.6ポイント)のうち45モデル(+19.6ポイント)の中立ベースライン以上で合意が成立し、10モデルで相互排他的オプションが90-100%であることが確認される。
合意は、ユーザーが2つのポールで反対方向にどのように聞こえるかを追跡する。
この楽器は1ワード、1ドル、そして裁判官なしで、リリース毎に実行され、フィールドの反薬効訓練をモデル行動から直接読み取る。
関連論文リスト
- Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift [7.837842601637295]
トーンはランキング結果よりもキャリブレーションに基づく合意に影響します。
音調が変わる場合、結果は裁判官の厳格な操作点の変化とより一致している。
論文 参考訳(メタデータ) (2026-09-09T04:40:14Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - GradeTrap: Authority Cues in Images Shift VLM Judgments Despite Explicit Instructions to Ignore Them [0.0]
そこで我々は,2つの社会的手がかりを直接衝突させる制御された評価手法であるGradeTrapを紹介した。
学生の回答はサイコファンティックな合意を惹きつけるべきであり、友人、教師、または公式の回答キーに起因する矛盾した回答は権威に基づく推論を引き付けるべきである。
我々は60の合成現実世界のトレードオフシナリオでモデルをテストする。
論文 参考訳(メタデータ) (2026-09-05T12:30:39Z) - Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close [57.963463622270275]
イスラム金融における規範的多元主義を4つの分類法を用いて研究する。
文化的キューは1つのフレームワークに向かってモデルを操縦するが、そのモデルはそのフレームワーク内で間違った答えを選択する。
論文 参考訳(メタデータ) (2026-09-01T09:46:53Z) - TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models [40.42873860258522]
優先順序等調スコア編集(POISE)を備えたマルチパラダイム報酬モデリングフレームワークであるTrustRoboRewardを提案する。
POISEはポイントワイズスコアを修正し、TrustJudgeが未解決のクロスパラダイム逆転競合を取り除く。
POISEでトレーニングされたQwen3-VL-4Bは、全体的な報酬スコアが77.96%に達し、GPT-5-mini(78.09%、ギャップ0.13%)とほぼ一致し、最強のRoboReward-4Bベースラインを10.13%上回った。
論文 参考訳(メタデータ) (2026-08-09T05:25:22Z) - When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models [45.91367912142692]
異なるモデルがいまだに同じ狭い部分集合を選択している可能性を示し、単一の引用が誤りを犯さずに、引用モノカルチャーを生成する。
3つのベンダーの11のモデルが、30のランダムなパネルから少なくとも10の論文を選択しており、実際のタイトルと抽象物があるが、作者が作り直され、再割り当て年、隠れた会場と引用数がある。
論文 参考訳(メタデータ) (2026-08-03T14:27:46Z) - Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier [0.05055376568994175]
間違った多数派はモデルの正しいMMLU回答の22.8%を逆転させ、GPQAは54.8%、SimpleQAは71.0%である。
モデルが最初に間違って答えた後、正しいピア回答を採用するレートであるReceptivityと組み合わせます。
最も強力な公表方法であるリフレクションは、MMLU抵抗の7.9ポイントを獲得し、レセプティビティの15.3を付与する。
論文 参考訳(メタデータ) (2026-08-03T11:12:38Z) - OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment [0.9821874476902969]
逆ペアによる方向バイアスを検出するOptimismBenchを導入する。
ポストトレーニングではバイアスの兆候が示され、異なる家族の反対のシフトが示される。
モデル毎の指向性監査のために,10言語で3,870項目をリリースしています。
論文 参考訳(メタデータ) (2026-07-29T14:38:55Z) - Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes [1.1844977816228046]
学習した文脈的圧力が正しい判断をオーバーライドし、モデルの論理的安定性の限界を明らかにする方法を特徴付ける。
Qwen3.6-35B-A3B MoE、Qwen3-8B、Gemmaにまたがって、接頭辞は多くの正しい答えをリダイレクトし、目に見えない形やインターフェースの変更に対して有効である。
論文 参考訳(メタデータ) (2026-07-20T17:58:05Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - The One-Word Census: Answer-Choice Conformity Across 44 Language Models [3.7734715043126488]
我々は31個のシングルターンプロンプトの収束を特徴付け、それぞれに有効な1ワードの回答が多数あるカテゴリを命名する。
平均$-log2$の確率は、他のすべてのモデルのプールされた答えの下で得られる。
ペルソナとコミュニティがデザインしたモデルは最も異なっており、最新のメインラインフラッグシップは最もコンフォーマリストである。
論文 参考訳(メタデータ) (2026-07-14T14:12:05Z) - The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment [3.7193230342956056]
増大する文献では、論理的に無関係な文言変化の下でそのような判断がシフトしていると報告されている。
イエス/ノーの質問では、「ノー」という言葉は一度に論理的な評定、語彙トークン、最後の印刷オプションである。
我々はこれらを分離するサイコメトリック・バッテリを導入する: 質問フォームのコーパスを横断する対称性。
論文 参考訳(メタデータ) (2026-07-06T18:37:43Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models [45.71412371299232]
トレーニング不要なルーティングフレームワークであるDARTを紹介します。
DARTは、ドラフトが同意すると直接回答を受け入れ、意見が一致しない場合には、ドラフトのエントロピーから思考予算を予測する。
数学の推論では、オリンピアードレベルの問題に対して最大9.0ポイントの精度が向上し、トークンは15-69%減少する。
実行ベースの等価性の下でのコード推論では、トークンが51-63%減少する一方で、精度が+22.5ポイント向上する。
論文 参考訳(メタデータ) (2026-06-22T11:24:59Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure [8.86745721473138]
推論モデルはシングルターンベンチマークで評価されるが、マルチターンダイアログにデプロイされる。
われわれはこの不信な降伏(UC)を2ドル(約2万2000円)のラテント・ヴァース・ビヘイビア・フレームワークで分離し、指標のフリップレートとシングルターンプローブの両方を見逃す。
論文 参考訳(メタデータ) (2026-05-27T20:41:08Z) - Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models [0.0]
拡張思考モデルは、ユーザ可視の回答と並んで、第2のテキスト生成チャネル(トークンを考える)を公開する。
本研究では,MMLUおよびGPQA質問に対する12のオープンウェイト推論モデルについて,誤解を招くヒントと組み合わせて検討した。
論文 参考訳(メタデータ) (2026-03-27T13:39:05Z) - Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning [48.14470449860784]
テスト時強化学習(TTRL)は、推論時に合成信号のみを使用してモデルを適応するためのラベルなしパラダイムを提供する。
簡単な直感に基づくフレームワークであるSelf-Harmonyを紹介します。
論文 参考訳(メタデータ) (2025-11-03T03:34:34Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment [121.45689748315125]
Reinforcement Learning from Contrastive Distillation (RLCD) は、人間のフィードバックを使わずに言語モデルを調整する方法である。
RLCDは2つの対照的なモデル出力から選好ペアを生成し、1つは、与えられた原則に従うように設計された正のプロンプトを使用し、もう1つは、それらに違反するように設計された負のプロンプトを使用する。
次に、選好ペアを用いて選好モデルを訓練し、強化学習によりベース非整合言語モデルを改善する。
論文 参考訳(メタデータ) (2023-07-24T17:23:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。