論文の概要: Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks
- arxiv url: http://arxiv.org/abs/2607.05545v1
- Date: Mon, 06 Jul 2026 18:27:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.301155
- Title: Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks
- Title(参考訳): LLMのコンフォーマル性は話者を必要としない: ピアプレッシャベンチマークにおける話者レスフロアの測定
- Abstract要約: 整合性はしばしば、モデルがピアまたはグループ応答に対して正しい答えを変更する場合を記述するために使用される。
この明らかな整合性の大部分は、ピアが削除された後も生き残ることを示す。
我々は、明示的な話者を排除した同じ主張された答えを、オープンソース条件で導入する。
- 参考スコア(独自算出の注目度): 1.6734502292933282
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM conformity is often used to describe cases where a model changes a correct answer toward a peer or group response. We show that most of this apparent conformity survives even after the peer is removed. The reason is a confound: standard conformity prompts mix two cues at once, the presence of a speaker and the repeated wrong answer itself. Existing benchmarks vary these cues together, so they cannot tell how much of the revision actually depends on the speaker. We introduce a no-source condition: the same asserted answer with the explicit speaker removed. Across six open-weight LLMs and seven QA and reasoning datasets, this condition alone causes harmful revision in $66.5\%$ of initially correct cases, compared with $10.3\%$ under a plain re-ask. The effect also remains when the repeated answer is paraphrased and when answer options are hidden in an open-ended setting. Source framing mainly modulates this floor: expert-panel framing raises it, while minimal person labels do not reliably raise it. When models flip, they are usually confidently wrong, and simple recalibration does not recover the original answer. Source attribution still matters, but it should be measured as an increment above this speaker-free floor. The methodological lesson is that conformity benchmarks should first measure what remains after the speaker is removed; without this step, benchmarks may mistake repeated text for social influence.
- Abstract(参考訳): LLMの適合性はしばしば、モデルがピアやグループ応答に対して正しい答えを変更する場合を記述するために用いられる。
この明らかな整合性の大部分は、ピアが削除された後も生き残ることを示す。
標準整合性は2つのキューを同時に混合し、話者の存在と繰り返しの間違った答え自体を同時に生成する。
既存のベンチマークはいずれも異なるので、どの程度のリビジョンがスピーカーに依存しているかはわからない。
我々は、明示的な話者を排除した同じ主張された答えを、オープンソース条件で導入する。
6つのオープンウェイトLDMと7つのQAと推論データセットの合計で、この条件だけで、初期修正ケースの6.5.%$に対して有害なリビジョンを引き起こす。
この効果は、繰り返し答えが言い換えられ、答えオプションがオープンな設定で隠されるときにも残る。
ソースフレーミングは、主にこのフロアを調節する:エキスパートパネルフレーミングはそれを上昇させるが、最小限の人物ラベルは確実に上昇しない。
モデルが反転するときは通常、それらは自信を持って間違っている。
情報源の属性はまだ重要ですが、このスピーカーレスフロアの上のインクリメントとして測定されるべきです。
方法論的な教訓は、適合性ベンチマークは、まず話者が取り除かれた後の残余を計測すべきであり、このステップがなければ、ベンチマークは社会的影響のために繰り返しテキストを誤る可能性があるということである。
関連論文リスト
- FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect [69.8983512616053]
大規模な言語モデルは、しばしばユーザによる暗黙のスタンスと一致する微妙な言い換えに応答を変更する。
これによってユーザーは、根拠となる事実ではなく、どのようにして質問を言い表したかというアドバイスをユーザーに残すことができる。
FramingQAは、法律、医学、ファイナンス、ロボットシミュレーションにまたがるフレーミングに疑問を呈するモデル感度を測定するベンチマークである。
論文 参考訳(メタデータ) (2026-09-07T12:56:44Z) - Conformity Breaks Conformal Prediction [1.3583317564926913]
同型証明は、LLMが単独で回答し、同じLLMが全会一致で間違った答えを主張するピアを見ている場合、無効である場合に有効である。
マルチエージェントLLMシステムにおいて,このシフトが共形予測を静かに破ることを示す。
論文 参考訳(メタデータ) (2026-09-03T20:05:47Z) - Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation [52.58737865652009]
NLPにおけるMultiple-choice Question answering (MCQA)ベンチマークは、数右スコアリング(精度)を用いる。
教育試験において、スコアリング方式は、応答モードモデルが従うこと、および応答のグレーディングルールの組み合わせであり、どの能力に報酬を与えるかを規定する重要な設計選択である。
我々は、MCQAが6つの教育にインスパイアされた6つのスキームで、正確性を超えた能力を評価することで、数字右の代替手段がどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-08-30T16:35:22Z) - One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies [49.067670811577045]
本稿では,孤立した質問品質ではなく,政策行動として明確化を評価するベンチマークであるRegretBenchを紹介する。
RegretBenchは、意図的な解決、相互作用コスト、非効率な明確化、後悔を計測する。
以上の結果から,有効な明確化には有望な質問以上のものが必要であることが示唆された。
論文 参考訳(メタデータ) (2026-07-23T10:22:11Z) - What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks [25.519850997497283]
短解VQAベンチマークは2つの異なる量を説明する。
我々は、人間公認のセマンティック・ジャッジを使用して37k以上の公式エラーを監査する。
論文 参考訳(メタデータ) (2026-07-11T10:01:29Z) - LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation [79.03892269184145]
LivingArenaは自動汚染耐性評価フレームワークである。
モデルは質問を交互に提案し、相手が正しく答えられないアイテムを提示する。
質問者は、相手の知識境界を積極的に特定し、活用することが奨励される。
論文 参考訳(メタデータ) (2026-06-19T06:20:58Z) - The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer [14.274182889933272]
大規模な言語モデルはメモリ使用量と推論コストを削減しますが、標準ベンチマークが見逃す障害も発生します。
正しい答えが消去されるのか、それとも、上位の出力として答えが生成しにくくなるのか?
ベンチマークの錯覚を見いだす。高いスパーシティプルーニング(特にワンダ)の下では、モデルは、複数のスコアで正しい答えを選択しながら、欲張りのオープンジェネレーションで失敗することが多い。
論文 参考訳(メタデータ) (2026-06-16T07:14:52Z) - Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity [1.4889674786265437]
ピア合意は、当初間違ったモデルを修正するよりも、最初に正しいモデルを誤解させるのがずっと簡単であることを示す。
これらの結果から,マルチエージェントLLMシステムは単に集約するのではなく,ピア回答を検証すべきであることが示唆された。
論文 参考訳(メタデータ) (2026-06-01T03:42:00Z) - ABCD: All Biases Come Disguised [4.603755953026689]
MCQ(Multiple-choice Question)ベンチマークは標準的な評価手法である。
本稿では,各質問のラベルを一様無順序ラベルに置き換える,単純なバイアス低減評価プロトコルを提案する。
このプロトコルは、平均モデルの性能を最小限に抑えつつ、平均精度のばらつきを3倍に減らし、置換に答えるロバスト性を大幅に改善することを示す。
論文 参考訳(メタデータ) (2026-02-19T15:12:33Z) - AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering [58.04745279785462]
Aqua-Benchは、Audio Question Unanswerability Assessmentのベンチマークである。
提案手法は,Absent Answer Detection,Incompatible Answer Set Detection,Incompatible Audio Question Detectionの3つのシナリオを体系的に評価する。
これらのケースを評価することで、Aqua-Benchはモデルの信頼性を厳格に測定する。
論文 参考訳(メタデータ) (2026-01-18T03:55:28Z) - MARS-Sep: Multimodal-Aligned Reinforced Sound Separation [72.85468563236005]
MARS-Sepは音分離のための強化学習フレームワークである。
クリッピングされた信頼領域サロゲートによって最適化された、ファクタライズされたベータマスクポリシを学ぶ。
複数のベンチマークの実験は、テキスト、オーディオ、イメージ-キュード分離において一貫した利得を示している。
論文 参考訳(メタデータ) (2025-10-12T09:05:28Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - A Semantic-based Method for Unsupervised Commonsense Question Answering [40.18557352036813]
ラベル付きタスクデータに依存しないため、教師なしのコモンセンス質問応答は魅力的である。
教師なしコモンセンス質問応答のためのSemantic-based Question Answering法(SEQA)を提案する。
論文 参考訳(メタデータ) (2021-05-31T08:21:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。