論文の概要: Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift
- arxiv url: http://arxiv.org/abs/2609.09703v1
- Date: Wed, 09 Sep 2026 04:40:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.90107
- Title: Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift
- Title(参考訳): LLM関連審査員に礼儀正しくすべきか? 厳格なオペレーティングポイントシフトとしてのトーン
- Abstract要約: トーンはランキング結果よりもキャリブレーションに基づく合意に影響します。
音調が変わる場合、結果は裁判官の厳格な操作点の変化とより一致している。
- 参考スコア(独自算出の注目度): 7.837842601637295
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly used as relevance judges, yet their labels can shift with prompt surface form. We study one such feature -- tone -- on 3,498 TREC DL19/DL20 query-passage pairs, across eight judge models, five classifier-calibrated politeness levels, and three paraphrases per level. Effects are strongly model-dependent: one judge shows a structured U-shaped response, whereas most show only small changes. Where tone changes agreement, the results are more consistent with a shift in the judge's severity operating point -- its overall scoring leniency -- than with improved judgment. Agreement rises or falls as this shift moves the judge toward or away from human annotators' strictness. A query-disjoint cross-fit retains the expected association (Spearman $ρ= -0.683$; exact model-block permutation $p = 0.019$). Tone affects calibration-based agreement more than ranking outcomes: across 32 model-tone contrasts, the largest absolute mean change in NDCG@10 is 0.011, although Kendall's $τ$ as low as 0.743 shows that reordering is reduced, not absent. The account reconciles prior contradictory findings and identifies prompt tone as a potential validity threat when absolute relevance labels matter.
- Abstract(参考訳): 大型の言語モデルは、関連判断器としてますます使われているが、そのラベルは、即時的な表面形式でシフトすることができる。
我々は,3,498 TREC DL19/DL20クエリパスペアに対して,8つの判断モデル,5つの分類器校正された丁寧度レベル,および3つのパラフレーズについて,そのような特徴について検討した。
効果は強いモデル依存であり、ある裁判官は構造化されたU字型反応を示すが、ほとんどは小さな変化しか示さない。
トーンが変更される場合、結果は判断の改善よりも、審査員の厳格な運用点(総合的な採点の怠慢)の変化と一致している。
このシフトは、裁判官が人間の注釈の厳しさから遠ざかるにつれて、合意が上昇または低下する。
スピアマン$ρ= -0.683$; 正確なモデルブロック置換$p = 0.019$)。
32のモデル-トーンコントラストにおいて、NDCG@10における最大の絶対平均変化は0.011であるが、Kendallの$τ$は0.743と低いが、リオーダーは減少し、欠落していない。
アカウントは、事前の矛盾した発見を調整し、絶対関連ラベルが問題となる場合に、プロンプトトーンを潜在的な妥当性の脅威として識別する。
関連論文リスト
- Difference-in-Differences on a Censored Rating Scale Can Manufacture an Effect: Evidence from a Pre-Registered LLM-Judge Audit [15.81584544074437]
LLM審査員の聴取は、一致した条件を対比することでバイアスを認定する。
このエンドポイントは、報告するスケールでは特定されない。
我々は,そのメカニズムをクローズドな形で導き,その貢献が監査の自己評価から測定可能であることを示す。
論文 参考訳(メタデータ) (2026-08-27T16:10:16Z) - Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks [1.2555090617748867]
我々は、標準の0-10品質判断と厳密な二項意味等価判定とを、人為的な基準に対して組み合わせた二重判断プロトコルを寄贈する。
我々は、制御された視覚的基盤を持つ規制課題について研究し、その意味は、すべての入力に対して既知の参照を持つコーデレートされた質問である。
論文 参考訳(メタデータ) (2026-08-25T08:49:46Z) - Sharding Prevents LLM Oversight Failures and Adversarial Exploitation [45.380649793616705]
シャーディングは要求を小さなグループに分割し、各グループを別の呼び出しに割り当て、評決を集約する。
シャードの弱い裁判官は、より有能な総合的な裁判官よりも優れており、後者がパネルの全予算を受け取ったとしても、その裁判官と一致することができる。
論文 参考訳(メタデータ) (2026-08-05T18:21:21Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Majority Vote Silences Minority Values: Annotator Disagreement at the Hate/Offensive Boundary in HateXplain [0.0]
ヘイトスピーチアノテーションパイプラインは、アノテータの不一致をトレーニング前に多数投票ラベルに分解する。
この集合が中立ではないことを示す。
高度化のための下流3つの介入は、すべて境界精度の回復に失敗する。
論文 参考訳(メタデータ) (2026-06-27T06:56:07Z) - Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels [0.0]
LLM-as-a-judgeパネルは複数のモデルからの投票を集計する。
私たちは、その信頼性が独立投票の理想にどの程度劣るかを定量化します。
論文 参考訳(メタデータ) (2026-05-28T11:48:17Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior [0.0]
審査員は一貫性があるが、互いに一致していない。
評価は3,240件を超え、中間合意はほぼゼロに近い。
審査員の平均得点は、審査員の実際の値に該当しない合成判定を生成する。
論文 参考訳(メタデータ) (2026-01-08T17:02:22Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z) - The price of unfairness in linear bandits with biased feedback [62.25313751895011]
線形帯域フィードバックによる逐次意思決定の問題点について検討する。
その結果,不偏フィードバック下で得られたdT 1/2 log(T) の後悔率よりも最悪の後悔率が高いことがわかった。
興味深いことに、ギャップ依存率によって、問題はバイアスのないものほど難しくない非自明なインスタンスの存在が明らかになる。
論文 参考訳(メタデータ) (2022-03-18T08:03:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。