論文の概要: Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence
- arxiv url: http://arxiv.org/abs/2608.25869v1
- Date: Wed, 26 Aug 2026 14:41:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.866826
- Title: Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence
- Title(参考訳): LLM-as-a-Judgeシステムにおけるバイアスのアンコリング:事前スコアは評価独立を妥協する
- Abstract要約: 先行スコアは,文脈メタデータにのみ含まれていても,判断をアンカーし,評価を評価値に体系的にシフトすることを示す。
人間のラベル付き地上真実によるカテゴリー産業データでは、アンカーされたメタデータは誤り訂正の48%をブロックし、割り当てられた間違ったラベルに対して正しい判断の10.18%をフリップする。
- 参考スコア(独自算出の注目度): 0.7340017786387767
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) increasingly assess generated content, giving rise to the LLM-as-a-Judge paradigm. These systems now score outputs, filter content, and gate iterative refinement in production pipelines, where each judgment is often assumed to be independent of earlier evaluations. We test this assumption using three prompt conditions: no metadata, revision framing, and anchored metadata containing revision, attempt, and prior-score fields. We show that prior scores, even when included only as context metadata, anchor judgments and systematically shift ratings toward their values. Across 192,000 attempted evaluations (185,271 successful), seven out of the eight evaluated models have 95% task-stratified bootstrap intervals below zero for the total anchored-metadata effect on 20 fixed texts. Cohen's $d$, a standardized measure of the difference between score distributions, reaches an absolute value of 0.71. Token-level analysis of selected model-task probes suggests a threshold-like response pattern: introducing anchored metadata produces a marked redistribution of output-score probabilities, while changing the anchor value within the tested below-threshold range produces comparatively little additional variation. On categorical industry data with human-labeled ground truth, anchored metadata blocks 48% of error corrections and flips 10.18% of correct judgments toward an assigned wrong label, demonstrating the bias extends beyond numerical scoring to categorical decisions. Neither Chain-of-Thought nor a metadata-disregard warning reduces the total effect, although the warning improves the paired accuracy effect relative to baseline in the industry experiment. Reliable LLM evaluation demands careful context engineering rather than an assumption of impartiality. Effective mitigation must be validated for the intended model and task or domain.
- Abstract(参考訳): 大規模言語モデル (LLMs) は、LLM-as-a-Judgeパラダイムを生み出すために、生成したコンテンツをますます評価する。
これらのシステムは、生産パイプラインにおいて出力、フィルタ内容、ゲート反復精製をスコアし、各判断は以前の評価とは独立しているとしばしば想定される。
この仮定は、メタデータなし、リビジョンフレーミングなし、リビジョン、試行、事前スコアフィールドを含むアンロックされたメタデータの3つの条件を用いて検証する。
先行スコアは,文脈メタデータにのみ含まれていても,判断をアンカーし,評価値をその値に体系的にシフトすることを示す。
19万2000件の試行試験(185,271件)が成功し、8つの評価モデルのうち7件は、20の固定テキストに対する全アンカー・メタタ効果に対して、95%のタスク階層化ブートストラップ間隔をゼロ以下に設定した。
コーエンの$d$はスコア分布の差の標準的な尺度であり、絶対値0.71に達する。
アンカー付きメタデータを導入すると、出力スコア確率が顕著に再分配される一方で、テストした下閾値範囲内でアンカー値を変更すると、比較的わずかな変化が生じる。
人間のラベル付き地上真実によるカテゴリー産業データでは、アンカー付きメタデータブロックがエラー修正の48%をブロックし、正しい判断の10.18%を割り当てられた間違ったラベルに向け、偏差が数値的なスコアを超えてカテゴリー的決定を下すことを示す。
チェーン・オブ・ソートもメタデータの無視警告も合計効果を低下させるものではないが、警告は業界実験における基準値に対するペアの精度効果を改善する。
信頼性の高いLLM評価は、公平性の仮定よりも、注意深いコンテキストエンジニアリングを必要とする。
効果的な緩和は、意図されたモデルとタスクまたはドメインに対して検証されなければならない。
関連論文リスト
- Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation [2.733105115068754]
反復モデルの再トレーニングなしにShapley値を近似する,スケーラブルで推論のみのデータアベイラビリティパイプラインを導入する。
重厚な2つのアライメントデータセットの衛生化におけるパイプラインの有効性を実証する。
論文 参考訳(メタデータ) (2026-07-24T03:31:44Z) - Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance [9.771590610969918]
WMF-AM(Working Memory Fidelity-Active Manipulation)を紹介する。
その結果,20種類のオープンウェイトモデル (0.5B-35B, 13ファミリー) で10タスク・エージェント・バッテリを発売した。
論文 参考訳(メタデータ) (2026-03-28T17:25:11Z) - CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection [8.631593963090985]
バージョン管理は、コード変更の合理性を伝えるためにコミットメッセージに依存するが、これらのメッセージは、しばしば低品質で、メッセージコード不整合(MCI)として知られる差分と矛盾する。
大規模言語モデル(LLM)を用いたMCI検出のための最初のベンチマークであるCODEFUSE-COMMITEVALを紹介する。
我々は、元々一貫したコミットのルール誘導突然変異を通じて、7種類の一貫性のないメッセージを生成し、正と負の両方のサンプルを検証するために2倍の検証を適用した。
論文 参考訳(メタデータ) (2025-11-25T03:33:57Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Reducing Biases in Record Matching Through Scores Calibration [1.5530839016602822]
スコアバイアスの測定と低減のためのしきい値に依存しないフレームワークを提案する。
基準しきい値に基づく基準値の下では公平に見えても,いくつかの最先端マッチング手法がかなりのスコアバイアスを示すことを示す。
本稿では,2つのポストプロセッシングスコアキャリブレーションアルゴリズムを導入する。第1のキャリブは,ワッサーシュタイン・バリセンタを用いてグループワイズスコアの分布を調整し,人口統計学的パーティを目標とする。
第2のカラリブは、ラベルに依存したバイアス、例えば平等な機会を減らそうと予測されたラベルの条件である。
論文 参考訳(メタデータ) (2024-11-03T21:01:40Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - AMRFact: Enhancing Summarization Factuality Evaluation with AMR-Driven Negative Samples Generation [57.8363998797433]
抽象的意味表現(AMR)を用いた摂動要約を生成するフレームワークであるAMRFactを提案する。
提案手法は,AMRグラフに一貫した要約を解析し,制御された事実不整合を注入して負の例を生成し,一貫性のない事実不整合要約を高い誤差型カバレッジで生成する。
論文 参考訳(メタデータ) (2023-11-16T02:56:29Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z) - TRUST-LAPSE: An Explainable and Actionable Mistrust Scoring Framework
for Model Monitoring [4.262769931159288]
連続モデル監視のための"ミストラスト"スコアリングフレームワークであるTRUST-LAPSEを提案する。
我々は,各入力サンプルのモデル予測の信頼性を,潜時空間埋め込みのシーケンスを用いて評価する。
AUROCs 84.1 (vision), 73.9 (audio), 77.1 (clinical EEGs)
論文 参考訳(メタデータ) (2022-07-22T18:32:38Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。