論文の概要: Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge
- arxiv url: http://arxiv.org/abs/2603.04417v1
- Date: Wed, 04 Feb 2026 16:03:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-09 01:20:08.194383
- Title: Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge
- Title(参考訳): 同一入力, 異なるスコア: LLM判断の不整合に関するマルチモデル研究
- Authors: Fiona Lau,
- Abstract要約: 本研究は, GPT-4o, GPT-4o-mini, Gemini-2.5-Flash, Claude-Haiku-4.5, Claude-Sonnet-4.5の5モデルに対して, 評価安定性を系統的に評価した。
3つの疑問に対処する: 繰り返し実行されるモデルのスコアがどの程度安定しているか、モデルが異なる入力のスコアがどの程度異なるか、温度がスコアの一貫性にどのように影響するか。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models are increasingly used as automated evaluators in research and enterprise settings, a practice known as LLM-as-a-judge. While prior work has examined accuracy, bias, and alignment with human preferences, far less attention has been given to how consistently LLMs assign numerical scores, an important concern for many production workflows. This study systematically evaluates scoring stability across five commonly used models, GPT-4o, GPT-4o-mini, Gemini-2.5-Flash, Claude-Haiku-4.5, and Claude-Sonnet-4.5, two temperature settings, and real enterprise question-answer pairs drawn from a retrieval-augmented generation (RAG) system. We address three questions: how stable a model's scores are across repeated runs, how differently models score identical inputs, and how temperature affects scoring consistency. Temperature controls the determinism of an LLM's output. Despite expectations of stability at temperature=0, we observe substantial variability across models, with completeness scoring showing the largest fluctuations. Cross-model comparisons reveal systematic differences in strictness and interpretive style, leading to divergent ratings for the same answers. Lower temperatures improve stability for some models, notably GPT-4o and Gemini, but have limited or inconsistent effects for Anthropic models. These findings have important implications for enterprise pipelines that rely on LLM-generated scores for routing, triage, gating, or quality control. Identical inputs can receive different scores depending on model, family, or temperature, raising concerns around fairness, reproducibility, and operational reliability. Our results highlight the need for monitoring, robust parsing, and hybrid human-LLM evaluation strategies to ensure dependable use of LLM-as-a-judge in production environments.
- Abstract(参考訳): 大規模言語モデルは、LLM-as-a-judgeとして知られる研究や企業環境での自動化評価手段として、ますます使われている。
以前の研究では正確さ、偏り、人間の好みとの整合性について検討されてきたが、LLMがいかにして数値的なスコアを割り当てるかは、多くのプロダクションワークフローにとって重要な関心事である。
本研究は, GPT-4o, GPT-4o-mini, Gemini-2.5-Flash, Claude-Haiku-4.5, Claude-Sonnet-4.5, 2つの温度設定,および検索強化世代(RAG)システムから引き出された実企業質問応答対のスコアリング安定性を系統的に評価する。
3つの疑問に対処する: 繰り返し実行されるモデルのスコアがどの程度安定しているか、モデルが異なる入力のスコアがどの程度異なるか、温度がスコアの一貫性にどのように影響するか。
温度はLLM出力の決定性を制御する。
温度=0における安定性の期待にもかかわらず、モデル間での相当な変動を観測し、完全性スコアは最大の変動を示す。
クロスモデル比較では、厳密さと解釈スタイルの体系的な違いが示され、同じ答えに対する異なる評価が導かれる。
低い温度はいくつかのモデル、特にGPT-4oとGeminiの安定性を改善するが、人為的モデルには限定的または矛盾した効果がある。
これらの発見は、ルーティング、トリアージ、ゲーティング、品質管理のためのLCM生成スコアに依存するエンタープライズパイプラインに重要な意味を持つ。
正確な入力は、モデル、家族、または温度によって異なるスコアを受け取ることができ、公正性、再現性、運用上の信頼性に関する懸念を提起する。
実運用環境におけるLCM-as-a-judgeの信頼性を確保するため,モニタリング,ロバスト解析,ハイブリッド人間-LLM評価戦略の必要性を強調した。
関連論文リスト
- Does Tone Change the Answer? Evaluating Prompt Politeness Effects on Modern LLMs: GPT, Gemini, LLaMA [0.6263481844384227]
本研究は,インタラクショントーンがモデル精度に与える影響を検討するためのシステム評価フレームワークを提案する。
GPT-4o mini (OpenAI)、Gemini 2.0 Flash (Google DeepMind)、Llama 4 Scout (Meta) の3つのメジャー言語モデルにこのフレームワークを適用した。
以上の結果から,トーン感受性はモデル依存的かつドメイン依存的であることが示唆された。中性または超親和性は概してVery Rudeのプロンプトよりも高い精度が得られるが,統計的に有意な影響はヒューマニティタスクのサブセットにのみ現れる。
論文 参考訳(メタデータ) (2025-12-14T19:25:20Z) - Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models [57.33350664910483]
資源制約と非対称な情報設定を備えた動的・対角的評価環境であるSquid Gameを紹介する。
我々は,Squid Game 上で50以上の LLM を評価し,動的対向シナリオにおける一般 LLM の行動評価研究を最大規模で行った。
論文 参考訳(メタデータ) (2025-11-12T06:06:29Z) - The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models [1.4323566945483497]
本稿では,大規模言語モデルにおける「カメレオン行動」に関する最初の体系的研究について述べる。
我々は最先端のシステムに根本的な欠陥を露呈する。
情報源の再使用率と信頼性の相関は統計的に有意である。
論文 参考訳(メタデータ) (2025-10-19T04:51:14Z) - Analyzing the Instability of Large Language Models in Automated Bug Injection and Correction [0.0]
大規模言語モデル(LLM)は、ソフトウェア工学のタスクで使用される。
同じ入力で異なるタイミングで実行すると、根本的に異なるコードを生成することができる。
本研究では、コードバグの修正に関して、LLMがいかに不安定かを検討する。
論文 参考訳(メタデータ) (2025-09-08T08:23:49Z) - Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge [17.40713507922006]
大規模言語モデル(LLM)は、他の出力の迅速かつ信頼性の高い評価を提供する裁判官として機能する。
LLMは、自己バイアス(self-bias)として知られる、過度に好ましい評価を自身のアウトプットに体系的に割り当てる。
本稿では,自己バイアスを特定・推定できる仮定を明示的に定式化する統計的枠組みを提案する。
論文 参考訳(メタデータ) (2025-08-08T21:22:12Z) - DeepCritic: Deliberate Critique with Large Language Models [77.5516314477878]
我々は,Large Language Models(LLMs)の数学批判能力の研究と向上に焦点をあてる。
Qwen2.5-7B-Instructをベースとした批判モデルを開発した。
論文 参考訳(メタデータ) (2025-05-01T17:03:17Z) - Influences on LLM Calibration: A Study of Response Agreement, Loss Functions, and Prompt Styles [4.477423478591491]
Calib-nは、信頼度推定のための補助モデルをトレーニングする新しいフレームワークである。
補助的なモデルベース手法では,数発のプロンプトが最も有効であることが判明した。
論文 参考訳(メタデータ) (2025-01-07T18:48:42Z) - VHELM: A Holistic Evaluation of Vision Language Models [75.88987277686914]
視覚言語モデル(VHELM)の全体的評価について述べる。
VHELMは、視覚的知覚、知識、推論、バイアス、公平性、多言語性、堅牢性、毒性、安全性の9つの側面の1つ以上をカバーするために、さまざまなデータセットを集約する。
私たちのフレームワークは軽量で自動で、評価の実行が安価で高速に行えるように設計されています。
論文 参考訳(メタデータ) (2024-10-09T17:46:34Z) - Calibrating Large Language Models with Sample Consistency [76.23956851098598]
本稿では,複数サンプルモデル生成系の分布から信頼度を導出する可能性について,一貫性の3つの尺度を用いて検討する。
その結果、一貫性に基づくキャリブレーション手法は、既存のポストホック手法よりも優れていることがわかった。
種々のLMの特性に合わせて,キャリブレーションに適した整合性指標を選択するための実用的なガイダンスを提供する。
論文 参考訳(メタデータ) (2024-02-21T16:15:20Z) - Are You Sure? Challenging LLMs Leads to Performance Drops in The
FlipFlop Experiment [82.60594940370919]
大規模言語モデル(LLM)のマルチターン動作を研究するためのFlipFlop実験を提案する。
モデルが平均46%の時間で回答を反転させ、全てのモデルが最初の予測と最終予測の間に精度を低下させ、平均17%の低下(FlipFlop効果)を示す。
我々はオープンソースのLLMで微調整実験を行い、合成されたデータに対する微調整は、性能劣化を60%低減させることができるが、サイコファンティックな振る舞いを完全には解決できないことを発見した。
論文 参考訳(メタデータ) (2023-11-14T23:40:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。