論文の概要: The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity
- arxiv url: http://arxiv.org/abs/2608.04463v1
- Date: Wed, 05 Aug 2026 05:38:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.731265
- Title: The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity
- Title(参考訳): Evaluatorは実験の一部:オープンエンディングLDMの整合性の測定
- Authors: Alicia Guerra, Yibo Hu,
- Abstract要約: 回答の品質は、不完全で、遅れており、判断されるため、オープンエンドの修正は異なる測定戦略を必要とする。
我々は、プール化された主条件コーパスに実装された実験的なプロトコルを導入し、分解コーパスを別々に構築する。
4つのオープン・ウェイト・ジェネレータと3つのベンチマークで、全首ピア入力はジェネレータ・データセット・セルで最低品質のリビジョンを生成する。
- 参考スコア(独自算出の注目度): 1.3583317564926913
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prior work on LLM conformity largely measures discrete answer flips under verifiable labels. Open-ended revisions require a different measurement strategy because answer quality is graded, latent, and judged imperfectly. We introduce an experimental protocol implemented across a pooled main peer-condition corpus and separately constructed decomposition corpora, allowing us to separate ordinary re-answering, candidate-content exposure, a bundled peer-presentation residual, and directional judge sensitivity to visible peer context. Across four open-weight generators and three benchmarks, all-wrong peer input produces the lowest-quality revisions in every generator-dataset cell. Blind and informed ratings of identical answers also differ by evaluator: one judge shifts toward the peer-endorsed position, two shift away, one is approximately neutral, and GPT-4o and GPT-5.4-mini audits are likewise non-neutral. Finally, an anchor audit shows that terse correct anchors can be misread often enough to destabilize the latent scale unless calibration is checked explicitly. These results support four conclusions: flip rates are insufficient as a complete measure of open-ended conformity, wrong peers harm open-ended revision, evaluators are not neutral, and anchor calibration is necessary.
- Abstract(参考訳): LLMの適合性に関する以前の研究は、検証可能なラベルの下では、主に離散的な解フリップを測定する。
回答の品質は、不完全で、遅れており、判断されるため、オープンエンドのリビジョンは異なる測定戦略を必要とする。
我々は、プール化された主ピア条件コーパスに実装された実験プロトコルを導入し、分解コーパスを別々に構築し、通常の再回答、候補コンテンツ露光、バンドルされたピア表現残差、可視ピアコンテキストに対する方向判断感度を分離できるようにする。
4つのオープン・ウェイト・ジェネレータと3つのベンチマークで、全首ピア入力はジェネレータ・データセット・セルで最低品質のリビジョンを生成する。
同一回答のブラインドとインフォームドレーティングは評価者によっても異なる: 1人の裁判官がピアエンダードポジションに向かってシフトし、2人の裁判官がシフトし、1人はほぼ中立であり、GPT-4o と GPT-5.4-mini 監査も同様に中立である。
最後に、アンカー監査は、キャリブレーションが明示的にチェックされない限り遅延スケールを不安定化するのに十分な精度で正しいアンカーを誤読できることを示している。
これらの結果は、4つの結論を支持する: フリップレートはオープンエンド適合性の完全な尺度として不十分であり、間違ったピアはオープンエンド修正を害し、評価者は中立ではなく、アンカーキャリブレーションが必要である。
関連論文リスト
- Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning [9.345403722854543]
私たちは、専用のレビューステージが間違った候補を正しい候補に変えるのに役立つという仮定をテストします。
我々は、このギャップがレビュアーの品質によって説明されるのか、それともプロトコルが進める次の回答に批判が変わるのかを問う。
論文 参考訳(メタデータ) (2026-07-16T18:38:10Z) - LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition [19.651323641444726]
決定論的TEDS評価は、FinTabNetとOmniDocBenchを使って制御されたテストベッドを提供する。
判定信号は両方のデータセットで弱かった。
厳しい損害は 特定の判事のフィードバックなしに 発生しました
論文 参考訳(メタデータ) (2026-07-15T00:14:31Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges [33.739528721872844]
役に立ち、現実的」な回答を求めるあいまいなルーリックは、事実を発明したり、ユーザーの意図に反する、洗練された答えに報いることができる。
PReMISEは, 構造的妥当性, 信頼性, 嗜好適合性, 対向ロバスト性という4つの軸に沿って, LLM-judge の下で使用されるすべてのルーブリックを監査するフレームワークである。
選好ランク選択は、ペア化された応答の判定精度を65.0%から6.8.6%に引き上げ、最強のルーリック発見ベースラインと競合し、クロスジャッジスイープの審査員のうち2人を導いた。
論文 参考訳(メタデータ) (2026-05-29T03:45:11Z) - Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges [26.595399077062638]
LLM-as-a-Judgeパイプラインは、エージェント安全性のデファクト評価器となっている。
既存のベンチマークでは、評定がエージェントの行動に依存するか、それとも単に評価方針がどう語られるかをチェックすることなく、その評定を根底からのプロキシとして扱う。
我々は、証明された等価な書き換えの下でのルーブリック・セマンティック不変性、意図的な厳密なシフトの下でのルーブリック・スレッショルド不変性、曖昧さを意識したキャリブレーションの3つの検証可能な原則として運用する。
論文 参考訳(メタデータ) (2026-05-07T12:49:09Z) - MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following [8.500414706731036]
本稿では,制約レベル判定のベンチマークであるMCJudgeBenchを紹介する。
各インスタンスには、命令、候補応答、明示的な制約リスト、Yes、部分的、ノー、制御された応答側の摂動を含む。
我々は、正確性と矛盾性の両方の指標を用いて、プロプライエタリかつオープンソースのLCM審査員を評価した。
論文 参考訳(メタデータ) (2026-05-05T15:20:42Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。