論文の概要: Judging a Review by its Cover: A Reliability Analysis of LLM-based Peer Review Evaluation Metrics
- arxiv url: http://arxiv.org/abs/2609.23264v1
- Date: Sun, 20 Sep 2026 00:49:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.74118
- Title: Judging a Review by its Cover: A Reliability Analysis of LLM-based Peer Review Evaluation Metrics
- Title(参考訳): LLMに基づくピアレビュー評価尺度の信頼性分析
- Abstract要約: ピアレビュー評価指標が,表層言語以外の実体的レビュー品質をキャプチャするかどうかを検証するためのフレームワークを提案する。
我々は,文章やプレゼンテーションを変えながら,同じ評価内容を保持する忠実なLLMリライトと,オリジナルの人間レビューを比較した。
これらの結果から,多くのピアレビュー評価指標がレビュー品質と言語的プレゼンテーションを部分的に説明していることが明らかとなった。
- 参考スコア(独自算出の注目度): 13.687981034782517
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Peer-review evaluation is increasingly being automated with LLM-as-a-judge metrics, but this creates a measurement risk. A review may receive a high score because it is fluent, organized, and polished, rather than because it provides a strong evaluation of the paper. This risk is especially important in AI-assisted reviewing, where reviewers may use LLMs to improve clarity or presentation while preserving the underlying judgments. We propose a statistical framework for testing whether peer-review evaluation metrics capture substantive review quality beyond surface-level linguistic form. The framework compares original human reviews with faithful LLM rewrites that preserve the same evaluative content while changing wording and presentation. Using a dataset comprising 4,044 meaning-preserving rewrites derived from 674 human reviews from ICLR and NeurIPS, we evaluate 29 content-oriented peer-review evaluation metrics drawn from four prior works through complementary tests of surface sensitivity and robustness. Although these metrics are intended to capture review properties beyond surface-level, writing-dependent characteristics, we find that sensitivity to rewriting is widespread. Under our primary analysis, 23 metrics assign significantly different scores to reviews whose evaluative content is preserved, while only six satisfy our robustness criterion. The patterns are largely consistent across two LLM judge models, suggesting that the issue is not specific to a single judge. These findings show that many peer-review evaluation metrics partially conflate review quality with linguistic presentation, and indicate that robustness to meaning-preserving rewriting should be validated before such metrics are used to compare human-written, AI-assisted, and AI-generated reviews.
- Abstract(参考訳): LLM-as-a-judgeメトリクスによるピアレビュー評価がますます自動化されているが、これは測定リスクを生み出している。
レビューは、論文の強力な評価を提供するためではなく、流動的で組織的で、洗練されているため、高い評価を受けることができる。
このリスクは、AI支援によるレビューにおいて特に重要であり、レビュアーはLLMを使用して、基礎となる判断を維持しながら明確性やプレゼンテーションを改善することができる。
ピアレビュー評価指標が,表層言語以外の実体的レビュー品質を捉えているかどうかを統計的に検証する枠組みを提案する。
このフレームワークは、オリジナルの人間によるレビューと、言葉やプレゼンテーションを変えながら、同じ評価内容を保存する忠実なLLM書き直しを比較する。
ICLRとNeurIPSの674人のレビューから得られた4,044個の意味保存的書き直しからなるデータセットを用いて、4つの先行研究から得られた29のコンテンツ指向のピアレビュー評価指標を表面感度とロバストネスの相補的試験により評価した。
これらの指標は, 表面レベル, 書き込みに依存した特性を超えて, レビュー特性を捉えることを意図しているが, 書き換えに対する感受性は広い。
一次分析では,評価内容が保存されているレビューに対して,23の指標が著しく異なるスコアを割り当てる一方で,ロバスト性基準を満たすのは6つに過ぎない。
パターンは2つのLLM審査モデルでほぼ一致しており、この問題は1つの裁判官に固有のものではないことを示唆している。
これらの結果は、多くのピアレビュー評価指標が、レビュー品質と言語的プレゼンテーションを部分的に説明し、これらの指標を人文、AI支援、AI生成レビューと比較するために使用する前に、意味保存リライトに対する堅牢性を検証すべきであることを示している。
関連論文リスト
- SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators [50.129606229339146]
SurveyReviewは、調査評価のためのレビューアラインで多次元のベンチマークとデータセットである。
我々は、自由形式のコメントを4次元のスコアに変換することによって、ピアレビューレポートを構築する。
我々は,自動評価器と人間レビュアーのアライメントを測定するための,標準化された列車/テスト分割と評価プロトコルをリリースする。
論文 参考訳(メタデータ) (2026-08-07T16:11:46Z) - Impact of large language models on peer review opinions from a fine-grained perspective: Evidence from top conference proceedings in AI [12.04501354723317]
大規模言語モデル(LLM)の出現に伴う学術論文のピアレビューレポートの変化について検討する。
その結果, LLMの出現に伴い, 要約や表面面の明瞭さに重点を置いたピアレビューテキストが, より長く, より流動的になってきていることが示唆された。
同時に、独創性、複製性、ニュアンスドクリティカルな推論など、より深い評価次元への注意は減少している。
論文 参考訳(メタデータ) (2026-04-21T15:33:53Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - When Your Reviewer is an LLM: Biases, Divergence, and Prompt Injection Risks in Peer Review [34.067892820832405]
本稿では,学術レビュアーとして大規模言語モデル(LLM)を体系的に評価する。
ICLR 2023とNeurIPS 2022の1,441論文のキュレートされたデータセットを用いて、評価、強度、弱点を越えて、GPT-5-miniをヒトレビュアーに対して評価した。
以上の結果から, LLMは, より弱い論文に対する評価を一貫して向上させつつ, より強いコントリビューションに対する人間の判断と密に一致させることが示唆された。
論文 参考訳(メタデータ) (2025-09-12T00:57:50Z) - Identifying Reliable Evaluation Metrics for Scientific Text Revision [7.503795054002405]
ROUGEやBERTScoreといった従来のメトリクスは主に、意味のある改善を捉えるのではなく、類似性に重点を置いている。
まず手動による注釈研究を行い、異なる修正の質を評価する。
そこで本研究では,NLPドメインの参照不要評価指標について検討する。
LLM-as-a-judge評価とタスク固有のメトリクスを組み合わせたハイブリッドアプローチが,最も信頼性の高いリビジョン品質評価を提供することがわかった。
論文 参考訳(メタデータ) (2025-06-05T09:00:23Z) - A Literature Review of Literature Reviews in Pattern Analysis and Machine Intelligence [51.26815896167173]
本稿では,3つの相補的な側面からPAMIレビューを総合的に分析する。
我々の分析は、現在のレビューの実践において、独特の組織パターンと永続的なギャップを明らかにします。
最後に、最先端のAI生成レビューの評価は、コヒーレンスと組織の進歩を奨励していることを示している。
論文 参考訳(メタデータ) (2024-02-20T11:28:50Z) - CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation [87.44350003888646]
Eval-Instructは、疑似参照でポイントワイズした批評を取得し、マルチパスプロンプトを通じてこれらの批評を修正できる。
CritiqueLLMは、ChatGPTとすべてのオープンソースベースラインを上回るように実証的に示されています。
論文 参考訳(メタデータ) (2023-11-30T16:52:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。