論文の概要: Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews
- arxiv url: http://arxiv.org/abs/2607.10511v1
- Date: Sun, 12 Jul 2026 00:03:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.44649
- Title: Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews
- Title(参考訳): 関節内皮の直観と遺伝子解析 : LLM-as-a-Judge Peerレビューにおける疫学的信頼性のベンチマーク
- Authors: Nuo Chen, Qian Wang, Qingyun Zou, Bingsheng He,
- Abstract要約: 我々は、Kahnemanの二重プロセス理論をピアレビューとリリースのための構造化ルーリックとして運用する。
評価基準は3,563で、理論的に動機付けられた9つのテキスト次元、8つのバイアス診断、連続的推論品質スコアで評価された。
- 参考スコア(独自算出の注目度): 37.684628465527545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When an LLM judge calls a peer review analytical and a human committee calls another review high quality, are they tracking the same thing? We argue they are not, and that the difference matters philosophically. We operationalise Kahneman's dual-process theory into a structured rubric for peer review and release Kahneman4Review, a benchmark of 3,563 rated reviews scored along nine theoretically motivated textual dimensions, eight bias diagnostics, and a continuous reasoning-quality score. Three findings bear on trustworthiness: decision tier is not detectably aligned with the rubric's text-grounded epistemic-quality proxy; public-showcase agentic reviews receive higher raw scores than pooled human reviews, but length and venue explain most of the gap and the samples are not paper-paired; and ICLR review-text diagnostics shift at the 2022--2023 transition, temporally coincident with widespread LLM availability but without identifying its cause. A matched function-probe pilot further shows that the rubric distinguishes textual probes designed to contrast genuine fault-finding with surface fluency. We argue that a trustworthy reliability benchmark for LLM judges must separate analytical form from epistemic function, and propose concrete design choices toward that goal. An interactive demo is available at https://huggingface.co/spaces/nuojohnchen/Kahneman4Review.
- Abstract(参考訳): LLM判事がピアレビュー分析を、人間委員会が別のレビューをハイクオリティと呼ぶとき、彼らは同じことを追跡していますか?
彼らはそうではなく、その違いは哲学的に重要であると我々は主張する。
我々は、Kahnemanの二重プロセス理論をピアレビューとリリースのための構造化ルーブリックとして運用し、Kahneman4Reviewは、理論的に動機付けられた9つのテキスト次元、8つのバイアス診断、連続的推論品質スコアで評価された3,563の評価レビューのベンチマークである。
信頼度には3つの知見がある: 決定階層は、ルーリックのテキスト接地されたてんかん質のプロキシに検出されるものではない; 公開ショーケースのエージェントレビューは、プールされた人間のレビューよりも高い生スコアを受け取るが、長さと場所は、ギャップの大半を説明し、サンプルは紙張りではない; ICLRのレビューテキスト診断は、2022-2023の遷移において、時間的にLLMの可用性と一致するが、その原因を特定できない。
一致する関数プローブのパイロットは、このルーブリックが本物の欠陥フィリングと表面流速とを対比するために設計されたテキストプローブを区別していることを示している。
LLM審査員にとって信頼に値する信頼性ベンチマークは、分析形式とてんかん機能とを分離し、その目的に向けて具体的な設計選択を提案する必要がある。
インタラクティブなデモはhttps://huggingface.co/spaces/nuojohnchen/Kahneman4Review.comで公開されている。
関連論文リスト
- From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers [30.106132038073138]
PRISMは,4次元にわたるレビュー品質を評価するベンチマークフレームワークである。
我々は、ICLR、ICML、NeurIPSの階層化されたレビューコーパスにおいて、主要な自動レビュアシステムと人間レビュアをベンチマークする。
単一のシステムは、すべての次元にわたる人間のベースラインのバランスの取れた性能を一度に一致させるものはない。
論文 参考訳(メタデータ) (2026-05-26T09:06:27Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - When Your Reviewer is an LLM: Biases, Divergence, and Prompt Injection Risks in Peer Review [34.067892820832405]
本稿では,学術レビュアーとして大規模言語モデル(LLM)を体系的に評価する。
ICLR 2023とNeurIPS 2022の1,441論文のキュレートされたデータセットを用いて、評価、強度、弱点を越えて、GPT-5-miniをヒトレビュアーに対して評価した。
以上の結果から, LLMは, より弱い論文に対する評価を一貫して向上させつつ, より強いコントリビューションに対する人間の判断と密に一致させることが示唆された。
論文 参考訳(メタデータ) (2025-09-12T00:57:50Z) - Mind the Blind Spots: A Focus-Level Evaluation Framework for LLM Reviews [45.15786181058354]
大きな言語モデル(LLM)は、レビューを自動的にドラフトできる。
LLM生成レビューが信頼できるかどうかを決定するには、体系的な評価が必要である。
注意の正規分布として焦点を運用する焦点レベル評価フレームワークを導入する。
論文 参考訳(メタデータ) (2025-02-24T12:05:27Z) - Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review [66.73247554182376]
大規模言語モデル(LLM)がピアレビューに統合された。
未確認のLLMの採用は、ピアレビューシステムの完全性に重大なリスクをもたらす。
5%のレビューを操作すれば、論文の12%が上位30%のランキングでその地位を失う可能性がある。
論文 参考訳(メタデータ) (2024-12-02T16:55:03Z) - Sentiment Analysis through LLM Negotiations [58.67939611291001]
感情分析の標準的なパラダイムは、単一のLCMに依存して、その決定を1ラウンドで行うことである。
本稿では,感情分析のためのマルチLLMネゴシエーションフレームワークを提案する。
論文 参考訳(メタデータ) (2023-11-03T12:35:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。