論文の概要: Beyond Final Decisions: A Process-Centric Benchmark for Transparent AI-Assisted Peer Review
- arxiv url: http://arxiv.org/abs/2609.05947v1
- Date: Sat, 05 Sep 2026 07:30:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.171218
- Title: Beyond Final Decisions: A Process-Centric Benchmark for Transparent AI-Assisted Peer Review
- Title(参考訳): 最終決定を超えて: 透明なAI支援ピアレビューのためのプロセス中心ベンチマーク
- Abstract要約: 既存のAI支援ピアレビューの評価は、主に生成されたレビューの全体的な品質や最終的な決定の正確性に焦点を当てている。
本稿では,AI支援ピアレビューのためのプロセス中心診断ベンチマークを紹介する。
- 参考スコア(独自算出の注目度): 29.43256191104064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Peer review is central to quality control in science. However, existing evaluations of AI-assisted peer review mainly focus on the overall quality of generated reviews or the accuracy of final decisions. They therefore provide limited evidence about whether model decisions are supported by sufficient and reliable review evidence. We introduce a process-centric diagnostic benchmark for AI-assisted peer review. It uses (x,$z_s$,$z_c$,$z_r$,y) to represent the paper content, summary, critique, suggestion, and decision. We convert heterogeneous review records from PeerRead, NLPeer ARR-22, and OpenReview-ICLR into process-aligned data. Our benchmark uses direct decision prediction from the paper content (Direct) as its baseline. It compares the decision value of Gold-process variables and Predicted-process variables, and conducts stage-level evaluation, chain-consistency evaluation, and interventional sensitivity analysis. Experiments across three datasets and six models show that Gold-process variables generally have higher decision value. For the main analysis model, the Gold--Predicted gap remains stable across datasets and random seeds. This gap is also reproduced in most model--dataset combinations. Although model-generated intermediate review texts show relatively high local consistency across adjacent stages, the final decisions are not consistently supported by the preceding review evidence. Our benchmark targets AI systems designed to assist rather than replace human reviewers. It provides a transparent and auditable diagnostic tool for evaluating the reliability of their review processes.
- Abstract(参考訳): ピアレビューは科学における品質管理の中心である。
しかし、既存のAI支援ピアレビューの評価は、主に生成されたレビューの全体的な品質や最終的な決定の正確性に焦点を当てている。
したがって、モデル決定が十分な信頼性のあるレビューエビデンスによって支持されるかどうかについての限定的な証拠を提供する。
本稿では,AI支援ピアレビューのためのプロセス中心診断ベンチマークを紹介する。
x,$z_s$,$z_c$,$z_r$,y) を使って、論文の内容、要約、批評、提案、決定を表現する。
We convert heterogeneous review records from PeerRead, NLPeer ARR-22, and OpenReview-ICLR into process-aligned data。
本ベンチマークでは,論文の内容(Direct)から直接の意思決定予測をベースラインとして用いた。
ゴールドプロセス変数と予測プロセス変数の判定値を比較し、ステージレベルの評価、チェーン一貫性の評価、介入感度分析を行う。
3つのデータセットと6つのモデルにわたる実験により、ゴールドプロセス変数は一般的により高い決定値を持つことが示された。
主解析モデルでは、ゴールド予測ギャップはデータセットとランダムシードの間で安定しており、このギャップはほとんどのモデル-データセットの組み合わせで再現される。
モデル生成中間レビューテキストは、隣接するステージ間で比較的高い局所的な一貫性を示すが、最終決定は、前回のレビューエビデンスによって一貫して支持されない。
我々のベンチマークは、人間のレビュアーを置き換えるのではなく、支援するように設計されたAIシステムをターゲットにしている。
レビュープロセスの信頼性を評価するために、透明で監査可能な診断ツールを提供する。
関連論文リスト
- From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future [50.89292049215399]
大規模言語モデル(LLM)は、ピアレビュープロセスの異なる段階を支援または自動化する動機付けの手法である。
我々は、(i)ピアレビュー生成のためのテクニックを合成し、微調整戦略、エージェントベースシステム、RLベースの手法、そして生成を強化する新しいパラダイムを合成する。
データセットをカタログ化し、モデリングの選択を比較し、制限、倫理的懸念、今後の方向性について議論します。
論文 参考訳(メタデータ) (2026-04-30T14:28:21Z) - What Makes a Good AI Review? Concern-Level Diagnostics for AI Peer Review [6.59569431190247]
本稿では,AIレビューを判断レベルでのみ評価するのではなく,関心レベルで評価する診断フレームワークを提案する。
本稿では,二項精度から問題検出,判定・階層化動作,判断・認識の校正,帰属・認識の分解に移行した評価ラグを導出する。
論文 参考訳(メタデータ) (2026-04-21T21:16:59Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - Is Peer Review Really in Decline? Analyzing Review Quality across Venues and Time [55.756345497678204]
本稿では,エビデンスに基づくレビュー品質の比較研究のための新しいフレームワークを提案する。
ICLR、NeurIPS、*ACLといった主要なAIおよび機械学習のカンファレンスに適用します。
レビュー品質の測定値と時間経過に伴うその進化の関係について検討する。
論文 参考訳(メタデータ) (2026-01-21T16:48:29Z) - What Drives Paper Acceptance? A Process-Centric Analysis of Modern Peer Review [2.9282248958475345]
ICLR 2017-2025の大規模な実証研究を行い、28,000件以上の提出書を提出した。
以上の結果から,科学的新奇性以外の要因が受容結果を著しく形作っていることが示唆された。
著者,レビュアー,メタレビュアーに対して,ピアレビューにおける透明性と公正性を高めるためのデータ駆動ガイドラインを提案する。
論文 参考訳(メタデータ) (2025-09-30T03:00:10Z) - Garbage In, Reasoning Out? Why Benchmark Scores are Unreliable and What to Do About It [1.6261897792391753]
我々は、SocialIQa、FauxPas-EAI、ToMiの3つの広く使われている推論ベンチマークの体系的な監査を行う。
ベンチマーク項目と評価手法の両方において,広範な欠陥を明らかにする。
論文 参考訳(メタデータ) (2025-06-30T13:57:28Z) - Identifying Aspects in Peer Reviews [59.02879434536289]
我々は、ピアレビューのコーパスからアスペクトを抽出するデータ駆動スキーマを開発した。
我々は、アスペクトを付加したピアレビューのデータセットを導入し、コミュニティレベルのレビュー分析にどのように使用できるかを示す。
論文 参考訳(メタデータ) (2025-04-09T14:14:42Z) - Paper Quality Assessment based on Individual Wisdom Metrics from Open Peer Review [4.35783648216893]
従来のクローズドピアレビューシステムは遅く、コストがかかり、透明ではない。
我々は、オープンなボトムアッププロセスを通じて、科学的ピアレビューの代替形態の有効性と正確性を提案し、検証する。
論文 参考訳(メタデータ) (2025-01-22T17:00:27Z) - How Many Ratings per Item are Necessary for Reliable Significance Testing? [7.422152765037947]
機械学習評価の基盤は、モデルと人間の反応が一元的、権威的、金標準のデータに対するモデルを評価するのに十分な信頼性を持つという仮定である。
我々は、(既存のまたは計画された)データセットが、信頼できるヌル仮説の統計的テストを保証するのに十分な応答を持っているかどうかを判断するために、メソッドを適用する。
我々の手法は、AI研究者がAI評価のためのデータ収集方法に関するより良い決定を下すのにどのように役立つかを示す。
論文 参考訳(メタデータ) (2024-12-04T02:31:28Z) - Ranking Scientific Papers Using Preference Learning [48.78161994501516]
我々はこれをピアレビューテキストとレビュアースコアに基づく論文ランキング問題とみなした。
ピアレビューに基づいて最終決定を行うための,新しい多面的総合評価フレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-02T19:41:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。