論文の概要: ReviewGuard: Aligning LLM-Assisted Peer Review with Long-Term Scientific Impact
- arxiv url: http://arxiv.org/abs/2606.24892v1
- Date: Fri, 29 May 2026 02:05:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.57497
- Title: ReviewGuard: Aligning LLM-Assisted Peer Review with Long-Term Scientific Impact
- Title(参考訳): ReviewGuard: LLM支援ピアレビューの長期的影響
- Abstract要約: ReviewGuardは、2段階のフレームワークで、LLMの生成したレビューと長期の科学的影響の引用に基づく見積もりを一致させる。
OpenReviewの20,861のAI/ML論文で、ReviewGuardは、Rho = 0.776のスピアマン相関と、辞退した論文の今後の引用を達成している。
この結果から,人的判断を置き換えることなく,高能率作業を特定するための補完的なシグナルを編集者に提供できることが示唆された。
- 参考スコア(独自算出の注目度): 17.218230815053683
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Peer review is central to scientific quality control, yet it can undervalue papers that later achieve substantial citation impact. While frontier large language models have shown promise in automating aspects of peer review, they primarily mimic human reviewer preferences rather than predict long-term scientific value. We introduce ReviewGuard, a two-stage framework that aligns LLM-generated reviews with citation-based estimates of long-term scientific impact rather than contemporaneous reviewer judgments. On 20,861 AI/ML papers from OpenReview augmented with Semantic Scholar citation data, ReviewGuard achieves a Spearman correlation of \r{ho} = 0.776 with future citations on rejected-then-published papers, outperforming human reviewers (\r{ho} = 0.492) and a supervised Expert model (\r{ho} = 0.681). Under the same decision threshold, ReviewGuard flags 10.2% of high-impact rejected papers, compared with 1.8% for human reviewers, corresponding to a 5.6x improvement. Our results demonstrate that impact-aligned reinforcement learning can provide editors with a complementary signal for identifying high-potential work, without replacing human judgment.
- Abstract(参考訳): ピアレビューは科学的な品質管理の中心であるが、後にかなりの引用効果をもたらす論文を過小評価することができる。
フロンティアの大規模言語モデルはピアレビューの自動化において有望であることを示しているが、それらは主に長期的な科学的価値を予測するのではなく、人間のレビュアーの好みを模倣している。
本稿では,LLM生成レビューを同時審査者判断ではなく,引用に基づく長期科学的影響の推定と整合する2段階のフレームワークであるReviewGuardを紹介する。
OpenReviewの20,861件のAI/ML論文にSemantic Scholar citation dataを付加し、ReviewGuardは \r{ho} = 0.776 のスピアマン相関を達成し、削除された論文の今後の引用、人間レビュアーのパフォーマンス(\r{ho} = 0.492)、教師付きエキスパートモデル(\r{ho} = 0.681)を達成している。
同じ判断基準の下では、ReviewGuardはハイインパクトな論文の10.2%をフラグ付けし、人間レビュアーの1.8%は5.6倍の改善に対応している。
この結果から,人的判断を置き換えることなく,高能率作業を特定するための補完的なシグナルを編集者に提供できることが示唆された。
関連論文リスト
- From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - EchoReview: Learning Peer Review from the Echoes of Scientific Citations [48.852960317704486]
EchoReviewは引用コンテキスト駆動のデータ合成フレームワークである。
科学界の長期的な判断を構造化されたレビュースタイルのデータに変換する。
これは、エビデンスのサポートや包括的なレビューのような中核的なレビューの側面において、大きく安定した改善を達成できます。
論文 参考訳(メタデータ) (2026-01-31T13:55:38Z) - Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models [1.8349858105838042]
大規模言語モデルは汎用的な汎用タスクソルバであり、その能力は学術的にピアレビューを行う人たちをテキストプレビューエージェントとして真に支援することができる。
非常に有益ではあるが、学術的ピアレビューの自動化は、概念として、安全性、研究の完全性、学術的ピアレビュープロセスの妥当性に関する懸念を提起する。
論文 参考訳(メタデータ) (2025-12-14T09:56:07Z) - ReviewGuard: Enhancing Deficient Peer Review Detection via LLM-Driven Data Augmentation [3.9199635838637072]
ReviewGuardは、欠陥レビューを検出して分類する自動化システムである。
最終コーパスは6,634枚、実際のレビュー24,657枚、合成レビュー46,438枚である。
不十分なレビューでは、評価スコアの低下、自己報告の信頼性の向上、構造的な複雑さの低減、ネガティブな感情の比率の向上が示されています。
論文 参考訳(メタデータ) (2025-10-18T15:45:26Z) - When Your Reviewer is an LLM: Biases, Divergence, and Prompt Injection Risks in Peer Review [34.067892820832405]
本稿では,学術レビュアーとして大規模言語モデル(LLM)を体系的に評価する。
ICLR 2023とNeurIPS 2022の1,441論文のキュレートされたデータセットを用いて、評価、強度、弱点を越えて、GPT-5-miniをヒトレビュアーに対して評価した。
以上の結果から, LLMは, より弱い論文に対する評価を一貫して向上させつつ, より強いコントリビューションに対する人間の判断と密に一致させることが示唆された。
論文 参考訳(メタデータ) (2025-09-12T00:57:50Z) - Beyond "Not Novel Enough": Enriching Scholarly Critique with LLM-Assisted Feedback [81.0031690510116]
本稿では,3段階を通して専門家レビューアの動作をモデル化する,自動ノベルティ評価のための構造化アプローチを提案する。
本手法は,人文のノベルティレビューを大規模に分析した結果から得られたものである。
182 ICLR 2025 の提出で評価されたこの手法は、人間の推論と86.5%の一致と、新規性の結論に関する75.3%の合意を達成している。
論文 参考訳(メタデータ) (2025-08-14T16:18:37Z) - Paper Quality Assessment based on Individual Wisdom Metrics from Open Peer Review [4.35783648216893]
従来のクローズドピアレビューシステムは遅く、コストがかかり、透明ではない。
我々は、オープンなボトムアッププロセスを通じて、科学的ピアレビューの代替形態の有効性と正確性を提案し、検証する。
論文 参考訳(メタデータ) (2025-01-22T17:00:27Z) - Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review [66.73247554182376]
大規模言語モデル(LLM)がピアレビューに統合された。
未確認のLLMの採用は、ピアレビューシステムの完全性に重大なリスクをもたらす。
5%のレビューを操作すれば、論文の12%が上位30%のランキングでその地位を失う可能性がある。
論文 参考訳(メタデータ) (2024-12-02T16:55:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。