論文の概要: Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review
- arxiv url: http://arxiv.org/abs/2607.22553v1
- Date: Sat, 16 May 2026 02:12:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.959886
- Title: Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review
- Title(参考訳): LLMによる自動ピアレビューにおけるレビュアガイドライン設計の影響評価
- Abstract要約: 我々は、公式カンファレンスガイドラインやレビュア模倣ガイドラインなど、さまざまなタイプのレビュアガイドラインが、自動ピアレビューにどのように影響するかを分析する。
実験の結果, 公式の会議ガイドラインでは, 人的判断と最も一致したレビュー結果が得られた。
対照的に、レビュアー模倣ガイドラインは、公式のカンファレンスガイドラインよりも一般的には効果が低かった。
- 参考スコア(独自算出の注目度): 6.23695451268052
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Peer review is an essential process in scientific research, yet the growing workload has made its automation increasingly necessary. In this study, we analyze how different types of reviewer guidelines, such as official conference guidelines and reviewer-imitating ones generated from high-quality human reviews using LLMs, affect automated peer review. Our experiments show that official conference guidelines produce review results most consistent with human judgments, suggesting that evaluation criteria refined through conference practice serve as effective guidance for automated reviewing as well. In contrast, reviewer-imitating guidelines were generally less effective than official conference guidelines. Furthermore, enforcing strict rubric-style scoring consistently degraded performance, highlighting the importance of allowing subjective and holistic scoring.
- Abstract(参考訳): ピアレビューは科学研究に欠かせないプロセスだが、作業負荷の増加により自動化の必要性はますます高まっている。
本研究では,LSMを用いた高品質な人間レビューから生成された公式の会議ガイドラインやレビュア模倣ガイドラインなど,さまざまなタイプのレビュアガイドラインが,自動ピアレビューにどのように影響するかを分析する。
本実験は, 人的判断に最も整合したレビュー結果が得られたことを示し, 評価基準の整備が, 自動レビューの効果的な指針となることを示唆している。
対照的に、レビュアー模倣ガイドラインは、公式のカンファレンスガイドラインよりも一般的には効果が低かった。
さらに、厳格なルーリックスタイルのスコアリングを強制することは、主観的および全体的なスコアリングを可能にすることの重要性を強調し、一貫してパフォーマンスを低下させた。
関連論文リスト
- ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation [54.82704239643649]
本稿では, 紙固有の診断と具体的, 基礎的なリビジョン計画とを結びつける, 反感に満ちたポストトレーニングフレームワークである ActReview を紹介する。
我々の中心的な洞察は、著者の反論は、レビュアーの懸念に対処するための妥当な行動を明らかにし、それゆえ、リビジョン指向のフィードバックに対する潜在的な監督を提供することができるということである。
またActReview-Benchは、診断品質とリビジョンの有用性を評価するために、1,000インスタンスの人為的なベンチマークである。
論文 参考訳(メタデータ) (2026-09-08T17:30:16Z) - From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - EchoReview: Learning Peer Review from the Echoes of Scientific Citations [48.852960317704486]
EchoReviewは引用コンテキスト駆動のデータ合成フレームワークである。
科学界の長期的な判断を構造化されたレビュースタイルのデータに変換する。
これは、エビデンスのサポートや包括的なレビューのような中核的なレビューの側面において、大きく安定した改善を達成できます。
論文 参考訳(メタデータ) (2026-01-31T13:55:38Z) - Insights from the ICLR Peer Review and Rebuttal Process [11.96840383745149]
ICLR 2024と2025のピアレビュープロセスを大規模に分析する。
本研究は,レビュースコア,著者-レビューアテンション,レビュー提出時の時間的パターン,共同レビューアの影響について検討する。
この結果から,初回評価と共同視聴者の評価が,報奨期間における得点変化の予測因子として最強であることが示唆された。
論文 参考訳(メタデータ) (2025-11-19T14:21:52Z) - LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation [41.42324204820521]
本研究は,ゲーム理論の原理が大規模言語モデル(LLM)の評価に効果的に適用できるかどうかを考察する。
そこで我々は,LLMが自己再生とピアレビューを通じて相互の出力を評価できる新しい代替案を提案する。
本フレームワークでは,ゲーム理論の投票アルゴリズムを組み込んでピアレビューを集約し,モデル生成ランキングが人間の嗜好を反映するかどうかを原則的に調査する。
論文 参考訳(メタデータ) (2025-10-17T15:34:25Z) - When Your Reviewer is an LLM: Biases, Divergence, and Prompt Injection Risks in Peer Review [34.067892820832405]
本稿では,学術レビュアーとして大規模言語モデル(LLM)を体系的に評価する。
ICLR 2023とNeurIPS 2022の1,441論文のキュレートされたデータセットを用いて、評価、強度、弱点を越えて、GPT-5-miniをヒトレビュアーに対して評価した。
以上の結果から, LLMは, より弱い論文に対する評価を一貫して向上させつつ, より強いコントリビューションに対する人間の判断と密に一致させることが示唆された。
論文 参考訳(メタデータ) (2025-09-12T00:57:50Z) - ReviewEval: An Evaluation Framework for AI-Generated Reviews [9.35023998408983]
学術研究の増大は、資格のあるレビュアーの不足と相まって、ピアレビューに対する革新的なアプローチを必要としている。
本稿では,AIによるレビューを総合的に評価するフレームワークであるReviewEvalを提案する。
本稿では、AIに基づくピアレビューに不可欠な指標を確立し、学術研究におけるAI生成レビューの信頼性と影響を大幅に向上させる。
論文 参考訳(メタデータ) (2025-02-17T12:22:11Z) - Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators [48.54465599914978]
大規模言語モデル(LLM)は、生成された自然言語の品質を評価するための自動評価器として有望な能力を示した。
LLMは依然として評価のバイアスを示しており、人間の評価と整合したコヒーレントな評価を生成するのに苦労することが多い。
Pairwise-preference Search (PAIRS) は、LLMを用いた不確実性誘導検索に基づくランクアグリゲーション手法で、局所的にペアワイズ比較を行い、グローバルに候補テキストを効率よくランク付けする。
論文 参考訳(メタデータ) (2024-03-25T17:11:28Z) - Ranking Scientific Papers Using Preference Learning [48.78161994501516]
我々はこれをピアレビューテキストとレビュアースコアに基づく論文ランキング問題とみなした。
ピアレビューに基づいて最終決定を行うための,新しい多面的総合評価フレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-02T19:41:47Z) - A Novice-Reviewer Experiment to Address Scarcity of Qualified Reviewers
in Large Conferences [35.24369486197371]
主要なAIカンファレンスから受け取った応募数の増加は、レビュープロセスの持続可能性に挑戦している。
我々は,大規模なカンファレンスにおけるレビュアーの資格不足に着目して,レビュアー採用の問題を考える。
大規模でトップクラスの機械学習カンファレンスであるICML 2020と合わせて、私たちの手順を通じて少数のレビュアーを募集し、ICMLレビュアーの一般人口と比較します。
論文 参考訳(メタデータ) (2020-11-30T17:48:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。