論文の概要: AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality
- arxiv url: http://arxiv.org/abs/2608.03581v1
- Date: Tue, 04 Aug 2026 12:34:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.190464
- Title: AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality
- Title(参考訳): AI支援ピアレビュー 研究コミュニティ全体で:レビュアAIポリシからLLMレビュー品質まで
- Authors: Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber, Kryštof Olík, Georg Groh,
- Abstract要約: 我々は、主要なAI/NLPカンファレンスと医療雑誌111社を対象に、レビュアーが直面するAIポリシーを調査した。
ICLR 2026とNature CommunicationsのAI生成ピアレビューを,新しいデータセットを用いて評価した。
- 参考スコア(独自算出の注目度): 39.33746637947531
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: AI-assisted peer review is increasingly discussed and adopted as a tool to support the scientific publishing process, yet there is little systematic understanding of how publication venues regulate its use or of how capable current AI review systems are. We address these questions by first surveying reviewer-facing AI policies across 111 leading AI/NLP conferences and medical journals, revealing substantial regulation differences between the two communities. Second, we evaluate AI-generated peer reviews at ICLR 2026 and Nature Communications using a novel dataset comprising original manuscript submissions and several hundred human- and machine-generated reviews. We compare reviews produced by open-source and proprietary models using complementary evaluation metrics, including LLM-as-a-Judge, score alignment, granularity, and overlap with human reviewers' concerns. Our results show that current LLMs can generate detailed and fluent reviews but exhibit systematic weaknesses, such as overly positive recommendations, generic criticism, and uneven evidence grounding. We demonstrate that aggregate quality scores alone can overestimate review quality and argue for multi-dimensional evaluation of AI-generated peer reviews.
- Abstract(参考訳): AI支援のピアレビューは、科学出版プロセスをサポートするツールとして議論され、採用されているが、パブリッシング会場がその使用を規制するか、現在のAIレビューシステムがどの程度有能であるかについて、体系的な理解はほとんどない。
AI/NLPカンファレンスとメディカルジャーナルの111件を対象に、レビュアーが直面するAIポリシーを初めて調査し、この2つのコミュニティ間の実質的な規制の違いを明らかにすることで、これらの疑問に対処する。
第2に,AIによるピアレビューをICLR 2026とNature Communicationsで評価する。
LLM-as-a-Judge,スコアアライメント,粒度,人間の関心事との重なり合いなど,補完的な評価指標を用いたオープンソースモデルとプロプライエタリモデルによるレビューを比較した。
以上の結果から,現在のLCMは詳細なレビューを生成できるが,過剰な肯定的勧告や総称的批判,不均一な証拠など,体系的な弱点を呈する可能性が示唆された。
集約された品質スコアだけでレビュー品質を過大評価でき、AI生成されたピアレビューの多次元評価を議論できることを示す。
関連論文リスト
- When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - AI-Assisted Peer Review at Scale: The AAAI-26 AI Review Pilot [45.90272517740283]
本稿では,AI支援ピアレビューの大規模展開について報告する。
AAAI-26のすべてのメイントラックは、最先端のシステムから明確に特定されたAIレビューを受け取りました。
論文 参考訳(メタデータ) (2026-04-15T14:51:07Z) - CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review Detection [60.52240468810558]
我々は、AI生成ピアレビューの詳細なデータセットの上に構築されたコンテンツ指向ベンチマークであるCoCoNUTSを紹介する。
また、マルチタスク学習フレームワークを介してAIレビュー検出を行うCoCoDetを開発し、レビューコンテンツにおけるAIのより正確で堅牢な検出を実現する。
論文 参考訳(メタデータ) (2025-08-28T06:03:11Z) - The AI Imperative: Scaling High-Quality Peer Review in Machine Learning [49.87236114682497]
AIによるピアレビューは、緊急の研究とインフラの優先事項になるべきだ、と私たちは主張する。
我々は、事実検証の強化、レビュアーのパフォーマンスの指導、品質改善における著者の支援、意思決定におけるAC支援におけるAIの具体的な役割を提案する。
論文 参考訳(メタデータ) (2025-06-09T18:37:14Z) - Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review [6.20631177269082]
ピアレビュープロセスに対する新たなリスクは、Negligentレビュアーが論文をレビューするために大きな言語モデル(LLM)に依存することだ。
我々は、AIで書かれたピアレビューを、対応する人間のレビューと組み合わせた合計788,984件の包括的データセットを導入する。
我々は、この新たなリソースを使用して、既存の18のAIテキスト検出アルゴリズムが、人間が完全に書いたピアレビューと、最先端のLLMを区別する能力を評価する。
論文 参考訳(メタデータ) (2025-02-26T23:04:05Z) - ReviewEval: An Evaluation Framework for AI-Generated Reviews [9.35023998408983]
学術研究の増大は、資格のあるレビュアーの不足と相まって、ピアレビューに対する革新的なアプローチを必要としている。
本稿では,AIによるレビューを総合的に評価するフレームワークであるReviewEvalを提案する。
本稿では、AIに基づくピアレビューに不可欠な指標を確立し、学術研究におけるAI生成レビューの信頼性と影響を大幅に向上させる。
論文 参考訳(メタデータ) (2025-02-17T12:22:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。