論文の概要: AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification
- arxiv url: http://arxiv.org/abs/2607.27845v1
- Date: Thu, 30 Jul 2026 08:24:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.460558
- Title: AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification
- Title(参考訳): AutoSupervision: 根拠付きリビジョン検証による科学ワークフローのフィードバックループのクローズ
- Authors: Haobo Li, Eunseo Jung, Wenxiao Zhao, Feng Liu, Jiong Wang, Kaiyi Xu, Zijie Guo, Zixin Chen, Ben Fei, Fenghua Ling, Lei Bai,
- Abstract要約: 本稿では,論文の改訂がレビュアーの懸念に真に対処するかどうかを評価するAutoSupervisionを紹介する。
我々は56,000のNature Communications記事とそれに対応するレビュー記録からAutoSupervisionを構築した。
以上の結果から,LLMはレビュアーの関心事の特徴として優れているが,エビデンスに基づく検証が主要なボトルネックであることが示唆された。
- 参考スコア(独自算出の注目度): 26.43951827696846
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in large language models (LLMs) have enabled AI systems to assist scientific research and peer review. However, an essential capability for reliable AI-assisted scientific workflows remains underexplored: verifying whether reviewer feedback leads to meaningful and evidence-supported manuscript improvements. We introduce AutoSupervision, which evaluates whether scientific manuscript revisions genuinely address reviewer concerns through grounded evidence. AutoSupervision leverages transparent peer-review records as a natural source of supervision, where reviewer comments specify scientific concerns, author responses describe claimed resolutions, and revised manuscripts provide evidence of changes. Given reviewer comments, author responses, and revised manuscripts, models must characterize reviewer concerns, determine whether concerns have been addressed, and identify supporting manuscript evidence. We construct AutoSupervision from 56,000 Nature Communications articles and corresponding review records. Then we conducted experiments on LLMs, the ablation study, and the case study. Our results show that while LLMs perform well in characterizing reviewer concerns, with GPT-5.5 achieving a score of 0.754, evidence-based verification remains the primary bottleneck, with the best-performing model reaching only 0.501.
- Abstract(参考訳): 大規模言語モデル(LLM)の最近の進歩により、AIシステムは科学研究やピアレビューを支援することができるようになった。
しかし、信頼できるAI支援科学ワークフローにとって不可欠な能力は、レビューアのフィードバックが有意義でエビデンスに支えられた原稿の改善につながるかどうかを検証することである。
本稿では,学術写本の改訂が,根拠的証拠を通じてレビュー担当者の懸念に真に対処するかどうかを評価するAutoSupervisionを紹介する。
AutoSupervisionは、透明なピアレビュー記録を自然の監視源として活用し、レビュアーのコメントは科学的な懸念を規定し、著者の反応は要求された解決を記述し、改訂された原稿は変更の証拠を提供する。
レビューアのコメント、著者の反応、改訂された原稿が与えられた場合、モデルはレビューアの懸念を特徴づけ、懸念が解決されたかどうかを判断し、支援された原稿の証拠を特定する必要がある。
我々は56,000のNature Communications記事とそれに対応するレビュー記録からAutoSupervisionを構築した。
次に, LLM, アブレーション研究, ケーススタディについて実験を行った。
GPT-5.5は0.754のスコアを得たが、証拠に基づく検証は主要なボトルネックであり、最高の性能モデルは0.501に留まった。
関連論文リスト
- From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing [0.0]
Peer Review AI Benchmark (PRAIB)は、レビューの具体性、スタイル、エンゲージメントの振る舞いを測定する、徹底的に定義されたメトリクスで構成されるフレームワークである。
我々は、1000 ICLRおよびNeurIPSの論文に対して、5つのプロプライエタリおよびオープンソースモデルによって生成される11,000のレビューのデータセットを活用する大規模な実証的研究を行う。
分析の結果,人的レビュアーのフィードバックから生成したレビューが著しく逸脱していることが判明した。
論文 参考訳(メタデータ) (2026-05-28T11:59:54Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models [1.8349858105838042]
大規模言語モデルは汎用的な汎用タスクソルバであり、その能力は学術的にピアレビューを行う人たちをテキストプレビューエージェントとして真に支援することができる。
非常に有益ではあるが、学術的ピアレビューの自動化は、概念として、安全性、研究の完全性、学術的ピアレビュープロセスの妥当性に関する懸念を提起する。
論文 参考訳(メタデータ) (2025-12-14T09:56:07Z) - ReviewGuard: Enhancing Deficient Peer Review Detection via LLM-Driven Data Augmentation [3.9199635838637072]
ReviewGuardは、欠陥レビューを検出して分類する自動化システムである。
最終コーパスは6,634枚、実際のレビュー24,657枚、合成レビュー46,438枚である。
不十分なレビューでは、評価スコアの低下、自己報告の信頼性の向上、構造的な複雑さの低減、ネガティブな感情の比率の向上が示されています。
論文 参考訳(メタデータ) (2025-10-18T15:45:26Z) - LiRA: A Multi-Agent Framework for Reliable and Readable Literature Review Generation [66.09346158850308]
文献レビュープロセスをエミュレートする多エージェント協調ワークフローLiRA(Literature Review Agents)を提案する。
LiRAは、コンテンツアウトライン、サブセクションの執筆、編集、レビュー、コヒーシブで包括的なレビュー記事の作成に特殊エージェントを使用している。
実世界のシナリオにおいて文書検索を用いてLiRAを評価し,そのロバスト性を評価する。
論文 参考訳(メタデータ) (2025-10-01T12:14:28Z) - Unveiling the Merits and Defects of LLMs in Automatic Review Generation for Scientific Papers [4.455306283717651]
科学論文の急増は、従来のピアレビュープロセスに緊張を増している。
本稿では,意味的類似性分析と構造化知識グラフメトリクスを統合した総合評価フレームワークを提案する。
ICLRとNeurIPSによる1,683の論文と6,495の専門家レビューのベンチマークを数年間にわたって構築し、5つの大きな言語モデルを用いてレビューを生成する。
論文 参考訳(メタデータ) (2025-09-13T19:15:22Z) - Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework [55.078301794183496]
我々は、高品質なピアレビューを支えるコアレビュースキル、すなわち欠陥のある研究ロジックの検出に注力する。
これは、論文の結果、解釈、クレームの間の内部の一貫性を評価することを含む。
本稿では,このスキルを制御条件下で分離し,テストする,完全自動対物評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-29T08:48:00Z) - Usefulness of LLMs as an Author Checklist Assistant for Scientific Papers: NeurIPS'24 Experiment [59.09144776166979]
大規模言語モデル(LLM)は、科学的ピアレビューを支援する上で有望だが議論の余地のあるツールである。
本研究は,論文提出を提出基準に適合させるツールとして,会議環境におけるLCMの有用性を評価する。
論文 参考訳(メタデータ) (2024-11-05T18:58:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。