論文の概要: ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation
- arxiv url: http://arxiv.org/abs/2609.09076v1
- Date: Tue, 08 Sep 2026 17:30:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 20:27:23.223138
- Title: ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation
- Title(参考訳): ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation
- Abstract要約: 本稿では, 紙固有の診断と具体的, 基礎的なリビジョン計画とを結びつける, 反感に満ちたポストトレーニングフレームワークである ActReview を紹介する。
我々の中心的な洞察は、著者の反論は、レビュアーの懸念に対処するための妥当な行動を明らかにし、それゆえ、リビジョン指向のフィードバックに対する潜在的な監督を提供することができるということである。
またActReview-Benchは、診断品質とリビジョンの有用性を評価するために、1,000インスタンスの人為的なベンチマークである。
- 参考スコア(独自算出の注目度): 54.82704239643649
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As LLMs are increasingly used for pre-submission self-review, there is growing demand for feedback that not only identifies weaknesses but also guides authors toward concrete revisions. We study this as Actionable Peer-review Generation and decompose it into two subtasks: diagnostic claim generation and revision suggestion generation. We introduce ActReview, a rebuttal-guided post-training framework that connects paper-specific diagnoses to concrete, grounded revision plans. Our central insight is that author rebuttals reveal plausible actions for addressing reviewer concerns and can therefore provide latent supervision for revision-oriented feedback. From real review-rebuttal threads on OpenReview, we construct ActReview-40K by aligning reviewer weaknesses with author responses and grounding the resulting feedback in localized paper evidence. We post-train Qwen3-8B-Base with multi-task supervised fine-tuning followed by GRPO using candidate-aware, weakness-specific rubric rewards. We also introduce ActReview-Bench, a human-curated benchmark of 1,000 instances for evaluating diagnostic quality and revision usefulness. Experiments show that ActReview outperforms prior specialized review-generation models on actionability and grounding while remaining competitive with strong prompt-based LLMs. Human evaluation confirms improved revision usefulness while revealing a remaining gap in technical accuracy, and additional analyses support generalization to held-out papers and robustness across independent judges.
- Abstract(参考訳): LLMは、受注前の自己レビューにますます使われているため、弱点を識別するだけでなく、具体的な修正に向けて著者を導くフィードバックの需要が高まっている。
本研究は,Actionable Peer-Review Generation として検討し,診断クレーム生成と修正提案生成の2つのサブタスクに分解する。
本稿では, 紙固有の診断と具体的, 基礎的なリビジョン計画とを結びつける, 反感に満ちたポストトレーニングフレームワークである ActReview を紹介する。
我々の中心的な洞察は、著者の反論は、レビュアーの懸念に対処するための妥当な行動を明らかにし、それゆえ、リビジョン指向のフィードバックに対する潜在的な監督を提供することができるということである。
OpenReviewの実際のリビュー・リビュースレッドから、リビューの弱点を著者の反応と整合させ、その結果のフィードバックをローカライズされた論文のエビデンスに根拠付けることにより、ActReview-40Kを構築する。
マルチタスクによる微調整を施したQwen3-8B-Baseの後, GRPOが候補認識, 弱点特異的なルーリック報酬を用いた。
またActReview-Benchは、診断品質とリビジョンの有用性を評価するために、1,000インスタンスの人為的なベンチマークである。
実験により、ActReviewは、強力なプロンプトベースのLLMと競争しながら、行動可能性と接地性に関する事前のレビュー世代モデルより優れていることが示された。
人的評価は、技術的精度の差が残りながら改善された修正有用性を確認し、追加分析は、独立した審査員間での保留書類の一般化と堅牢性をサポートする。
関連論文リスト
- More Criticism Does Not Make a Better Review: EquiReview-R [5.8331781561663645]
我々は、AI支援レビューを、構造化された関心事セットのエビデンスガイダンスによる洗練として再考した。
EquiReview-Rを導入し、局所的な証拠に対する既存の懸念を解決する。
未確認論文の凍結コホート上では、EquiReview-R は未定の非不等式基準を満たす。
論文 参考訳(メタデータ) (2026-09-03T14:49:24Z) - From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers [39.97153044457166]
カテゴリ固有のベンチマークサブセットを構築し、人間のレビューが欠落している場合に評価をスキップし、完全性を強化します。
また、専門家のアノテーションとしてレビュアー-著者-レビューの議論を活用し、正確性を強化するために信頼できないレビューをフィルタリングします。
CoCoReviewBenchは、ICLRとNeurIPSから3,900の論文をキュレーションして、AIレビュアーの信頼性ときめ細かい評価を可能にする。
論文 参考訳(メタデータ) (2026-05-08T15:44:26Z) - ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents [50.27474750319121]
公式ガイドライン、論文の内容、人間によるレビューから派生した、紙固有のルーリックに従ってテキストをレビューする。
本稿では、公式ガイドライン、論文の内容、人手によるレビューに基づいて、レビューテキストを評価するベンチマークであるREVIEWBENCHを紹介する。
本稿では,レビューを起草段階と接地段階に分解するルーリック誘導ツール統合マルチエージェントフレームワークであるREVIEWGROUNDERを提案する。
論文 参考訳(メタデータ) (2026-04-15T16:33:04Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation [47.274230235946625]
多くのAI生成レビューは表面的で不十分な実行可能であり、著者は具体的で実装可能なガイダンスを残さず、この作業が抱えるギャップを動機付けている。
本稿では,行動可能なレビューフィードバック生成を目的としたRbtActを提案し,既存のピアレビューを学習の中心に配置する。
論文 参考訳(メタデータ) (2026-03-10T14:30:55Z) - LazyReview A Dataset for Uncovering Lazy Thinking in NLP Peer Reviews [74.87393214734114]
この研究は、微粒な遅延思考カテゴリで注釈付けされたピアレビュー文のデータセットであるLazyReviewを紹介している。
大規模言語モデル(LLM)は、ゼロショット設定でこれらのインスタンスを検出するのに苦労する。
命令ベースのデータセットの微調整により、パフォーマンスが10~20ポイント向上する。
論文 参考訳(メタデータ) (2025-04-15T10:07:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。