論文の概要: FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification
- arxiv url: http://arxiv.org/abs/2604.04074v1
- Date: Sun, 05 Apr 2026 11:45:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.904179
- Title: FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification
- Title(参考訳): FactReview:Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification
- Abstract要約: 本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
- 参考スコア(独自算出の注目度): 55.1206171151332
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Peer review in machine learning is under growing pressure from rising submission volume and limited reviewer time. Most LLM-based reviewing systems read only the manuscript and generate comments from the paper's own narrative. This makes their outputs sensitive to presentation quality and leaves them weak when the evidence needed for review lies in related work or released code. We present FactReview, an evidence-grounded reviewing system that combines claim extraction, literature positioning, and execution-based claim verification. Given a submission, FactReview identifies major claims and reported results, retrieves nearby work to clarify the paper's technical position, and, when code is available, executes the released repository under bounded budgets to test central empirical claims. It then produces a concise review and an evidence report that assigns each major claim one of five labels: Supported, Supported by the paper, Partially supported, In conflict, or Inconclusive. In a case study on CompGCN, FactReview reproduces results that closely match those reported for link prediction and node classification, yet also shows that the paper's broader performance claim across tasks is not fully sustained: on MUTAG graph classification, the reproduced result is 88.4%, whereas the strongest baseline reported in the paper remains 92.6%. The claim is therefore only partially supported. More broadly, this case suggests that AI is most useful in peer review not as a final decision-maker, but as a tool for gathering evidence and helping reviewers produce more evidence-grounded assessments. The code is public at https://github.com/DEFENSE-SEU/Review-Assistant.
- Abstract(参考訳): 機械学習におけるピアレビューは、提出量の増加とレビュアー時間の制限によるプレッシャーが増大している。
LLMベースのレビューシステムのほとんどは、原稿のみを読み、論文自身の物語からコメントを生成する。
これにより、アウトプットはプレゼンテーションの品質に敏感になり、レビューに必要な証拠が関連する作業やリリースコードにある場合に弱くなる。
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは、提出された投稿によって、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能になったら、中央実証的なクレームをテストするために、制限付き予算の下でリリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
CompGCN のケーススタディでは、FactReview はリンク予測やノード分類と密接に一致した結果を再現しているが、MUTAG グラフ分類では、再現結果は 88.4% であり、論文で報告された最強のベースラインは92.6% である。
そのため、この主張は部分的にしか支持されていない。
より広い範囲において、このケースは、AIが最終的な意思決定者ではなく、証拠を集め、レビュアーがより証拠に基づいて評価を行うのを助けるツールとしてピアレビューにおいて最も有用であることを示唆している。
コードはhttps://github.com/DEFENSE-SEU/Review-Assistantで公開されている。
関連論文リスト
- ReGround: Grounding Reviewer Comments in Multimodal Evidence [65.14860452709777]
レビューアのコメントは、レビューされた論文の特定の部分に自然に関連付けるが、長いマルチモーダル文書のために、これらのコメントを根底にある証拠に根拠付けることは困難である。
このデータセットは、レビュアーのコメントを10,267件と16,274件の証拠を3,656件の匿名の論文に関連付けている。
その結果,論文内容全体の検索は不十分であり,エビデンス型推論は大きなボトルネックであり,マルチモーダルなエビデンスによってテキストのみが見逃す補完的な信号が得られていることがわかった。
論文 参考訳(メタデータ) (2026-09-10T12:32:58Z) - ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation [54.82704239643649]
本稿では, 紙固有の診断と具体的, 基礎的なリビジョン計画とを結びつける, 反感に満ちたポストトレーニングフレームワークである ActReview を紹介する。
我々の中心的な洞察は、著者の反論は、レビュアーの懸念に対処するための妥当な行動を明らかにし、それゆえ、リビジョン指向のフィードバックに対する潜在的な監督を提供することができるということである。
またActReview-Benchは、診断品質とリビジョンの有用性を評価するために、1,000インスタンスの人為的なベンチマークである。
論文 参考訳(メタデータ) (2026-09-08T17:30:16Z) - From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review [2.531440973296736]
このビジョンとプロトコルペーパーは、コードファーストピアレビューを提案する。
著者は、実行可能な研究成果物と最小限のクレームマニフェストを提出する。
会場に制御されたAIシステムは環境を構築し、実験を実行し、コードパスを監査し、証拠のクレームをマップし、人間レビュアーのための標準化されたレビューパッケージを生成する。
論文 参考訳(メタデータ) (2026-06-05T01:26:07Z) - Peerispect: Claim Verification in Scientific Peer Reviews [12.340116689292726]
Peerispectは、ピアレビューでクレームレベルの検証を運用するインタラクティブシステムである。
結果は、論文のエビデンスを直接ハイライトするビジュアルインターフェースを通じて提示される。
論文 参考訳(メタデータ) (2026-04-19T23:40:26Z) - ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents [50.27474750319121]
公式ガイドライン、論文の内容、人間によるレビューから派生した、紙固有のルーリックに従ってテキストをレビューする。
本稿では、公式ガイドライン、論文の内容、人手によるレビューに基づいて、レビューテキストを評価するベンチマークであるREVIEWBENCHを紹介する。
本稿では,レビューを起草段階と接地段階に分解するルーリック誘導ツール統合マルチエージェントフレームワークであるREVIEWGROUNDERを提案する。
論文 参考訳(メタデータ) (2026-04-15T16:33:04Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - RIGOURATE: Quantifying Scientific Exaggeration with Evidence-Aligned Claim Evaluation [29.44948404858214]
RIGOURATEは、紙の本体から証拠を回収し、各クレームにオーバーステートメントスコアを割り当てる。
このフレームワークは、ICLRとNeurIPSの論文から10K以上のクレームエビデンスセットのデータセットで構成されている。
論文 参考訳(メタデータ) (2026-01-07T19:36:08Z) - Incremental Extractive Opinion Summarization Using Cover Trees [81.59625423421355]
オンラインマーケットプレースでは、ユーザレビューは時間とともに蓄積され、意見要約を定期的に更新する必要がある。
本研究では,漸進的な環境下での抽出的意見要約の課題について検討する。
本稿では,CentroidRankの要約をインクリメンタルな設定で正確に計算するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-01-16T02:00:17Z) - When Reviewers Lock Horn: Finding Disagreement in Scientific Peer
Reviews [24.875901048855077]
本稿では,ある記事のレビュアー間での矛盾を自動的に識別する新しいタスクを紹介する。
我々の知識を最大限に活用するために、ピアレビュアー間での意見の不一致を自動的に識別する最初の試みを行う。
論文 参考訳(メタデータ) (2023-10-28T11:57:51Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - Assessing Effectiveness of Using Internal Signals for Check-Worthy Claim
Identification in Unlabeled Data for Automated Fact-Checking [6.193231258199234]
本稿では,偽ニュース記事からチェック価値のあるクレーム文を特定する手法について検討する。
我々は2つの内部監督信号(見出しと抽象的な要約)を利用して文をランク付けする。
見出しは、ファクトチェックのWebサイトがクレームを記述する方法とよく似ているが、要約ベースのパイプラインは、エンドツーエンドのファクトチェックシステムにとって最も有望である。
論文 参考訳(メタデータ) (2021-11-02T16:17:20Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。