論文の概要: Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
- arxiv url: http://arxiv.org/abs/2607.15388v1
- Date: Thu, 16 Jul 2026 18:38:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.681396
- Title: Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
- Title(参考訳): 正確だが未解決:マルチエージェントの数学的推論において、レビュアーの精度は批判の獲得を保証しない
- Authors: Chih-Hsuan Yang, Jingyan Jiang, Vikram Vasudevan, Cheng-Hau Yang, Huihuo Zheng, Le Chen, Eliu A. Huerta, Venkatram Vishwanath, Ian T. Foster, Rajeev Thakur,
- Abstract要約: 私たちは、専用のレビューステージが間違った候補を正しい候補に変えるのに役立つという仮定をテストします。
我々は、このギャップがレビュアーの品質によって説明されるのか、それともプロトコルが進める次の回答に批判が変わるのかを問う。
- 参考スコア(独自算出の注目度): 9.345403722854543
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many math- and science-oriented agent systems use hierarchical designs with specialized reviewer roles, assuming that a dedicated review stage should help turn wrong candidates into correct ones. We test this assumption on 4,181 verifier-grounded Omni-MATH problems using matched gpt-oss-120b actors. Collaboration adds little on the easiest tiers, but from tier 4 onward the gains open sharply; in this harder regime, broadcast-style peer discussion reaches higher final accuracy than a planner-executor-reviewer pipeline (PER). We ask whether this gap is explained by reviewer quality or by whether critique changes the next answer the protocol carries forward. It is not explained by reviewer precision alone: PER's reviewer is more precise than broadcast's (0.861 vs. 0.644), yet evaluator-verified useful critique is much less likely to change the next candidate and produces lower reviewer-guided repair. These results show that reviewer detection quality and critique uptake are empirically separable. Within matched PER interventions, forcing explicit acknowledgment lowers final accuracy, while embedding reviewer guidance directly in the solver's working context partially improves follow-through without closing the gap. Overall, reviewer-centric evaluation can overstate system quality: a protocol may spot errors well yet still fail to solve more problems if it does not act on those critiques.
- Abstract(参考訳): 多くの数学および科学指向のエージェントシステムは、専用のレビューステージが間違った候補を正しい候補に変えるのに役立つと仮定して、特定のレビュアーの役割を持つ階層的な設計を使用する。
一致したgpt-oss-120bアクターを用いて,4,181個の検証器付きOmni-MATH問題に対して,この仮定を検証した。
コラボレーションは最も簡単な層にはほとんど加わらないが、第4層以降は利得が急激に開かれ、放送スタイルのピアディスカッションはプランナー・エグゼクタ・リビューア・パイプライン(PER)よりも高い最終精度に達する。
我々は、このギャップがレビュアーの品質によって説明されるのか、それともプロトコルが進める次の回答に批判が変わるのかを問う。
PERのレビュアーは放送より正確である(0.861対0.644)が、評価者によって検証された有用な批評は、次の候補を変更する可能性が低く、レビュアーが指導する修理が低くなる。
これらの結果から,レビュアー検出品質と批判的取り込みは実験的に分離可能であることが示された。
一致したPER介入では、明示的な承認を強制することで最終的な精度が低下する一方、レビュアーガイダンスを解決者の作業コンテキストに直接埋め込むことで、ギャップを埋めることなく、部分的に改善する。
全体としては、レビュア中心の評価はシステム品質を過大評価することができる。
関連論文リスト
- Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews [37.684628465527545]
我々は、Kahnemanの二重プロセス理論をピアレビューとリリースのための構造化ルーリックとして運用する。
評価基準は3,563で、理論的に動機付けられた9つのテキスト次元、8つのバイアス診断、連続的推論品質スコアで評価された。
論文 参考訳(メタデータ) (2026-07-12T00:03:42Z) - Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes [0.0]
大規模言語モデル(LLM)システムは、ピアレビューを支援するためにますます提案されている。
ほとんどの評価は、システムが割り当てる数値スコアの妥当性ではなく、機械生成レビューテキストの散文を判断する。
提案した原稿を読み取って5つの0-100品質ディメンションと重み付き総合スコアを出力するAIPRを検証する。
論文 参考訳(メタデータ) (2026-06-14T16:13:15Z) - CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers [39.97153044457166]
カテゴリ固有のベンチマークサブセットを構築し、人間のレビューが欠落している場合に評価をスキップし、完全性を強化します。
また、専門家のアノテーションとしてレビュアー-著者-レビューの議論を活用し、正確性を強化するために信頼できないレビューをフィルタリングします。
CoCoReviewBenchは、ICLRとNeurIPSから3,900の論文をキュレーションして、AIレビュアーの信頼性ときめ細かい評価を可能にする。
論文 参考訳(メタデータ) (2026-05-08T15:44:26Z) - Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents [6.158612515104146]
エージェントフィードバックとレビュアーフィードバックのトレードオフを測定するために、ヘルプフルネス・ハームフルネスメトリクスを導入します。
我々はBFCLとTau2-Bench(マルチターンステートフルシナリオ)に対するアプローチを評価し、無関係検出では+5.5%、マルチターンタスクでは+7.1%を達成した。
GPT-4oでは,評価モデルo3-miniが3:1の利益率と2.1:1の利益率を達成した。
論文 参考訳(メタデータ) (2026-04-29T22:09:47Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - LazyReview A Dataset for Uncovering Lazy Thinking in NLP Peer Reviews [74.87393214734114]
この研究は、微粒な遅延思考カテゴリで注釈付けされたピアレビュー文のデータセットであるLazyReviewを紹介している。
大規模言語モデル(LLM)は、ゼロショット設定でこれらのインスタンスを検出するのに苦労する。
命令ベースのデータセットの微調整により、パフォーマンスが10~20ポイント向上する。
論文 参考訳(メタデータ) (2025-04-15T10:07:33Z) - Paper Quality Assessment based on Individual Wisdom Metrics from Open Peer Review [4.35783648216893]
従来のクローズドピアレビューシステムは遅く、コストがかかり、透明ではない。
我々は、オープンなボトムアッププロセスを通じて、科学的ピアレビューの代替形態の有効性と正確性を提案し、検証する。
論文 参考訳(メタデータ) (2025-01-22T17:00:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。