論文の概要: How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review
- arxiv url: http://arxiv.org/abs/2608.08975v1
- Date: Mon, 10 Aug 2026 00:42:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.024886
- Title: How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review
- Title(参考訳): Rhetoric Reward-Hack AIレビュアーはどのようにしてレトリック・リワード・ハック・AIレビュアーにできるのか?
- Abstract要約: 報告された科学的内容が保存されている場合、修辞的選択がAIレビューの判断をどのように形成するかを検討する。
我々は120の匿名ICLR 2026からの4,200のフルペーパー原稿の制御コーパスを構築した。
- 参考スコア(独自算出の注目度): 34.868311584135775
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models increasingly participate in scientific evaluation, we investigate a potential form of reward hacking: how rhetorical choices shape AI-review judgments when reported scientific content is preserved and how these effects vary across evaluation conditions. We construct a controlled corpus of 4,200 full-paper manuscripts derived from 120 anonymized ICLR 2026 submissions. Two LLM rewriters transform six rhetorical dimensions in opposing directions, and five LLM reviewers evaluate the resulting manuscripts under standard and strict protocols. We also test joint, recursive, and reviewer-guided rewriting. Our results show that rhetorical sensitivity is structured rather than uniform. Evidence framing and novelty stance produce the largest positive-negative contrasts in overall assessment, with scope framing forming a weaker second tier; the remaining dimensions have smaller or less stable effects. This hierarchy persists across human-assessed quality levels, but score movement depends strongly on the AI reviewer's original score: lower scores tend to rise, higher scores tend to fall, and directional contrasts are clearest in the middle ranges. More elaborate workflows do not reliably yield larger gains. Joint rewriting is strongly rewriter-dependent, reviewer guidance does not consistently outperform an unguided second pass, and repeated rewriting yields diminishing, configuration-dependent returns. Across conditions, the rewriter primarily determines the separation between opposing variants, whereas the reviewer determines the magnitude and sign of their score effects. Strict review lowers mean OA by 1.36 points without consistently changing rhetorical sensitivity. These findings identify when rhetorical presentation influences AI scientific review and motivate evaluation systems robust to content-preserving variation in scientific writing.
- Abstract(参考訳): 大規模言語モデルが科学的評価にますます参加するにつれて、我々は報酬ハックの潜在的な形態、すなわち、報告された科学的内容が保存されたときのAIレビュー判断がどのように形成されるか、そしてこれらの効果が評価条件によってどのように変化するか、について調査する。
我々は120の匿名ICLR 2026からの4,200のフルペーパー原稿の制御コーパスを構築した。
2つのLLMリフレクタは6つのレトリック次元を反対方向に変換し、5つのLLMレビュアは標準および厳密なプロトコルの下で得られた原稿を評価する。
また、共同で再帰的かつレビュアーが指導する書き直しもテストします。
以上の結果から,レトリックの感度は均一ではなく構造化されていることが示唆された。
エビデンス・フレーミングとノベルティ・スタンスは、全体評価において最大の正負のコントラストを生み出し、スコープ・フレーミングはより弱い第2階層を形成し、残りの次元はより小さいかより安定した効果を持っている。
この階層は人間の評価された品質レベルにわたって持続するが、スコアのムーブメントはAIレビュアーの元々のスコアに強く依存する。
より精巧なワークフローは、確実に大きな利益をもたらすわけではない。
共同書き直しは、強い書き直し依存であり、レビュアーガイダンスは、誘導されていない第2パスを一貫して上回り、繰り返し書き直しが減少し、構成に依存したリターンを減少させる。
条件によって、リライターは、主に反対の変種間の分離を決定するが、レビュアーはスコア効果の大きさと符号を決定する。
厳密なレビューでは、平均OAを1.36ポイント下げるが、レトリック感度は変わらない。
これらの知見は、修辞的なプレゼンテーションがAIの科学的レビューに影響を及ぼし、科学的執筆におけるコンテンツ保存のバリエーションに頑健な評価システムに動機づけるかどうかを明らかにする。
関連論文リスト
- No Hidden Prompts Needed! You Can Game AI Peer Review with Presentation-Only Revisions [43.03725702558361]
隠れテキストなし、プロンプトインジェクションなし、メソッド、実験、数値、方程式、証明、数値結果の変更なし。
攻撃者は、抽象的、コントリビューション・フレーミング、関連する作業、議論、物語構造など、プレゼンテーションレベルのコンテンツのみを変更する。
3つの主要なAIレビュアーの中で、敵対的再パッケージングは75.1%の攻撃成功率と平均スコアの+1.21/10を達成する。
論文 参考訳(メタデータ) (2026-06-11T08:30:18Z) - Gaming AI-Assisted Peer Reviews Poses New Risks to the Scientific Community [33.39468805524881]
AIによるピアレビューは、単純で低コストな操作に対して脆弱であることを示す。
これは、人書きとAI生成の両方の論文のために、規律と出版の場にまたがって見られます。
以上の結果から,AIツールを中性評価対象として扱うべきではないことが示唆された。
論文 参考訳(メタデータ) (2026-06-08T20:38:06Z) - Stop Automating Peer Review Without Rigorous Evaluation [51.53099943385505]
このポジションペーパーは、今日のAIシステムは、論文レビューの作成に使用すべきではない、と論じている。
1)AIレビュアーは、視点の多様性を低下させる論文内および新聞内における過剰な合意の隠れた効果を示す。
ピアレビューの危機に対処するには、ピアレビューの自動化の科学が必要です。
論文 参考訳(メタデータ) (2026-05-04T22:41:04Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework [55.078301794183496]
我々は、高品質なピアレビューを支えるコアレビュースキル、すなわち欠陥のある研究ロジックの検出に注力する。
これは、論文の結果、解釈、クレームの間の内部の一貫性を評価することを含む。
本稿では,このスキルを制御条件下で分離し,テストする,完全自動対物評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-29T08:48:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。