論文の概要: Review Arcade: On the Human Alignment and Gameability of LLM Reviews
- arxiv url: http://arxiv.org/abs/2605.28897v1
- Date: Wed, 27 May 2026 12:40:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.03505
- Title: Review Arcade: On the Human Alignment and Gameability of LLM Reviews
- Title(参考訳): レビュー・アーケード:LDMレビューの人間のアライメントとゲーム性について
- Authors: Hans Ole Hatzel, Sebastian Steindl, Jan Strich,
- Abstract要約: 我々は,2025 ACL Rolling Review (ARR) の論文に対して,著者とレビュアーの両方の観点から LLM レビューを評価する実験を行った。
LLMレビューの「ゲーム」は特定のシナリオで有効であり、最大35%の論文において、統計学的に顕著なスコアの増大につながることが判明した。
- 参考スコア(独自算出の注目度): 4.626261940793026
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-generated reviews for scientific papers are gaining considerable traction and are even being officially piloted by major conferences. We have to assume that not only reviewers are using LLM-assistance, but also that authors use LLMs to revise their papers before submitting. In this work, we perform empirical experiments on papers from the 2025 ACL Rolling Review (ARR) to evaluate LLM reviews from both the author and the reviewer perspective. First, we identify a limited alignment of LLM reviews with human ones. In the best-case scenario, the alignment is reasonable. However, we also find that LLM-human alignment varies substantially across prompts and models. Finally, we investigate the scenario in which the author uses an iterative draft-revise workflow to improve the submission according to the LLM review. We find that this "gaming" of LLM reviews can be effective in specific scenarios, leading to a statistically significant increase of overall scores for up to 35\% of papers. We publish our code: https://github.com/uhh-hcds/reviewarcade.
- Abstract(参考訳): LLMによる科学論文のレビューは、かなりの勢いで行われており、主要な会議によって公式に試験されている。
我々は、レビュアーがLSMアシストを使用しているだけでなく、著者がLSMを使って提出前に論文を改訂していると仮定する必要がある。
本研究では,2025 ACL Rolling Review (ARR) の論文に対する実証実験を行い,著者とレビュアーの両方の観点からLCMレビューを評価する。
まず、LLMレビューと人間レビューの限定的なアライメントを同定する。
ベストケースのシナリオでは、アライメントは合理的です。
しかし、LLM-ヒトのアライメントはプロンプトやモデルによって大きく異なる。
最後に、著者が反復的なドラフト修正ワークフローを使用して、LLMレビューに従って提出を改善するシナリオについて検討する。
LLMレビューの「ゲーム」は特定のシナリオで有効であり、最大35%の論文において、統計学的に顕著なスコアの増大につながることが判明した。
コードを公開する。 https://github.com/uhh-hcds/reviewarcade。
関連論文リスト
- Do LLMs Favor LLMs? Quantifying Interaction Effects in Peer Review [23.244156664404205]
ピアレビューパイプラインにまたがるLLM使用に関する,最初の包括的な分析結果を提供する。
我々は、ICLR、NeurIPS、ICMLから125,000以上のペーパーレビューペアを分析した。
論文 参考訳(メタデータ) (2026-01-28T18:50:54Z) - Gen-Review: A Large-scale Dataset of AI-Generated (and Human-written) Peer Reviews [7.138338798002387]
我々は LLM によるレビューを含む最大のデータセットである GenReview を提示する。
私たちのデータセットには、2018年から2025年にかけてのICLRのすべてのサブミッションに対して生成される81Kのレビューが含まれています。
GenReviewの価値を説明するために、興味深い研究質問のサンプルを探索する。
論文 参考訳(メタデータ) (2025-10-24T06:54:27Z) - LLM-REVal: Can We Trust LLM Reviewers Yet? [70.58742663985652]
大規模言語モデル(LLM)は研究者に、学術的なワークフローに広く組み込むよう刺激を与えている。
本研究は、LLMのピアレビューと研究プロセスへの深い統合が学術的公正性にどのように影響するかに焦点を当てる。
論文 参考訳(メタデータ) (2025-10-14T10:30:20Z) - Detecting LLM-Generated Peer Reviews [37.51215252353345]
大規模言語モデル(LLM)の台頭は、一部のレビュアーが独立して記述するのではなく、レビューを生成するためにこれらのツールに依存するのではないかという懸念を提起している。
論文のPDFを通じて間接的インジェクションを行うアプローチを考察し,LLMが生成したレビューに隠された透かしを埋め込むよう促す。
本稿では,複数のレビューにまたがって家族的誤り率を制御し,標準的な修正よりも高い統計力を実現する透かし方式と仮説テストを導入する。
論文 参考訳(メタデータ) (2025-03-20T01:11:35Z) - Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review [66.73247554182376]
大規模言語モデル(LLM)がピアレビューに統合された。
未確認のLLMの採用は、ピアレビューシステムの完全性に重大なリスクをもたらす。
5%のレビューを操作すれば、論文の12%が上位30%のランキングでその地位を失う可能性がある。
論文 参考訳(メタデータ) (2024-12-02T16:55:03Z) - AI-Driven Review Systems: Evaluating LLMs in Scalable and Bias-Aware Academic Reviews [18.50142644126276]
我々は,人選好のアリーナを用いて,人選好と自動レビューのアライメントを評価する。
我々は、LLMを微調整して人間の好みを予測し、LLM同士の真っ向からの戦いにおいて、どのレビューが好まれるかを予測する。
我々は、公開可能なarXivおよびオープンアクセスのNatureジャーナルのレビューをオンラインで公開し、著者が研究論文をレビューし、改訂し、品質を改善するのに役立つ無料サービスを提供しています。
論文 参考訳(メタデータ) (2024-08-19T19:10:38Z) - LLMs Assist NLP Researchers: Critique Paper (Meta-)Reviewing [106.45895712717612]
大規模言語モデル(LLM)は、様々な生成タスクにおいて顕著な汎用性を示している。
本研究は,NLP研究者を支援するLLMの話題に焦点を当てる。
私たちの知る限りでは、このような包括的な分析を提供するのはこれが初めてです。
論文 参考訳(メタデータ) (2024-06-24T01:30:22Z) - Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions [77.66677127535222]
Auto-ArenaはLLMエージェントを使用した評価プロセス全体を自動化した革新的なフレームワークである。
我々の実験では、Auto-Arenaは92.14%の相関関係を示し、以前の専門家が注釈付けしたベンチマークをすべて上回っている。
論文 参考訳(メタデータ) (2024-05-30T17:19:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。