論文の概要: Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
- arxiv url: http://arxiv.org/abs/2608.28626v1
- Date: Fri, 31 Jul 2026 12:12:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-06 19:38:41.447535
- Title: Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
- Title(参考訳): 大規模言語モデルは、彼らがレビューしたものを精査するのか? : 校正、誤り検出、著者同一性効果のマルチモーダル監査
- Authors: Emad Alharbi,
- Abstract要約: 大きな言語モデル(LLM)は、ピアレビューを生成するためにますます使われています。
本研究は,2026年国際学習表現会議への165件の応募に対して,2つのマルチモーダルLCMをレビュアーとして評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to generate peer reviews, prompting examination of their capacity for critical evaluation. This study evaluates two multimodal LLMs, Qwen2.5-VL-72B and Pixtral-Large-124B, as reviewers across 165 submissions to the 2026 International Conference on Learning Representations, a venue that postdates both models' training cutoffs. Manuscripts were presented to both models with author identities blinded, replaced with high-prestige affiliations, or replaced with low-prestige affiliations, and in either text-only or text-with-figure format. Additionally, 145 verifiably detectable errors were inserted into 55 manuscripts to assess error identification under natural and verification-oriented prompts. Across all manuscript groups, including rejected submissions, LLM scores ranged from 7.0 to 8.1, whereas human mean scores ranged from 3.4 to 6.8. The models detected 12.1\% of the verified errors under natural prompting, and a one-sentence verification instruction increased detection to 22.2\%; however, 78\% of the errors remained undetected. Providing figures reduced error detection while increasing review scores. No visual error was reliably verified against its corresponding figure, and half of the text-only reviews described figures that were not provided. Author identity did not influence either review scores or error detection. LLM editorial decisions exactly matched those produced by simple score averaging.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ピアレビューを生成するためにますます使われており、批判的評価のための能力の検証が進められている。
本研究は,2026年の国際学習表現会議への165件のレビュアーとして,Qwen2.5-VL-72BとPixtral-Large-124Bの2つのマルチモーダルLCMを評価した。
原稿は両モデルに表示され、著者の身元は見えず、高解像度のアフィリエイトに置き換えられたり、低解像度のアフィリエイトに置き換えられたり、テキストのみまたはテキスト・ウィズ・フィギュアのフォーマットで表示された。
さらに、自然および検証指向のプロンプトの下でエラー識別を評価するために、55の原稿に145個の検出可能なエラーが挿入された。
LLMスコアは7.0から8.1まで、人間の平均スコアは3.4から6.8までである。
モデルは、自然なプロンプトの下で検証エラーの12.1\%を検出し、一文検証命令は検出を22.2\%に増やしたが、エラーの78\%は未検出のままであった。
数字の提供は、レビュースコアを増やしながらエラー検出を減らした。
視覚的誤りは、対応する図に対して確実に検証されず、テキストのみのレビューの半数は、提供されていない図を記述した。
著者の身元はレビュースコアやエラー検出に影響を与えなかった。
LLMの編集決定は、単純なスコア平均化によって生成されたものと正確に一致した。
関連論文リスト
- Decoupling Scores and Text: The Politeness Principle in Peer Review [0.0]
著者はしばしばピアレビューのフィードバックを解釈するのに苦労し、丁寧なコメントから誤った希望を導き、特定の低いスコアで混乱していると感じている。
我々は,3万件以上のICLR 2021-2025のデータセットを構築し,数値スコアを用いた受入予測性能とテキストレビューを比較した。
スコアベースモデルでは91%,テキストベースモデルでは81%,大規模言語モデルでは81%であった。
論文 参考訳(メタデータ) (2026-03-23T11:58:48Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - FLAWS: A Benchmark for Error Identification and Localization in Scientific Papers [10.04850395402571]
エラーの特定とローカライゼーションは、ピアレビューにおける中核的なタスクである。
大規模言語モデル(LLM)の最近の進歩は、そのような評価タスクをサポートする可能性への関心を喚起している。
レビューシステムにおけるLSMの利用が増加しているにもかかわらず、エラーを特定できる能力はいまだに未調査のままである。
論文 参考訳(メタデータ) (2025-11-26T19:19:44Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Tgea: An error-annotated dataset and benchmark tasks for text generation from pretrained language models [57.758735361535486]
TGEAは、事前訓練された言語モデル(PLM)からテキストを生成するためのエラーアノテートデータセットである。
PLM生成文で発生する24種類の誤りを網羅する誤り分類を作成する。
PLM生成テキストに対する包括的なアノテーションを備えた最初のデータセットである。
論文 参考訳(メタデータ) (2025-03-06T09:14:02Z) - MQM-APE: Toward High-Quality Error Annotation Predictors with Automatic Post-Editing in LLM Translation Evaluators [53.91199933655421]
大規模言語モデル(LLM)は、機械翻訳(MT)の品質評価の裁判官として大きな可能性を秘めている。
非インパクト的なエラーをフィルタリングするアイデアに基づいて、ユニバーサルでトレーニング不要なフレームワークである$textbfMQM-APEを紹介します。
実験の結果,GEMBA-MQMに対する誤差の信頼性と品質の両方が一貫して改善されていることがわかった。
論文 参考訳(メタデータ) (2024-09-22T06:43:40Z) - Assessing the Efficacy of Grammar Error Correction: A Human Evaluation
Approach in the Japanese Context [10.047123247001714]
我々は,最先端のシーケンスタギング文法誤り検出・修正モデル(SeqTagger)の性能評価を行った。
自動アノテーションツールキット ERRANT を用いて,SeqTagger の性能評価を行った。
その結果、精度は63.66%、リコールは20.19%であった。
論文 参考訳(メタデータ) (2024-02-28T06:43:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。