論文の概要: HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer Reviews
- arxiv url: http://arxiv.org/abs/2609.03580v1
- Date: Thu, 03 Sep 2026 09:27:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.001591
- Title: HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer Reviews
- Title(参考訳): HalluPeer: 科学的ピアレビューで幻覚を検出するための分類駆動ベンチマーク
- Abstract要約: HalluPeerは、科学的ピアレビューで幻覚を検出するためのベンチマークである。
我々のパイプラインは、ピアレビュー固有の幻覚分類を誘導し、レビューコンテキストを特定し、自動フィルタリングで幻覚を注入する。
- 参考スコア(独自算出の注目度): 20.989630888021463
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The growing scale of academic peer review has motivated the use of Large Language Models (LLMs) as review assistants, yet LLMs can generate fluent but unsupported claims that undermine review reliability. Existing hallucination benchmarks are not designed for peer review, where verification requires grounding claims in long, technical papers. We introduce HalluPeer, a benchmark for detecting hallucinations in scientific peer reviews, providing aligned triples of paper content, human-written reviews, and hallucination-injected reviews, annotated for detection, classification, and localization. Our pipeline induces a peer-review-specific hallucination taxonomy, identifies review contexts, and injects hallucinations with automated filtering. Experiments on 12K papers and 38K reviews show that existing detectors struggle to separate hallucinations from legitimate critique, while evaluation on authentic reviews demonstrates that HalluPeer-defined hallucination patterns occur in real peer reviews, highlighting the critical need for source-aware verification. Our project page can be found in https://github.com/Lin-TzuLing/HalluPeer.git
- Abstract(参考訳): 学術的ピアレビューの規模が拡大し、レビューアシスタントとしてLarge Language Models (LLMs) の使用が動機となっているが、LLMはレビューの信頼性を損なうような流動的な主張を生成することができる。
既存の幻覚ベンチマークはピアレビューのために設計されていない。
本稿では,学術的査読において幻覚を検出するためのベンチマークであるHaluPeerを紹介する。
我々のパイプラインは、ピアレビュー固有の幻覚分類を誘導し、レビューコンテキストを特定し、自動フィルタリングで幻覚を注入する。
12K論文と38Kレビューの実験では、既存の検出器が正当な批判から幻覚を分離するのに苦労していることが示されている。
私たちのプロジェクトページはhttps://github.com/Lin-TzuLing/HalluPeer.gitにある。
関連論文リスト
- When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - Peerispect: Claim Verification in Scientific Peer Reviews [12.340116689292726]
Peerispectは、ピアレビューでクレームレベルの検証を運用するインタラクティブシステムである。
結果は、論文のエビデンスを直接ハイライトするビジュアルインターフェースを通じて提示される。
論文 参考訳(メタデータ) (2026-04-19T23:40:26Z) - Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation [9.540386616651295]
CoT(Chain-of-Thought)は、ステップバイステップ推論を奨励することによって幻覚を緩和する。
我々の研究は、推論の利用における見落とされがちなトレードオフを浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-20T15:49:37Z) - HalluLens: LLM Hallucination Benchmark [49.170128733508335]
大規模言語モデル(LLM)は、しばしばユーザ入力やトレーニングデータから逸脱する応答を生成する。
本稿では,新たな内因性評価タスクと既存内因性評価タスクを併用した総合幻覚ベンチマークを提案する。
論文 参考訳(メタデータ) (2025-04-24T13:40:27Z) - C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation [58.40263551616771]
本稿では,いくつかの知識文書に基づいて,詳細なQAデータセットを自動的に構築するエージェントフレームワークであるHaluAgentを紹介する。
本実験は,手作業で設計したルールと迅速な最適化により,生成データの品質が向上できることを実証する。
論文 参考訳(メタデータ) (2025-04-14T12:21:55Z) - Halu-J: Critique-Based Hallucination Judge [22.79828961875684]
批判に基づく幻覚判断器であるHalu-Jを紹介する。
Halu-Jは、関連する証拠を選択し、詳細な批評を提供することで幻覚の検出を強化する。
実験の結果,Hlu-J は GPT-4o よりも多値幻覚検出に優れていた。
論文 参考訳(メタデータ) (2024-07-17T18:21:01Z) - HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation [19.318217051269382]
大規模言語モデル(LLM)は自然言語処理(NLP)の分野で大きく進歩した。
HalluDialは、対話レベルの幻覚自動評価のための、初めての総合的な大規模ベンチマークである。
ベンチマークには4,094の対話があり、合計146,856のサンプルが含まれている。
論文 参考訳(メタデータ) (2024-06-11T08:56:18Z) - Fine-grained Hallucination Detection and Editing for Language Models [109.56911670376932]
大規模言語モデル(LM)は、しばしば幻覚と呼ばれる事実的誤りを引き起こす傾向にある。
我々は,幻覚の包括的分類を導入し,幻覚が多様な形態で現れることを議論する。
本稿では, 幻覚自動検出のための新しいタスクを提案し, 新たな評価ベンチマークであるFavaBenchを構築した。
論文 参考訳(メタデータ) (2024-01-12T19:02:48Z) - Evaluating Hallucinations in Chinese Large Language Models [65.4771562909392]
我々は,中国大言語モデルにおける幻覚現象を測定するために,HaluQA(中国語幻覚質問回答)というベンチマークを構築した。
GLM-130B と ChatGPT の2種類の幻覚について考察した。
評価のために,モデル出力が幻覚的かどうかを判定するために,GPT-4を用いた自動評価手法を設計する。
論文 参考訳(メタデータ) (2023-10-05T07:57:09Z) - HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large
Language Models [146.87696738011712]
大型言語モデル(LLM)は幻覚を生成する傾向があり、すなわち、ソースと矛盾したり、事実の知識によって検証できないコンテンツである。
言語モデル(HaluEval)のための幻覚評価ベンチマーク(Halucination Evaluation benchmark)を導入する。
論文 参考訳(メタデータ) (2023-05-19T15:36:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。