論文の概要: Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences
- arxiv url: http://arxiv.org/abs/2607.00738v2
- Date: Mon, 06 Jul 2026 08:00:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.801703
- Title: Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences
- Title(参考訳): ファントム・レファレンス:トップタイアの会議でピーアを乗り越える幻想
- Authors: Mark Russinovich, Ram Shankar Siva Kumar, Ahmed Salem,
- Abstract要約: 我々は、ICLR、ICML、NeurIPS、USENIX Securityから受理されたカメラ対応の論文にRefCheckerを適用する。
我々は、保守的な定義を用いて、ピアレビューされた手続きにおける引用幻覚を測定する。
結果は、ピアレビューだけでは引用整合性を確実に強制しないが、監査は難航していることを示唆している。
- 参考スコア(独自算出の注目度): 4.766369673059568
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models can generate polished scientific text that includes unsupported claims, allowing hallucinations to enter the archival record. Assessing this risk via technical statements is difficult and often requires expert judgment, but citations provide a more auditable surface: a reference either resolves to a real scholarly work with compatible authorship, or it does not. We measure citation hallucination in peer-reviewed proceedings using a conservative definition limited to identity-level failures: non-existent works and substantial author-list mismatches. We explicitly exclude ordinary bibliographic drift (e.g., venue/year differences, publication-status updates, minor name variants). To audit citations at scale, we build RefChecker, a verification pipeline that resolves bibliography entries against multiple bibliographic sources and escalates unresolved cases to web-search re-verification. We apply RefChecker to accepted camera-ready papers from ICLR, ICML, NeurIPS, and USENIX Security. Hallucinated citations have entered the archival record. While reference-level rates are usually below 1%, proceedings are large enough that paper-level failures are visible: in 2025, roughly one in twenty NeurIPS and USENIX Security papers contains at least two likely hallucinated academic-paper-like references under our strict definition. We also observe post-ChatGPT increases in several venues, including a tail of papers with 5+ failures in a single bibliography, and likely hallucinated citations even among award-winning papers. These results suggest peer review alone does not reliably enforce citation integrity, yet auditing is tractable (about 0.04$ per paper in one venue-scale scan). We open-source RefChecker for routine, reproducible citation verification before publication (https://github.com/markrussinovich/refchecker).
- Abstract(参考訳): 大規模な言語モデルは、不要なクレームを含む洗練された科学的テキストを生成することができ、幻覚がアーカイブ記録に入ることができる。
このリスクを技術的声明を通じて評価することは困難であり、しばしば専門家の判断を必要とするが、引用はより監査可能な表面を提供する。
我々は,個人レベルの失敗に限定した保守的定義を用いて,査読された手続きにおける引用幻覚を測定する。
通常の書誌のドリフト(例えば、場所/年差、出版・統計更新、マイナーネームの変種)を明示的に除外します。
RefCheckerは、複数の文献ソースに対する書誌エントリを解決し、未解決事例をWeb検索の再検証にエスカレートする検証パイプラインである。
我々は、ICLR、ICML、NeurIPS、USENIX Securityから受理されたカメラ対応の論文にRefCheckerを適用する。
幻覚的な引用がアーカイブ記録に載っている。
2025年、およそ20のNeurIPSとUSENIX Securityの論文には、私たちの厳格な定義の下で少なくとも2つの幻覚された学術論文のような参照が含まれている。
また,複数会場におけるChatGPT後の増加を観察し,一冊の書誌に5件以上の障害のある論文の尾部や,受賞論文においても幻覚的な引用が見られた。
これらの結果は、ピアレビューだけでは引用整合性を確実に強制することはできないことを示唆している。
RefCheckerをオープンソースとして公開前に再現可能な引用検証を行う(https://github.com/markrussinovich/refchecker)。
関連論文リスト
- CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text [39.146761527401424]
我々は、引用幻覚検出のためのフレームワークであるCiteCheckを紹介する。
CiteCheckは外部の学術文献から候補者の出版物を検索し、構造化LCM検証器を用いて抽出された候補と比較し、検証器のスコアをExact、Minor、Majorの3つのラベルにマップする。
ホールドアウトテストセットでは、CiteCheck は 88.7マクロF1 と 88.9% の精度を実現し、GPT、Claude、Gemini のベースラインを上回り、Web 検索や少数ショットの亜種を含む。
論文 参考訳(メタデータ) (2026-05-26T21:20:40Z) - HalluCiteChecker: A Lightweight Toolkit for Hallucinated Citation Detection and Verification in the Era of AI Scientists [58.87954687016989]
HalluCiteCheckerは、科学論文の幻覚的引用を検出し検証するためのツールキットである。
私たちのコードはGitHubのApache 2.0ライセンスでリリースされており、PyPI経由でインストール可能なパッケージとして配布されています。
論文 参考訳(メタデータ) (2026-04-29T16:01:42Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - Citation Failure: Definition, Analysis and Efficient Mitigation [56.09968229868067]
LLMベースのRAGシステムからの引用は、応答検証の簡略化を目的としている。
これは、モデルが有効な応答を生成するとき、引用失敗には当てはまらないが、完全な証拠を引用することができない。
応答自体に欠陥があり、完全な証拠を引用することは不可能である。
論文 参考訳(メタデータ) (2025-10-23T07:47:22Z) - The Noisy Path from Source to Citation: Measuring How Scholars Engage with Past Research [20.649638393774048]
本稿では,大規模な引用忠実度を定量化する計算パイプラインを提案する。
論文の全文を用いて、パイプラインは引用論文における引用と引用論文における対応するクレームを識別する。
準実験を用いて「電話効果」を確立する - 引用論文が原主張に忠実度が低い場合、引用論文と原文を引用する将来の論文は原文に忠実度が低い。
論文 参考訳(メタデータ) (2025-02-27T22:47:03Z) - CausalCite: A Causal Formulation of Paper Citations [80.82622421055734]
CausalCiteは紙の意義を測定するための新しい方法だ。
これは、従来のマッチングフレームワークを高次元のテキスト埋め込みに適応させる、新しい因果推論手法であるTextMatchに基づいている。
科学専門家が報告した紙衝撃と高い相関性など,各種基準におけるCausalCiteの有効性を実証する。
論文 参考訳(メタデータ) (2023-11-05T23:09:39Z) - Towards generating citation sentences for multiple references with
intent control [86.53829532976303]
We build a novel generation model with the Fusion-in-Decoder approach to handlee with multiple long inputs。
実験により,提案手法は引用文を生成するためのより包括的な特徴を提供することが示された。
論文 参考訳(メタデータ) (2021-12-02T15:32:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。