論文の概要: RefVerifier: Semi-Automated Reference Claim Verification for Scientific Manuscripts
- arxiv url: http://arxiv.org/abs/2609.07652v1
- Date: Mon, 07 Sep 2026 15:39:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 21:26:03.238017
- Title: RefVerifier: Semi-Automated Reference Claim Verification for Scientific Manuscripts
- Title(参考訳): RefVerifier:科学写本の半自動参照クレーム検証
- Abstract要約: RefVerifierは、学術的なピアレビューをサポートするために設計された、引用バウンドの参照検証プロトタイプである。
引用文を原稿から抽出し、学術的なデータベースに対してメタデータをチェックし、PDFへの参照を解決し、関連するエビデンスをローカライズし、自然言語の説明で評定を生成する。
8つの原稿によるエンドツーエンドテストでは、RefVerifierは精度が71%に達する。
- 参考スコア(独自算出の注目度): 1.6950215926321557
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As software engineering research submission counts surge, peer reviewers face severe time constraints, making systematic verification of citation-supported claims prohibitively expensive. Consequently, unsubstantiated claims and semantic drift can propagate undetected across scientific literature. Existing approaches such as fact-checking and retrieval-augmented generation tools operate on open-domain web data or evaluate claims in isolation without processing complete manuscripts. To address this gap, we present RefVerifier, a semi-automated, citation-bounded reference verification prototype designed to support in academic peer review. RefVerifier extracts citation-bearing sentences from manuscripts, checks bibliography metadata against scholarly databases, resolves references to full-text open-access PDFs, localizes relevant evidence passages, and generates verdicts with natural language explanations. Evaluating RefVerifier on public benchmarks shows claim detection at an F1 score of 0.990, open-access resolution of 57.6% of references, and evidence localization with a hit rate of 98% on abstracts and 68% on complete cited papers. In an end-to-end test with eight manuscripts, RefVerifier achieves a verdict accuracy of 71%. By automating document retrieval and evidence localization while preserving reviewer oversight, RefVerifier provides first indicators for the feasibility of semi-automated integrity checks in scholarly publishing.
- Abstract(参考訳): ソフトウェアエンジニアリング研究の提出が急増するにつれて、ピアレビュー担当者は厳しい時間的制約に直面し、引用支援クレームの体系的検証が違法に高価になる。
その結果、根拠のない主張やセマンティックドリフトは、科学的文献で発見されていないことを伝播することができる。
ファクトチェックや検索拡張生成ツールのような既存のアプローチは、オープンドメインのWebデータで動作したり、完全な原稿を処理せずにクレームを独立して評価する。
このギャップに対処するために、学術的ピアレビューを支援するために設計された半自動化された引用バウンド参照検証プロトタイプであるRefVerifierを提案する。
RefVerifierは、原稿から引用文を抽出し、学術的なデータベースに対して書誌のメタデータをチェックし、全文オープンアクセスPDFへの参照を解決し、関連するエビデンスをローカライズし、自然言語の説明で評定を生成する。
公開ベンチマークでRefVerifierを評価すると、F1スコア0.990のクレーム検出、57.6%の参照のオープンアクセス解像度、98%の抽象値と68%の完全引用論文のヒット率を持つエビデンスローカライゼーションが示されている。
8つの原稿によるエンドツーエンドテストでは、RefVerifierは精度が71%に達する。
RefVerifierは、レビュアーの監視を保ちながら文書の検索とエビデンスローカライゼーションを自動化することで、学術出版における半自動整合チェックの実現可能性の第一の指標を提供する。
関連論文リスト
- AtomCite: Verification and Correction of Supplied Page-Level Citations in Multi-Page Documents [21.842813905857863]
AtomCiteは、回答をクレームに解析し、引用されたページのイメージに対して各クレームをチェックし、決定論的修復ポリシーを適用します。
インジェクションされたベンチマークでは、約93%のバイナリ検証精度に達し、OCRのみの条件ではかなり上回っている。
その修理方針は、正しいクレームの90%以上を保持しながら、34%から87-90%までの混合液の引用精度を引き上げている。
論文 参考訳(メタデータ) (2026-09-05T01:31:50Z) - ATIBA: Grounded Integrity and Quality Checking for Research Papers [1.3241176321860364]
ATIBAは、原稿に5つの基礎的整合性と品質チェックを実行するツールである。
LLMは判断のみを信頼し、判断する証拠を決して発明しない。
論文 参考訳(メタデータ) (2026-09-03T17:24:15Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - CheckIfExist: Detecting Citation Hallucinations in the Era of AI-Generated Content [0.0]
CheckIfExistは学術データベースに対する参照の即時検証を提供するオープンソースツールである。
提案手法は,文字列類似性アルゴリズムを用いて多次元マッチング信頼度を求めることで,このギャップを埋める。
このシステムはBibエントリの単一参照検証とバッチ処理の両方を統一インターフェースでサポートする。
論文 参考訳(メタデータ) (2026-01-27T20:26:24Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment [63.662126457336534]
OpenNoveltyは、透明で証拠に基づく新規性分析のためのエージェントシステムである。
回収された実論文のすべての評価を根拠にし、検証可能な判断を確実にする。
OpenNoveltyは、公正で一貫性があり、エビデンスに支えられたピアレビューを促進するスケーラブルなツールで、研究コミュニティに力を与えることを目指している。
論文 参考訳(メタデータ) (2026-01-04T15:48:51Z) - AI-Powered Citation Auditing: A Zero-Assumption Protocol for Systematic Reference Verification in Academic Research [0.0]
本稿では,ツール使用機能を備えたエージェントAIを用いた,体系的かつ総合的な参照監査のための,AIを活用した新しい方法論を提案する。
我々は,引用が正しいと仮定せずに,複数の学術データベースに対するすべての参照を独立に検証するゼロ推定検証プロトコルを開発した。
その結果、公表されたPLOS論文の平均検証率は91.7%で、製造された参照、削除された記事、孤児の引用、捕食雑誌の発見に成功している。
この研究は、学術的引用整合性のための最初の検証済みAIエージェント方法論を確立し、監督者、学生、制度的品質保証の実践的適用性を実証する。
論文 参考訳(メタデータ) (2025-10-17T16:53:03Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。