論文の概要: Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis
- arxiv url: http://arxiv.org/abs/2607.20527v1
- Date: Fri, 10 Jul 2026 02:05:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.218521
- Title: Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis
- Title(参考訳): エージェント・サイエント・シンセサイクティック・シンセサイクティック・シンセサイクティック・シンセサイクティック・シンセサイクティクスの評価と保護
- Authors: Taewan Goo, Junsik Kim, Kyulhee Han, GwonYul Jo, Jong-Soo Kim, Tae-Hyung Kim,
- Abstract要約: OpenScholarやPaperQA2のようなエージェントLLMシステムは科学論文を読み、引用された回答を返す。
どちらもそのチェックの信頼性を監査しません。
私たちはそれが信頼できないこと、そしてこれが重要であることを示します。
本報告では,ゴールドアンコール評価プロトコルとデプロイ可能なガードについて述べる。
- 参考スコア(独自算出の注目度): 2.7092559671391
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic LLM systems such as OpenScholar and PaperQA2 read the scientific literature and return cited answers, and both they and their benchmarks already check whether those citations hold, with a fixed attribution model or human graders. Neither audits the reliability of that check itself. We show it is not reliable, and that this matters. On identical agent outputs the measured unsupported-citation rate ranges from about 3% to about 18% depending only on the verifier's strictness, and although verifiers agree on which citations are supported, they disagree on which to flag (negative-specific agreement 0.27 to 0.30), so no single flag set is trustworthy and cross-paper comparison is invalid without a named verifier and protocol. We present a gold-anchored evaluation protocol and a deployable guard that make this behavior measurable and bounded. The protocol validates the verifier, measures re-attribution, and calibrates a guarantee against human gold rather than another model's verdict; the verifier is a swappable instrument chosen on cost (recall 0.94 on the supported class, held out), and re-attribution is a commodity step where a deterministic BM25 matches the best open generator. The guard adds a split-conformal layer placing a distribution-free, finite-sample bound on truly unsupported citations that slip past a chosen flagging rule, a guarantee on catch rate rather than conclusion correctness. The bound holds on held-out gold, and we identify and quantify the condition governing its transfer to deployment, calibration-negative difficulty, with a concrete recalibration recipe, left untested by prior conformal-factuality work. Validated across four open 27-35B models and three agentic pipelines on public benchmarks (SciFact, QASA, PubMedQA), with confidence intervals on every headline number, the protocol and guard ship as an open single-GPU kit.
- Abstract(参考訳): OpenScholarやPaperQA2のようなエージェントLLMシステムは科学文献を読み、引用された回答を返す。
どちらもそのチェックの信頼性を監査しません。
私たちはそれが信頼できないこと、そしてこれが重要であることを示します。
同一のエージェント上では、評価済みの引用率は、検証者の厳密性に応じて約3%から約18%の範囲を出力し、検証者はどの引用をサポートするかに同意するが、どのフラグにフラグを付けるか(負特約0.27〜0.30)には同意しないため、単一のフラグセットは信頼できておらず、クロスペーパー比較は名前付き検証者およびプロトコルなしで無効である。
我々は,この動作を計測可能かつバウンダリにするためのゴールドアンコール評価プロトコルと展開可能なガードを提供する。
このプロトコルは、検証器を検証し、再帰を計測し、他のモデルの判断よりも人間の金に対する保証を校正する。検証器は、コストで選択された交換可能な機器(サポートされたクラスでは0.94をコールし、保持される)であり、再帰は、決定論的BM25が最高のオープンジェネレータと一致する商品ステップである。
ガードは、選択されたフラグングルールを通り抜ける真に支持されない引用、結論の正しさよりもキャッチレートの保証に、分布のない有限サンプルを配置する分割コンフォーマル層を追加する。
この境界は金の保留を前提としており, 本研究は, 既定の整合実効性試験で検証されていない具体的な校正法を用いて, キャリブレーション負の難易度, キャリブレーション負の条件を同定し, 定量化する。
公開ベンチマーク(SciFact、QASA、PubMedQA)で4つのオープンな27-35Bモデルと3つのエージェントパイプラインが検証され、すべてのヘッダ番号、プロトコル、ガードがオープンなシングルGPUキットとして出荷される。
関連論文リスト
- The Calibrated Deepfake Trust Score (CDTS): Competence-Coupled Trust Degradation Across Deepfake Detectors [0.0]
Calibrated Deepfake Trust Score (CDTS) は、ディープフェイク検出のための自己監査型トラストである。
我々の中心的な発見はコンピテンス・校正結合であり、検出器の識別能力が低下するにつれて分解する。
我々は、検出器の信頼性は、共有ドライバーとしての能力によって組織され、能力は見積もりと条件づけの正しい量であり、信頼スコアは能力に注意する必要があると論じている。
論文 参考訳(メタデータ) (2026-06-28T16:29:48Z) - Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - Acceptance Cards:A Four-Diagnostic Standard for Safe Fine-Tuning Defense Claims [0.6882042556551609]
本稿では,評価プロトコルであるアクセプタンスカード,文書オブジェクト,実行可能監査パッケージ,クレーム固有の明細調整型ディフェンスクレームのための明細書標準について紹介する。
このプロトコルは、ギャップ低減をフルカードパスとして扱う前に、統計的信頼性、新鮮なセマンティック一般化、メカニズムアライメント、およびクロスタスク転送をチェックする。
これは1つのモデルファミリ上の狭いインストールギャップ監査であり、SafeLoRAの有効性のグローバルな判断ではない。
論文 参考訳(メタデータ) (2026-05-11T13:48:42Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Verifier-Bound Communication for LLM Agents: Certified Bounds on Covert Signaling [0.0]
言語モデルエージェントを結合することで、ポリシーに準拠したメッセージの調整を表面レベルで隠蔽することができる。
生成と受け入れを分離するプロトコルであるCLBCを提案する。
このプロトコルは、遅延リークと明示的な残留チャネルの観点から、転写リークの上限をいかに高めるかを示す。
論文 参考訳(メタデータ) (2026-02-27T23:42:37Z) - Audit the Whisper: Detecting Steganographic Collusion in Multi-Agent LLMs [0.0]
Audit the Whisperは、理論、ベンチマーク設計、検出、検証にまたがるカンファレンスグレードの研究成果物である。
i) パラフレーズ, レート制限, 役割置換などの介入が, ペアリングしたKullback-Leibler診断によって定量的なペナルティの操作を課すことを示すチャネル容量分析を行った。
我々は、匿名化された再生スクリプト、匿名化されたマニフェスト、ドキュメントをリリースし、外部監査官がすべての図を再現し、二重盲検要件を満たし、最小限の努力でフレームワークを拡張します。
論文 参考訳(メタデータ) (2025-10-05T17:51:52Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z) - Distribution-free uncertainty quantification for classification under
label shift [105.27463615756733]
2つの経路による分類問題に対する不確実性定量化(UQ)に焦点を当てる。
まず、ラベルシフトはカバレッジとキャリブレーションの低下を示すことでuqを損なうと論じる。
これらの手法を, 理論上, 分散性のない枠組みで検討し, その優れた実用性を示す。
論文 参考訳(メタデータ) (2021-03-04T20:51:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。