論文の概要: HNR-DAC: Hard-Negative Reranking and Distribution-Aligned Classification for Scientific Claim Verification
- arxiv url: http://arxiv.org/abs/2608.07204v1
- Date: Fri, 07 Aug 2026 13:19:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.503079
- Title: HNR-DAC: Hard-Negative Reranking and Distribution-Aligned Classification for Scientific Claim Verification
- Title(参考訳): HNR-DAC:科学的クレーム検証のためのハード負の再分類と分布対応分類
- Authors: Zhenchao Wang, Xin Chen, Luoxi Zhang, Min Yang, Shiwen Ni,
- Abstract要約: HNR-DACは,実際に遭遇するケースに対して,各ステージをトレーニングする2段階のフレームワークである。
NLPCC 2026 Task 10 Track 2では97.21% Hit@3、95.79% Macro-F1、94.47% Joint@3、平均スコア95.13%となる。
- 参考スコア(独自算出の注目度): 19.757139845905098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scientific claim verification over a cited paper requires predicting the claim--paper relation and identifying the paragraphs that justify that prediction. This setting poses two linked challenges: within-paper distractors often resemble genuine evidence, while a classifier trained on gold evidence must operate on retrieved evidence at inference. We present HNR-DAC, a two-stage framework that trains each stage on the cases it will actually encounter. Hard-Negative Reranking (HNR) quantifies evidence confusability using a base reranker's scores on non-gold paragraphs and contrasts gold evidence against the most confusable candidates. Distribution-Aligned Classification (DAC) trains on the Top-1 paragraph produced by the same frozen HNR used to construct inference inputs, while HNR's Top-3 paragraph identifiers provide the evidence output. On the NLPCC 2026 Task 10 Track 2, the final configuration obtains 97.21% Hit@3, 95.79% Macro-F1, 94.47% Joint@3, and an average score of 95.13%. The corresponding submission ranks third on the official Track 2 leaderboard while achieving the highest overall Macro-F1 of 93.05%, alongside 70.16% Joint@3 and an average score of 81.61%.
- Abstract(参考訳): 引用された論文に対する科学的クレームの検証には、クレームの関係を予測し、その予測を正当化する段落を特定する必要がある。
この設定は2つの関連した課題を提起する: 紙内部の気晴らし器は真正の証拠によく似ているが、金の証拠で訓練された分類器は推論時に回収された証拠で操作しなければならない。
HNR-DACは,実際に遭遇するケースに対して,各ステージをトレーニングする2段階のフレームワークである。
HNR(Hard-Negative Re rank)は、非金の段落のベースリランカのスコアを用いて証拠の難易度を定量化し、最も不愉快な候補と金の証拠を対比する。
配電系統分類(DAC)は、同じ冷凍HNRが作成したトップ1段落の列車で推論入力を構築し、HNRのTop-3段落識別子はエビデンス出力を提供する。
NLPCC 2026 Task 10 Track 2では97.21% Hit@3、95.79% Macro-F1、94.47% Joint@3、平均スコア95.13%となる。
公式のトラック2では3位にランクインし、マクロF1の最高スコアは93.05%、ジョイント@3の70.16%、平均スコアは81.61%となった。
関連論文リスト
- Evidence-Ledger Adjudication for Claim-Evidence Traceability [0.45743735246920414]
本稿では,エビデンス・レジャーの判断,すなわちクレーム・エビデンス・トレーサビリティ・ワークフローについて検討する。
それぞれのクレームとエビデンスパケットをペアにし、サポート関係を割り当てる。
その結果,エビデンスリーダの判断は,異質なエビデンスパケットをAI支援書込みのための監査可能なトレーサビリティ層にすることができることがわかった。
論文 参考訳(メタデータ) (2026-07-29T06:22:53Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense [0.0]
企業文書の大量生成には、財務紛争の物語、コンプライアンス通知、監査要約が含まれる。
統一されたガードレール層の前に、プロダクションシステムはしばしば別々のPIIリアクション、コンテンツモデレーション、フォーマット検証ステップを縫い合わせていた。
本稿では,テキストと画像入力のためのガードレールオーケストレーションレイヤを提案する。
論文 参考訳(メタデータ) (2026-06-01T00:24:30Z) - The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning [0.0]
マルチエージェントの場合、Debate Trap と Reasoning Trap というより広い現象を例に挙げる。
フレームワークには、(i) SFS(Supported Faithfulness Score)、(ii) EGSR(Evidence-Grounded Socratic Reasoning)の3つの部分がある。
定理 1 のマルコフ構造を保存する閉系推論プロトコルは、期待して、同じ DPI 境界となる。
論文 参考訳(メタデータ) (2026-05-03T04:12:21Z) - An Auditable Pipeline for Fuzzy Full-Text Screening in Systematic Reviews: Integrating Contrastive Semantic Highlighting and LLM Judgment [0.0]
フルテキストのスクリーニングは、体系的なレビューの大きなボトルネックです。
私たちは、ファジィな決定問題として包摂/排除を再設計する、スケーラブルで監査可能なパイプラインを提示します。
論文 参考訳(メタデータ) (2025-08-17T17:41:50Z) - Certified Error Control of Candidate Set Pruning for Two-Stage Relevance
Ranking [57.42241521034744]
本稿では、妥当性ランキングのための候補セットプルーニングの認証エラー制御の概念を提案する。
提案手法は,第1段階から抽出した候補集合を抽出し,第2段階の復位速度を向上する。
論文 参考訳(メタデータ) (2022-05-19T16:00:13Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。