論文の概要: From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification
- arxiv url: http://arxiv.org/abs/2606.13262v1
- Date: Thu, 11 Jun 2026 12:17:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.782749
- Title: From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification
- Title(参考訳): 検証からプロセスへ:多段階ファクト検証のためのエージェント強化学習
- Authors: Rongxin Yang, Shenghong He, Siyuan Zhu, Chao Yu,
- Abstract要約: 本稿では,多段階事実検証トラジェクトリのエンドツーエンド最適化のためのエージェント強化学習フレームワークProFactを提案する。
ProFactは、クレームの分解、証拠探索、回答生成、検証予測を協調する統一的なポリシーを訓練する。
実証評価の結果,ProFactは検証性能と推論効率の両方において,高いベースラインを一貫して上回っていることがわかった。
- 参考スコア(独自算出の注目度): 4.539896456749749
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent approaches combining Large Language Models (LLMs) with retrieval-augmented reasoning have shown promise for automated fact verification. To process complex claims, these verification pipelines typically execute multi-stage workflows that coordinate tightly coupled modules, including claim decomposition, evidence gathering, and verdict prediction. However, existing methods optimize individual stages in isolation or rely on fixed heuristics, which limits adaptive coordination among stages and can lead to suboptimal outcomes. In this work, we propose ProFact, an agentic reinforcement learning framework for end-to-end optimization of multi-stage fact verification trajectories. ProFact trains a unified policy to coordinate claim decomposition, evidence seeking, answer generation, and verdict prediction. To address the sparse and delayed supervision provided by final veracity labels, ProFact introduces process-aware rewards that provide stage-level learning signals throughout the verification process. Empirical evaluation shows that ProFact consistently outperforms strong baselines in both verification performance and inference efficiency. These results highlight the effectiveness of process-aware trajectory optimization for multi-stage fact verification.
- Abstract(参考訳): 近年,Large Language Models (LLMs) と検索強化推論を組み合わせた手法が,自動事実検証の可能性を示唆している。
複雑なクレームを処理するために、これらの検証パイプラインは通常、クレームの分解、エビデンス収集、検証予測を含む密結合モジュールを調整するマルチステージワークフローを実行する。
しかし、既存の手法は個別の段階を最適化するか、固定的なヒューリスティックに依存し、段階間の適応的調整を制限し、最適以下の結果をもたらす可能性がある。
本研究では,多段階事実検証トラジェクトリのエンドツーエンド最適化のためのエージェント強化学習フレームワークであるProFactを提案する。
ProFactは、クレームの分解、証拠探索、回答生成、検証予測を協調する統一的なポリシーを訓練する。
ProFactは、最終的な検証ラベルによって提供されるスパースと遅延の監督に対処するため、検証プロセス全体を通してステージレベルの学習信号を提供するプロセス認識報酬を導入している。
実証評価の結果,ProFactは検証性能と推論効率の両方において,高いベースラインを一貫して上回っていることがわかった。
これらの結果は,多段階事実検証におけるプロセス認識軌道最適化の有効性を浮き彫りにした。
関連論文リスト
- Self-Improving In-Context Learning [3.9202238580555417]
本稿では,短時間の即時テストの埋め込みを最適化し,文脈内学習を改善することを提案する。
我々はこの信号を有界自己監督キャリブレーション法として定式化する。
ICLタスクの包括的なスイート全体において、提案されたキャリブレーションはベースモデルを改善したり、一致させたりすることで、ほとんどのタスクにおける分類固有のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-22T03:01:34Z) - Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents [24.080021799509847]
textscEvalAct (Evaluate-as-Action) は暗黙的な検索品質評価を明示的なアクションに変換する。
textscEvalActは、マルチホップタスクにおいて最も高い平均精度を達成する。
論文 参考訳(メタデータ) (2026-03-10T05:22:40Z) - Not All Queries Need Deep Thought: CoFiCot for Adaptive Coarse-to-fine Stateful Refinement [24.721024438862553]
CoFiCotは粗粒度適応フレームワークで、推論戦略を問題に合わせる。
セマンティックエントロピー、コンセンサス信頼性、予測推論深度でクエリをトリアージするマルチメトリック分類器を実装した。
これにより、複雑なクエリをコンテキスト対応の修正ループにルーティングしながら、単純なクエリに対して効率的なアグリゲーションを適用することができる。
論文 参考訳(メタデータ) (2026-03-09T11:23:07Z) - Prompt Optimization via Retrieved Reasoning Assets and Multi-Agent Analysis [5.935239028627343]
スコア・アウェア・プロンプト最適化のためのマルチエージェントフレームワークであるMA-SAPOを紹介する。
従来の手法と比較して、MA-SAPOは、体系的な編集を導く構造的推論と評価結果を明示的に結合する。
評価信号を解釈可能な推論連鎖に変換することで、MA-SAPOはより透明で、監査可能で、制御可能な、迅速な改善を生成する。
論文 参考訳(メタデータ) (2025-10-18T20:21:09Z) - In-context Demonstration Matters: On Prompt Optimization for Pseudo-Supervision Refinement [71.60563181678323]
大規模言語モデル(LLM)は様々なタスクで大きな成功を収めており、生成品質をさらに向上させるためには微調整が必要である場合もある。
これらの課題に対処する直接的な解決策は、教師なしの下流タスクから高信頼のデータを生成することである。
本稿では,プロンプトと全体的な擬似スーパービジョンを両立させる新しい手法,擬似教師付きデモアライメント・アライメント・アライメント・プロンプト・最適化(PAPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-04T03:39:28Z) - Step-by-Step Reasoning for Math Problems via Twisted Sequential Monte Carlo [55.452453947359736]
Twisted Sequential Monte Carlo(TSMC)に基づく新しい検証手法を提案する。
TSMCを大規模言語モデルに適用し、部分解に対する将来的な報酬を推定する。
このアプローチは、ステップワイドなヒューマンアノテーションを必要としない、より直接的なトレーニングターゲットをもたらす。
論文 参考訳(メタデータ) (2024-10-02T18:17:54Z) - FineDiving: A Fine-grained Dataset for Procedure-aware Action Quality
Assessment [93.09267863425492]
競争力のあるスポーツビデオにおける行動の高レベル意味論と内部時間構造の両方を理解することが、予測を正確かつ解釈可能なものにする鍵である、と我々は主張する。
本研究では,多様なダイビングイベントに対して,アクションプロシージャに関する詳細なアノテーションを付加した,ファインディビングと呼ばれる詳細なデータセットを構築した。
論文 参考訳(メタデータ) (2022-04-07T17:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。