論文の概要: EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy
- arxiv url: http://arxiv.org/abs/2609.22223v1
- Date: Wed, 02 Sep 2026 21:00:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.791785
- Title: EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy
- Title(参考訳): EAVer: エンドツーエンドのエージェントポリシーとしての長期のファクチュアリティ検証
- Abstract要約: 我々は、完全な応答レベルの検証ワークフローを統一ポリシーとして制御することを学ぶ、エンドツーエンドのエージェント検証であるEAVerを紹介する。
EAVerはセマンティック関連クレームをグループ化し、信頼に基づいた直接検証やターゲット検索にルートし、コンパクトなインコンテキストメモで検索によって返される証拠を保持する。
- 参考スコア(独自算出の注目度): 50.665874114632
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-form factuality verification is commonly implemented as a static decompose-search-verify pipeline, with separately prompted modules processing claims and invoking external search. Treating claims independently makes LLM and search calls scale with claim count and causes repeated searches for overlapping evidence about related claims. We introduce EAVer, an End-to-end Agentic Verifier that learns to control the complete response-level verification workflow as a unified policy. EAVer groups semantically related claims, routes each group to direct verification or targeted search based on confidence, and keeps evidence returned by search in compact in-context memos for cross-claim reuse. To train this policy, we develop a privileged-teacher synthesis pipeline that converts gold claim annotations into executable multi-turn tool-interaction trajectories with live search rather than post-hoc rationales. Structural, label-alignment, tool-use, search-budget, and leakage checks yield 1,447 quality-controlled trajectories. We further construct 794 bidirectional same-trajectory preference pairs that keep claim grouping, search, and evidence fixed, enabling decision-focused Direct Preference Optimization (DPO) over factuality-decision tokens. The results with Qwen3-8B show that EAVer outperforms the strongest search-based baseline on each benchmark by 2.88 Macro-F1 points on VeriFastScore and 4.73 points on the out-of-distribution FaStFact-Bench, while using about 80% fewer searches than the most search-efficient baseline. Moreover, EAVer consistently improves performance across models ranging from 4B to 32B parameters, demonstrating its strong generalizability.
- Abstract(参考訳): 長期の事実性検証は静的分解探索検証パイプラインとして一般的に実装され、個別にモジュール処理クレームを処理し、外部検索を起動する。
クレームを個別に扱うことで、LCMと検索コールはクレーム数とともにスケールし、関連するクレームに関する複数の証拠を何度も検索する。
我々は、完全な応答レベルの検証ワークフローを統一ポリシーとして制御することを学ぶ、エンドツーエンドのエージェント検証であるEAVerを紹介する。
EAVerはセマンティック関連クレームをグループ化し、信頼に基づく直接検証やターゲット検索にルートし、クロスステート再利用のためのコンパクトなインコンテキストメモで検索によって返される証拠を保持する。
この方針を訓練するために,金のクレームアノテーションを,ポストホック論理ではなくライブ検索で実行可能なマルチターンツール・インタラクション・トラジェクトリに変換する特権教師合成パイプラインを開発した。
構造、ラベルアライメント、ツール使用、検索予算、リークチェックは、品質管理された1,447のトラジェクトリを生成する。
さらに、クレームのグルーピング、検索、エビデンスを固定し続け、事実性決定トークンよりも決定中心の直接選好最適化(DPO)を可能にする794の双方向同軌道選好ペアを構築した。
Qwen3-8B の結果、EAVer は VeriFastScore の2.88 Macro-F1 点、配布外 FaStFact-Bench の4.73 点で各ベンチマークにおいて最強の検索ベースラインを上回り、検索効率のよいベースラインよりも約80% 少ない。
さらにEAVerは、4Bパラメーターから32Bパラメーターまでのモデル間のパフォーマンスを一貫して改善し、その強力な一般化性を示している。
関連論文リスト
- Efficiently Linking Unstructured Data for Multi-step Reasoning [17.545873517131206]
DASEクエリエンジンは、候補エビデンサウェアを構築し、ランク付けする。
強いRDBMSよりも6倍から46倍高速なマルチステップ推論クエリの候補証拠を検索する。
セマンティック・オペレーショナルな後処理を必要とするタスクに対しては、DASEはハイリコールプリフィルタとして機能する。
論文 参考訳(メタデータ) (2026-09-16T23:16:45Z) - EviGraph: Towards Verifiable Evidence Construction for Information-Seeking Agents [0.28675177318965045]
本稿では,証拠記録から検索実行を分離するディープ検索フレームワークであるEviGraphを紹介する。
結果として得られるグラフは、永続的なワーキングメモリと、密集したプロセス報酬の源として機能する。
BrowseComp-Plusでは、Qwen3-8B EviGraphエージェントが一致した相互作用予算の下で35.9%の精度を達成する。
論文 参考訳(メタデータ) (2026-08-25T15:06:54Z) - Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval [0.0]
Retrieval-Augmented Generation (RAG) は、言語モデル(LLM)を拡張し、その応答を外部知識に基盤付ける。
本稿では,動的クエリ分解,反復検索,および有界自己回帰評価ループを導入したエージェントオーケストレーション適応型RAGフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-04T03:38:46Z) - GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes [5.276278723196607]
Agentic DAG-Orchestrated Transformer (A.DOT) Plannerはマルチモーダル・マルチホップ質問応答のためのフレームワークである。
A.DOTは、ユーザNLクエリを構造化および非構造化の両方にまたがる有向非巡回グラフ(DAG)実行計画にコンパイルする。
System Decomposes query into parallelizable sub-queries, includess schema-aware reasoning, and applied both structure and semantic validation。
論文 参考訳(メタデータ) (2026-03-15T05:34:16Z) - Reasoning-enhanced Query Understanding through Decomposition and Interpretation [87.56450566014625]
ReDIは、分解と解釈によるクエリ理解のための推論強化アプローチである。
我々は,大規模検索エンジンから実世界の複雑なクエリの大規模データセットをコンパイルした。
BRIGHT と BEIR の実験により、ReDI はスパースと密度の高い検索パラダイムの両方において、強いベースラインを一貫して超えることを示した。
論文 参考訳(メタデータ) (2025-09-08T10:58:42Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。