論文の概要: SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution
- arxiv url: http://arxiv.org/abs/2606.29713v1
- Date: Mon, 29 Jun 2026 02:37:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.022361
- Title: SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution
- Title(参考訳): SEVA:Fact Attributionのためのプロセスリワードによる自己進化型検証エージェント
- Authors: Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao,
- Abstract要約: SEVAは、エビデンスアライメント、ステップバイステップの推論チェーン、キャリブレーションされた信頼度、6カテゴリのエラー診断を発行する構造化検証エージェントである。
ClearFacts では、SEVA-3B は GPT-4o-mini (69.0 vs. 69.8 F1) と一致し、よりリッチで監査可能な出力を生成する。
- 参考スコア(独自算出の注目度): 6.908637308550535
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hallucination is the reliability bottleneck for LLM-based agents, and fact attribution verifiers are the last line of defense -- yet today's verifiers emit only opaque binary labels, leaving agents unable to self-correct and operators unable to audit. We present SEVA, a structured verification agent that emits evidence alignments, step-by-step reasoning chains, calibrated confidence, and a six-category error diagnosis with actionable fixes. Training such an agent with RL is non-trivial: standard binary reward on multi-component output triggers advantage collapse -- within-group reward variance vanishes and the GRPO gradient disappears. We resolve this with a process reward that decomposes verification quality into five independent components weighted 70/30 toward process signals, restoring the gradient and inducing an implicit curriculum -- the agent first masters verification behavior (alignment 0.917 -> 0.997, format 72% -> 100%), then outcomes (F1 64.9 -> 69.0). Structured output further enables a Verify -> Reflect -> Probe -> Refine self-evolution loop, which over four rounds on a 7B model surfaces an unexpected structural finding: each round produces a benchmark-specialist, not a generalist (+15 pp on HaluEval, -10 to -14 pp on TruthfulQA in the same model, persistent at 4x data). On ClearFacts, SEVA-3B matches GPT-4o-mini (69.0 vs. 69.8 F1) while producing substantially richer, auditable output -- confirming a principle that should generalize: for any RL task with multi-component generation, reward granularity must match output granularity.
- Abstract(参考訳): 幻覚はLSMベースのエージェントの信頼性ボトルネックであり、事実帰属検証は最後の防衛線である。しかし今日の検証者は不透明なバイナリラベルのみを出力し、エージェントは自己修正できず、オペレーターは監査できない。
本報告では,エビデンスアライメント,ステップバイステップの推論チェーン,キャリブレーションされた信頼度,動作可能な修正を伴う6カテゴリエラー診断を出力する構造化検証エージェントSEVAを提案する。
マルチコンポーネント出力における標準的なバイナリ報酬は、アドバンテージ崩壊を引き起こす -- グループ内の報酬分散は消滅し、GRPO勾配は消滅する。
我々は、検証品質をプロセス信号に向けて70/30の独立した5つのコンポーネントに分解し、勾配を復元し、暗黙のカリキュラムを誘導するプロセス報酬で解決する。エージェントは検証動作をマスターする(アライメント0.917 -> 0.997, フォーマット72% -> 100%), そして結果(F1 64.9 -> 69.0)。
構造化された出力は、さらに Verify -> Reflect -> Probe -> Refine self-evolution loopを可能にし、7Bモデル上の4ラウンド以上のラウンドが予期せぬ構造的発見を行う: 各ラウンドは、ジェネラリストではなくベンチマークスペシャリストを生成する(HaluEvalでは+15 pp、同じモデルではTruthfulQAでは-10 ppから-14 pp)。
ClearFacts では、SEVA-3B は GPT-4o-mini (69.0 vs. 69.8 F1) と一致し、よりリッチで監査可能な出力を生成する。
関連論文リスト
- Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL [12.234169944475537]
RefGRPOは、標準的なRLアルゴリズムを2つの重要な要素で強化する、シンプルだが効果的な修正である。
エージェント自身の反射と実際の結果とを対比して計算した自由キャリブレーションボーナス。
結果の反射は、エージェントを環境フィードバックに基づく独自の検証器に変える。
論文 参考訳(メタデータ) (2026-06-12T07:47:15Z) - Automating Formal Verification with Reinforcement Learning and Recursive Inference [0.0]
我々はダフニーで検証可能な報酬(RLVR)と検証者誘導推論時間探索を用いてオープンソースモデルを訓練する。
固定ベースモデルでは、証明修正器を備えた完全な足場は、直接修理中の初期VeriCodingパイロットセットのパスレートを46.2%から69.2%に改善する。
Rust $texttcurve25519-dalek$検証プロジェクトから派生した,レポジトリスケールのLeanベンチマークであるDalek-Benchについても紹介します。
論文 参考訳(メタデータ) (2026-05-29T06:59:28Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - AgentV-RL: Scaling Reward Modeling with Agentic Verifier [63.55502685076245]
試験時間スケーリング(TTS)によるLCM推論を強化する検証器が実証されている。
本稿では,報酬モデリングを多ターンツール拡張型検討プロセスに変換するフレームワークであるエージェント検証を提案する。
Agentic Verifier は並列およびシーケンシャルTS の両方で一貫した性能向上が得られることを示す。
論文 参考訳(メタデータ) (2026-04-17T12:27:36Z) - AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling [12.42698406379544]
AgentHERは、自然言語エージェントトラジェクトリにHindsight Experience原則を適用することで、失われたトレーニング信号を回復する。
破棄された障害を高品質のSFT、DPO、ShareGPTトレーニングデータに変換する。
WebArena Replay (Zhou et al., 2024)とToolBench (Qin et al., 2024)では、AgentHERは4つのモデルファミリーで成功のみのSFTを+7.1-11.7ppで改善している。
論文 参考訳(メタデータ) (2026-03-22T18:36:58Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - Replayable Financial Agents: A Determinism-Faithfulness Assurance Harness for Tool-Using LLM Agents [0.7699235580548228]
LLMエージェントは、規制監査のリプレイに苦労する: トランザクションフラグ付き決定を同じ入力で再現するように要求された場合、ほとんどのデプロイメントは一貫性のある結果を返すことができません。
本稿では,金融サービスに展開するツール利用エージェントにおけるトラジェクティブ決定性およびエビデンス条件の忠実度を測定するためのフレームワークであるDFAHを紹介する。
論文 参考訳(メタデータ) (2026-01-17T19:47:55Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。