論文の概要: FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search
- arxiv url: http://arxiv.org/abs/2606.00660v1
- Date: Sat, 30 May 2026 10:21:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 00:57:58.911955
- Title: FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search
- Title(参考訳): FineVerify: エージェント検索のためのファイングラインド自己検証によるテスト時間計算のスケーリング
- Abstract要約: FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 88.16262636915975
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic search requires language model agents to explore many sources and answer complex information-seeking questions. Scaling test-time compute is a promising way to improve these agents, but current approaches can fail, because correct answers are often sparse and score-based selection depends on model calibration. We propose FineVerify, a fine-grained self-verification framework that decomposes each question into checkable sub-questions, verifies sampled candidates against each sub-question, and selects the candidate with the highest aggregated score. This per-check structure turns selection into simpler local judgments and produces scores under the same explicit criteria. Across four agentic search benchmarks and two models, FineVerify consistently outperforms standard scaling baselines. With only four sampled trajectories, it improves GPT-5-mini by 8.2 accuracy points and Gemini-3-flash by 5.6% on average. With 12 samples, FineVerify enables GPT-5-mini to surpass frontier GPT-5 on BrowseComp-Plus. Beyond accuracy, FineVerify produces interpretable verification traces that help audit benchmark errors, suggesting broader applications for inspecting agentic search systems. Code and data are available at https://github.com/XuZhao0/fineverify
- Abstract(参考訳): エージェント検索では、言語モデルエージェントが多くの情報源を探索し、複雑な情報検索の質問に答える必要がある。
テスト時間計算のスケールは、これらのエージェントを改善するための有望な方法であるが、正しい答えがしばしばスパースであり、スコアベースの選択はモデルの校正に依存するため、現在のアプローチは失敗する可能性がある。
本研究では,各質問をチェック可能なサブクエストに分解し,各サブクエストに対してサンプル候補を検証し,最もスコアの高い候補を選択する,きめ細かい自己検証フレームワークであるFineVerifyを提案する。
このチェック単位の構造は、選択をより単純な局所的な判断に変換し、同じ明示的な基準の下でスコアを生成する。
4つのエージェント検索ベンチマークと2つのモデルで、FinVerifyは標準のスケーリングベースラインを一貫して上回っている。
サンプル軌道は4つしかなく、GPT-5-miniを8.2の精度で改善し、Gemini-3-flashを平均5.6%改善した。
FineVerifyは12のサンプルで、BrowseComp-PlusでGPT-5-miniがフロンティアのGPT-5を超えることができる。
FineVerifyは精度の他に、ベンチマークエラーの監査に役立つ解釈可能な検証トレースを生成し、エージェント検索システムを調べるための幅広い応用を提案する。
コードとデータはhttps://github.com/XuZhao0/fineverifyで公開されている。
関連論文リスト
- AutoVerifier: Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification [5.990350746292239]
AutoVerifierは繰り返し検証エラーから暗黙の仮定を学ぶ。
4つの検証器ベンチマークの実験により、AutoVerifierは最先端の検証器を大きなマージンで上回ることを示した。
論文 参考訳(メタデータ) (2026-08-26T11:06:40Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Adaptive Test-Time Compute Allocation via Learned Heuristics over Categorical Structure [1.8055130471307603]
テスト時間計算は、大規模言語モデル(LLM)推論の進歩の原動力となっている。
我々は,検証作業が中間状態にまたがってどのように配置されるべきか,検証コストに制限のある環境下での推論について検討する。
本研究では, (i) 構造化された移動インタフェース上での確定可能性ゲーティング, (ii) 学習された状態距離と残差スコアのハイブリッドを用いた事前検証ランキング, (iii) 局所的不確実性に基づく検証呼び出しの適応的アロケーションを組み合わせた状態レベルの選択的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-03T19:57:53Z) - Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification [71.98473277917962]
近年のDeep Research Agents (DRA) の進歩は、自動知識発見と問題解決に変化をもたらしている。
本稿では,政策モデルのアウトプットを反復的に検証することで,エージェントの能力を自己進化させる手法を提案する。
検証の非対称性を生かしたルーブリックスに基づく結果報酬検証器であるDeepVerifierを提案する。
論文 参考訳(メタデータ) (2026-01-22T09:47:31Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Trust but Verify! A Survey on Verification Design for Test-time Scaling [8.428618801719198]
テスト時スケーリング(TTS)は,大規模言語モデルのパフォーマンス向上のための新たなフロンティアとして登場した。
検証者は、復号プロセスから候補出力をスコアするのに役立つ報酬モデルとして機能する。
検証者は、素早いベースで、識別または生成モデルとして微調整することができる。
論文 参考訳(メタデータ) (2025-08-20T22:27:21Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Reward Models Enable Scalable Code Verification by Trading Accuracy for Throughput [21.59519440154879]
結果報酬モデル(ORM)が,速度のトレーディング精度を通じて検証をスケールする上で重要な役割を担っていることを示す。
生成-帰属-ランクのアプローチを分析し、不正だが高いランクの解をフィルタリングすることで機能することを示す。
論文 参考訳(メタデータ) (2025-06-11T17:58:21Z) - Claim Check-Worthiness Detection: How Well do LLMs Grasp Annotation Guidelines? [0.0]
ファクトチェックを必要とするテキストセグメントを識別するために、ゼロショットと少数ショットのLCMプロンプトを使用する。
各種領域の5つのCD/CWデータセットに対して,LLMの予測精度と校正精度を評価した。
提案手法により, 最適急進的冗長性はドメイン依存であり, 文脈の追加は性能を向上しないことがわかった。
論文 参考訳(メタデータ) (2024-04-18T13:31:05Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。