論文の概要: Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning
- arxiv url: http://arxiv.org/abs/2608.19009v1
- Date: Wed, 19 Aug 2026 15:10:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.43725
- Title: Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning
- Title(参考訳): グレーディング・ザ・グレーダー:LLM推論のための検証オートノミーレベル(L0-L5)
- Abstract要約: 本稿では,一軸に沿ったメタ標準分類法を提案する。
VAL は L0 (LLM self-declaration) から L2 (Objective Ground truth, correctness only) から L3 (Single-property or domain-level completeness) までの範囲である。
置換およびサンプリングに基づく検証は、提案された候補が保持されていることを確認できるが、候補が見逃されたことを証明できない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly paired with verifiers (step checkers, self-consistency filters, tool-based fact checkers, formal proof assistants) that claim to detect the model's errors. Yet the verification literature uses the word "level" to mean at least five different things: verification granularity, concept abstraction, risk tier, system-stack layer, and the epistemic source of the ground truth. We propose Verification Autonomy Levels (VAL), a meta-standard classifying verification schemes along a single axis: where does the verification spec come from, and what does the verdict guarantee? VAL ranges from L0 (LLM self-declaration, no deterministic anchor) through L2 (objective ground truth, correctness only) to L3/L4 (decidable systems with single-property or domain-level completeness), with L5 impossible in the unrestricted case. Central to VAL is the completeness blind spot: substitution- and sampling-based verifiers can confirm that proposed candidates hold, but cannot prove that no candidate was missed. We further identify a dichotomy the literature has not stated: completeness is reachable only for formally specifiable properties, while empirical open-world verification (fact-checking, diagnosis) caps at anchored correctness (L2). We document this across four domains (symbolic mathematics, behavior monitoring, medical diagnosis, and code generation) and in the strongest existing formal-verification baseline, whose authors note the verifier "focuses on the correctness of each step." We show the levels of granularity, concept hierarchy, risk, and system stack are orthogonal to VAL, resolving a systematic conflation across 17 surveyed papers. Code and full assessment are released as supplementary material.
- Abstract(参考訳): 大規模言語モデル(LLM)は、モデルのエラーを検出すると主張する検証者(ステップチェッカー、自己整合フィルタ、ツールベースのファクトチェッカー、フォーマルな証明アシスタント)とペアになってきています。
しかし、検証文献は「レベル」という言葉を少なくとも5つの異なる意味:検証の粒度、概念の抽象化、リスク層、システムスタック層、そして地上真実の疫学的な源である。
検証仕様はどこから来たのか,検証基準は何を保証しているのか,といったメタスタンダードな検証手法である検証自律度(VAL)を提案する。
VAL は L0 (LLM self-declaration, no deterministic anchor) から L2 (objective ground truth, correctness only) から L3/L4 (decidable systems with single-property or domain-level completeness) まで様々である。
置換およびサンプリングに基づく検証は、提案された候補が保持されていることを確認できるが、候補が見逃されたことを証明できない。
完全性は形式的に特定可能な特性に対してのみ到達可能であり、実証的なオープンワールド検証(ファクトチェック、診断)キャップはアンカード正当性(L2)である。
我々は、これを4つの領域(記号数学、行動監視、医学診断、コード生成)にまたがって文書化し、既存の最強の形式検証ベースラインで検証を「各ステップの正しさに焦点をあてる」と記している。
VALに直交する粒度,概念階層,リスク,システムスタックのレベルを示す。
コードと完全なアセスメントは補足資料としてリリースされる。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - ITPEval: Benchmarking Formal Translation Across Interactive Theorem Provers [77.95933562142014]
ITPEvalは、4つの主要なIPP間で自動形式証明翻訳を評価するための最初のベンチマークである。
itpevalは、状態が分離されたウォームバックエンドを備えた、統合されたマルチITP認証インフラストラクチャです。
論文 参考訳(メタデータ) (2026-07-07T22:05:55Z) - ForEx: A Formal Verification Framework for Explainable Reasoning in Logical Fallacy Detection and Annotation [0.0]
大規模な言語モデルをLean4に変換するフレームワークであるForExを提案する。
ForExは、翻訳された論理式が、元の自然言語引数の論理的妥当性ではなく、符号化された前提の下で導出可能であるかどうかを検証する。
論文 参考訳(メタデータ) (2026-06-20T04:10:02Z) - Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture [0.3823356975862005]
検証を伴うアーキテクチャペア生成を3つの原則に基づいて記述する。
この決定論的な分割は、整合性のある分類として組織化され、中核的な貢献である。
MedSci Skillsは、43のスキルのオープンソースツールキットで、21の決定論的階層を持ち、3つのパブリックデータセットパイプラインで評価されている。
論文 参考訳(メタデータ) (2026-06-08T13:51:04Z) - Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks [0.0]
確率的検証パターン(自己整合性投票、レビュアー LLM アンサンブル)は、人工物ではなく、判断を生成する。
Pramana は、ワイヤフォーマットの欠如を定義している。すべての連続エージェント出力は、タイプ付き ClaimAttestation でラップされ、4つの変種のうちの1つでラップされる。
プラマナは3つの対称性を再現したモデル(38,563個の到達可能な状態、0個の不変な違反)でTLCの下で徹底的に検証された。
論文 参考訳(メタデータ) (2026-05-19T17:00:33Z) - Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models [53.279391576560755]
大規模言語モデル(LLM)は、広範囲のNLPタスクにおいて顕著な流速と汎用性を示してきたが、実際的な不正確さと制限が伴う傾向にある。
これは、信頼と妥当性が最優先される医療、法律、科学コミュニケーションといった、高リスク領域に重大なリスクをもたらす。
LLM出力の事実的信頼性と解釈可能性を高めるために設計されたDAVinCI - Dual Attribution and Verificationフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-04-23T01:37:50Z) - Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM [0.17188280334580197]
事実確認と呼ばれるクレーム検証は、潜在的な誤情報を特定するのに役立つ。
ほとんどの自動クレーム検証システムは単一の知識源に依存している。
オープンドメインのクレーム検証のための新しいシステムを提案する。
論文 参考訳(メタデータ) (2026-02-21T02:21:31Z) - Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking [64.97768177044355]
大規模言語モデル(LLM)は、現実のファクトチェックシステムにますます多くデプロイされている。
FactArenaは、完全に自動化されたアリーナスタイルの評価フレームワークである。
本研究では,静的クレーム検証精度とエンドツーエンドのファクトチェック能力の相違点を明らかにした。
論文 参考訳(メタデータ) (2026-01-06T02:51:56Z) - Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math [80.46254366870447]
私たちは500時間以上の人的労力で生成された段階レベルの検証ベンチマークであるHard2Verifyを紹介します。
我々は29人の生成的批評家とプロセス報酬モデルを評価し、いくつかの点を超えて、オープンソースの検証者がクローズドソースモデルを評価することを実証した。
論文 参考訳(メタデータ) (2025-10-15T16:50:54Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - FactTest: Factuality Testing in Large Language Models with Finite-Sample and Distribution-Free Guarantees [41.78390564658645]
幻覚や非現実的コンテンツを生成するための大規模言語モデル(LLM)は、高い領域での信頼性を損なう。
FactTest は LLM が与えられた質問に対する正しい回答を確実に提供できるかどうかを統計的に評価する新しいフレームワークである。
本研究では,FactTestが幻覚を効果的に検出し,未知の疑問に答えることを禁じるモデルの能力を向上させることにより,40%以上の精度向上を実現していることを示す。
論文 参考訳(メタデータ) (2024-11-04T20:53:04Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。