論文の概要: Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning
- arxiv url: http://arxiv.org/abs/2610.06366v1
- Date: Mon, 05 Oct 2026 14:03:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 08:49:56.800207
- Title: Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning
- Title(参考訳): 誤り推論の正しい検証:LLMに基づく脆弱性推論の構造的監査
- Abstract要約: Vulnerability Explanation Reasoning Auditor (VERA)は脆弱性推論を監査する自動化フレームワークである。
VERAは、追跡ポインタ、メモリ操作、状態遷移を機械可読フィールドでコードする構造化推論レコード(SRR)を出力するようモデルに要求する。
多段階の裁判官は、決定論的チェックを使用して、各SRRを8つの推論失敗モードに対して監査し、LLMコールは意味解釈のために予約される。
評価の結果,誤判定は誤判定の頻度と同じ頻度で発生し,VERA は LLM-as-judge が体系的に誤りである推理誤差の 87% を公表した。
- 参考スコア(独自算出の注目度): 5.712163468212997
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed for automated software vulnerability analysis. Binary classification alone is insufficient; practitioners need explanations to triage bugs and engineer patches. Standard practice relies on Chain-of-Thought (CoT) prompting, but free-form reasoning allows models to obscure logical leaps, hallucinated execution steps, and internal inconsistencies behind plausible prose. Our manual audit reveals that approximately 60% of correct vulnerability verdicts are accompanied by fabricated or unverifiable claims, and free-form explanations allow reasoning errors to evade LLM-as-a-judge evaluation. We present Vulnerability Explanation Reasoning Auditor (VERA), an automated framework for auditing LLM vulnerability reasoning. Rather than accepting free-form text, VERA asks models to output a Structured Reasoning Record (SRR) encoding tracked pointers, memory operations, and state transitions in machine-readable fields. A multi-stage judge audits each SRR against eight reasoning failure modes using deterministic checks, with LLM calls reserved for semantic interpretation. The standardized SRR schema also enables automated mutation testing to benchmark judges at scale without human annotation. Our evaluation shows reasoning flaws occur in correct verdicts just as frequently as incorrect ones, and VERA exposes 87% of reasoning errors that free-form LLM-as-judge systematically miss.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ソフトウェアの自動脆弱性分析のためにますます多くデプロイされている。
バイナリ分類だけでは不十分であり、実践者はバグとエンジニアのパッチをトリアージするために説明が必要である。
標準的なプラクティスは、CoT(Chain-of-Thought)のプロンプトに頼っているが、自由形式の推論により、モデルは、論理的な飛躍、幻覚的な実行ステップ、そして、妥当な散文の背後にある内部の矛盾を曖昧にすることができる。
筆者らの手動検査では, 脆弱性判定の約60%は偽造又は未検証のクレームが伴っており, フリーフォームの説明では, LLM-as-a-judge 評価を回避できることがわかった。
LLMの脆弱性推論を監査する自動化フレームワークであるVERA(Vulnerability Explanation Reasoning Auditor)を提案する。
自由形式のテキストを受け入れる代わりに、VERAはモデルに追跡ポインタ、メモリ操作、状態遷移を機械可読フィールドで符号化する構造化推論レコード(SRR)を出力するよう要求する。
多段階の裁判官は、決定論的チェックを使用して、各SRRを8つの推論失敗モードに対して監査し、LLMコールは意味解釈のために予約される。
標準化されたSRRスキーマでは、人間のアノテーションを使わずに、審査員を大規模にベンチマークする自動突然変異テストも可能である。
評価の結果,誤判定は誤判定の頻度と同じ頻度で発生し,VERA は LLM-as-judge が体系的に誤りである推理誤差の 87% を公表した。
関連論文リスト
- Are LLMs Reliable Code Reviewers? Systematic Overcorrection in Requirement Conformance Judgement [8.059802912761919]
我々は,大規模言語モデル(LLM)が自然言語要求にマッチするコードの体系的失敗を明らかにする。
より詳細なプロンプト設計、特に説明や修正提案を必要とするものは、より高い誤判定率をもたらす。
そこで本稿では,提案した修正を実効的証拠として扱う固定誘導検証フィルタを提案する。
論文 参考訳(メタデータ) (2026-02-28T08:35:25Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - RULERS: Locked Rubrics and Evidence-Anchored Scoring for Robust LLM Evaluation [15.787947727055611]
本稿では,自然言語ルーブを実行可能な仕様に変換するコンパイラ・エグゼクタフレームワークであるRULERSを紹介する。
RULERSは、基準をバージョニングされた不変バンドルにコンパイルし、決定論的証拠検証による構造化復号を強制し、軽量なワッサーシュタインベースのポストホックキャリブレーションを適用する。
論文 参考訳(メタデータ) (2026-01-13T15:31:42Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking [64.97768177044355]
大規模言語モデル(LLM)は、現実のファクトチェックシステムにますます多くデプロイされている。
FactArenaは、完全に自動化されたアリーナスタイルの評価フレームワークである。
本研究では,静的クレーム検証精度とエンドツーエンドのファクトチェック能力の相違点を明らかにした。
論文 参考訳(メタデータ) (2026-01-06T02:51:56Z) - Semi-structured LLM Reasoners Can Be Rigorously Audited [43.72257027288094]
半構造化推論モデル (SSRM) を導入し, 推論の半構造化表現を生成する訓練を行った。
SSRMは、実行不可能なPythonの構文で推論トレースを生成し、各推論ステップを指定し、入力と出力をマークする。
これらの手法はすべて、予測可能な推論エラーを効果的にフラグできることを示す。
論文 参考訳(メタデータ) (2025-05-30T05:06:10Z) - Everything You Wanted to Know About LLM-based Vulnerability Detection But Were Afraid to Ask [30.819697001992154]
大規模言語モデルは、自動脆弱性検出のための有望なツールである。
LLMは現実世界の脆弱性を検出するのに本当に効果的か?
本稿では, LLM は (i) 信頼できないこと, (ii) コードパッチに敏感であること, (iii) モデルスケールにまたがる性能評価の3つを, 広く支持されているコミュニティの信念に異議を唱える。
論文 参考訳(メタデータ) (2025-04-18T05:32:47Z) - A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning [73.77088902676306]
論理的推論の文脈において,大規模言語モデル(LLM)の自己検証能力について詳しく検討する。
本研究の主目的は,既存のLCMが誤った推論手順を正確に識別するのに苦労し,自己検証法の有効性を保証できないことにある。
論文 参考訳(メタデータ) (2023-11-14T07:13:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。