論文の概要: ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance
- arxiv url: http://arxiv.org/abs/2609.09458v1
- Date: Tue, 08 Sep 2026 21:21:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.818964
- Title: ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance
- Title(参考訳): ContractEval: 手続き的インストラクション整合のためのクエリ記述型実行マッチング
- Abstract要約: 手続き的義務を明確にするための診断フレームワークであるConTRACTEVALを紹介する。
これは、手続き的な指示をクエリアクティブな義務として表現し、それらを応答や痕跡証拠と照合する。
ContractEvalはコンプライアンス保証ではない。最終回答の品質を暗黙にするのではなく、手続き順応を監査可能にする。
- 参考スコア(独自算出の注目度): 2.547425976804939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As LLM agents move from answering questions to carrying out procedures, failures can be unwarranted rather than visibly wrong: the final response looks acceptable even though the system skipped the check, branch, dependency, or invariant that made the answer justified. Output-only evaluation sees the answer, and trace-aware judging sees activity, but neither identifies which obligations were active for the query. We introduce CONTRACTEVAL, a diagnostic framework for making those active obligations explicit. It represents procedural instructions as query-active obligations and matches them against response or trace evidence, turning omissions, wrong branches, ordering errors, extra actions, invariant breaches, and output-contract violations into distinct conformance failures. On a controlled suite of audited procedural contracts, output-only and trace-aware LLM judges miss many injected structural failures; under gold expected and observed graphs, ContractEval detects and localizes all of them. LLM-backed extraction preserves much of this signal but remains calibration-sensitive. ContractEval is therefore not a compliance guarantee; it makes procedural conformance auditable rather than implicit in final-answer quality.
- Abstract(参考訳): システムがチェック、ブランチ、依存性、あるいはその答えを正当化した不変性をスキップしたとしても、最終応答は許容できるように見える。
アウトプットのみの評価は回答を、トレースアウェアによる判断はアクティビティを判断するが、クエリに対してアクティブな義務を特定できない。
本研究では,これらの積極的義務を明確にするための診断枠組みであるConTRACTEVALを紹介する。
これは、手続き的命令をクエリアクティブな義務として表現し、それらを応答またはトレースエビデンスにマッチさせ、省略、間違った分岐、エラーの順序付け、追加のアクション、不変な違反、出力-契約違反を異なる適合障害に変換する。
監査された手続き契約の制御スイートでは、出力のみおよびトレース対応のLLM判事は、多くの注入された構造的障害を見逃している。
LLMが支援する抽出は、この信号の多くを保存するが、校正感度は保たれている。
ですから、ContractEvalはコンプライアンス保証ではありません。
関連論文リスト
- From Intent to Execution Grant: An Execution-Boundary Conformance Profile for High-Risk AI Actions [9.27474112226667]
EBL-Coreは、1つの標準的な、完全に実体化されたAI生成候補が、明示的な条件下でアクションスコープ実行権限を受け取ることができるかどうかを決定する。
拘束力、政策非監視、エビデンス処理、決定論的判断、検証、ライフサイクル行動の付与などである。
100回の試験で32回の同時再空輸試験が成功し、1回の試行で完全に1回成功し、テスト効果が保護された。
論文 参考訳(メタデータ) (2026-09-10T14:21:45Z) - Mechanizing Typed Regulatory Actions for Security Tokens: Semantics, Falsification, and Bounded EVM Evidence [9.32030540168344]
セキュリティ標準は、実行された法的効果や、それが持つ証拠やリバース義務を特定せずに、特権的なコントロールを公開します。
我々はIsabelle/HOLで、FREEZE、SEIZE、CONFISCATE、LIQUIDATE、RESTRICT、RECOVERの6つのERC-8319の参照実行セマンティクスを定式化する。
論文 参考訳(メタデータ) (2026-08-29T08:23:27Z) - Scaling, Lock-In, and Proxy Compliance: A Political Economy of Responsible AI [1.253312107729806]
我々は、AIシステムの説明責任に対処するシーケンシャルな政治経済モデルを構築している。
我々は、AIベンダーが監査可能性と実体的緩和を選択し、デプロイはコストを切り替えながら導入後に監視し、実行は検証可能な証拠に依存することを示す。
その結果、ドキュメントと標準化された評価が、持続的なデプロイ後障害と共存する理由が説明できる。
論文 参考訳(メタデータ) (2026-07-30T11:12:13Z) - Evidence-in-the-Loop: Trace-Driven Optimization for Customer-Service LLM Agents [6.9430026014199635]
BM25リコール、イシュー-タイトル-ベクターリコール、イシュー-記述-ベクターリコール、重み付けされたRF核融合、クロスエンコーダリオークティングは、LLMの制御された決定の根拠となる証拠である。
ポリシー誘導オーケストレーションは、このRAGエビデンスとシナリオ固有のルールエビデンス、会話メモリ、固定されたLangGraph DAGcitelanggraph2024内の状態を忘れることとを組み合わせます。
再利用可能な配置パターンとして, textbfhybrid RAG evidence construction, textbfevidence-grounded issue/action decision, textbftrace-driven RAG がある。
論文 参考訳(メタデータ) (2026-07-20T15:07:58Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - Agentic Model Checking [12.832868209928039]
本稿では,LLMエージェントと境界モデルチェックバックエンドを結合するパラダイムを提案する。
我々は、BMC-Agentのアプローチをインスタンス化し、CとRustのLLM生成カーネルおよびコンパイラコード上で評価する。
論文 参考訳(メタデータ) (2026-05-20T17:25:52Z) - The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering [67.8271652641864]
我々は,隠蔽状態の介入によって検証の厳密性を制御できるかどうかを検討した。
VerifySteerは、サンプルレベルのルーティングに潜時補正信号を使用し、段落境界に選択的に介入する。
論文 参考訳(メタデータ) (2026-05-20T05:48:16Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems [0.0]
本稿では、その故障モードを測定するための決定論的ベンチマークであるPartial Evidence Benchを紹介する。
このベンチマークでは、デューディリジェンス、コンプライアンス監査、セキュリティインシデント対応の3つのシナリオファミリが提供されている。
答えの正しさ、完全性意識、ギャップレポートの品質、安全でない完全性行動の4つの面に沿ってシステムを評価する。
論文 参考訳(メタデータ) (2026-05-06T19:01:29Z) - PAVE: Premise-Aware Validation and Editing for Retrieval-Augmented LLMs [8.082352336629816]
PAVEは、根拠に基づく質問応答のための推論時検証層である。
検索されたコンテキストを質問条件のアトミックな事実に分解し、回答をドラフトし、抽出された前提によってそのドラフトがどの程度うまくサポートされているかをスコアし、ファイナライズ前に低サポート出力を更新する。
論文 参考訳(メタデータ) (2026-03-21T06:23:21Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval Augmented Generation [108.13261761812517]
本稿では,RAG出力における幻覚検出の新しい手法であるFRANQ(Fithfulness-based Retrieval Augmented Uncertainty Quantification)を紹介する。
本稿では,事実性と忠実性の両方に注釈を付したQAデータセットを提案する。
論文 参考訳(メタデータ) (2025-05-27T11:56:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。