論文の概要: GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation
- arxiv url: http://arxiv.org/abs/2606.22737v1
- Date: Mon, 22 Jun 2026 00:41:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 04:54:08.61998
- Title: GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation
- Title(参考訳): GroundEval: ステートフルエージェント評価におけるLCM-as-Judgeの決定論的リプレース
- Authors: Jeffrey Flynt,
- Abstract要約: GroundEvalは, エージェントを接地的, 時間的に制限された, アクセス制御された証拠に対して評価する, 判断自由なフレームワークである。
GroundEvalはドメイン構成を使用して質問を生成し、エージェントが答える方法を選択し、最後に生成した回答と記録された軌跡の両方をスコアする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Before letting an agent operate over real context, can you prove it used the right evidence? GroundEval turns that question into a deterministic test of what the agent searched, fetched, cited, and was permitted to access. In one case study, two frontier LLM judges scored a plausible agent response above 0.85. But the trace told a different story: the agent had never retrieved the artifact its answer depended on, yielding a GroundEval score of 0.000. We introduce GroundEval, a judge-free framework for evaluating agents against grounded, time-bounded, and access-controlled evidence. GroundEval uses a domain configuration to generate questions, lets the agent choose how to answer, and then scores both the final answer and the recorded trajectory that produced it. The benchmark targets three failures that LLM-as-judge evaluation struggles to detect: whether an agent checked before claiming absence, reasoned only from evidence available to the actor at the relevant time, and used the correct causal mechanism rather than a plausible one. These correspond to three tracks: Silence, Perspective, and Counterfactual. GroundEval exposes when plausible answers rest on invalid evidence paths, and produces structured per-question diagnostics that pair tool activity with the agent's turn-level narration, making each score inspectable rather than merely reported. What our case studies turned up is that this gap isn't some rare corner case. It's exactly the blind spot that final-answer and judge-based scoring were never built to catch.
- Abstract(参考訳): エージェントを実際の状況で操作させる前に、それが正しい証拠を使っていることを証明できますか?
GroundEvalは、その質問を、エージェントが検索し、フェッチし、引用し、アクセスすることを許可した決定論的テストに変える。
あるケーススタディでは、2人のフロンティアのLSM判事が0.85以上で有望な反応を示した。
しかし、この痕跡は別の物語を語っていた: エージェントは、その答えが依存する人工物を取り戻すことは一度もなく、グラウンド・エスバルのスコアは0.000だった。
GroundEvalは, エージェントを接地的, 時間的に制限された, アクセス制御された証拠に対して評価する, 判断自由なフレームワークである。
GroundEvalはドメイン構成を使用して質問を生成し、エージェントが答える方法を選択し、最後に生成した回答と記録された軌跡の両方をスコアする。
このベンチマークは、LCM-as-judge評価が検出に苦慮している3つの障害をターゲットにしている。
これらはサイレンス、パースペクティブ、カウンターファクトリーの3つのトラックに対応している。
GroundEvalは、妥当な答えが不正なエビデンスパスに留まっているときに露呈し、エージェントのターンレベルのナレーションとツールアクティビティを組み合わせ、単に報告されるのではなく、各スコアを検査可能にする、構造化されたクエリごとの診断を生成する。
今回のケーススタディで明らかになったのは、このギャップは珍しいケースではありません。
ファイナル・アンサーと審査員によるスコアは、決してキャッチするために作られていない、まさに盲点です。
関連論文リスト
- Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories [51.22051230894794]
最終回答に基づく評価は、エージェントが成功するかどうかを示すが、どの部分の軌道が答えを信頼できないかを示すものではない。
2つのエージェントフレームワーク、3つのバックボーンモデル、3つのベンチマークから2,790の実際のトラジェクトリを収集し、生ログをセマンティックスパンに変換し、エキスパートレビューを通じて有害なエラースパンを注釈付けします。
我々は,エージェントの主張を追跡するクレーム中心の監査フレームワークであるDRIFTを提案する。
論文 参考訳(メタデータ) (2026-06-01T10:50:26Z) - QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents [38.13248430205106]
QUACKはマルチモーダルな社会的推論におけるエージェント言語の基礎を監査するための評価フレームワークである。
エンジンログから各エージェントの基幹軌道を再構築し、それに対するすべての議論のクレームをチェックする。
最強のエージェントでさえ、検証可能な空間的主張の15.1%を幻覚させ、根拠のない証拠なしに告発の半数以上を犯している。
論文 参考訳(メタデータ) (2026-05-26T14:19:08Z) - A measurement substrate for agentic Kubernetes operations: Methodology and a case study in retrieval-compounding falsification [0.0]
自律的な操作エージェントに関する実証的な主張は、ほとんど不可能である。
コードエージェントは「機能する」検証基板を持ち、高速でファルサブルで地味な信号に変換する。
ターゲットクラスタに障害を注入するクローズドループ計測フレームワークである Agent-breakage を提案する。
論文 参考訳(メタデータ) (2026-05-21T21:47:52Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning [0.6138671548064355]
大型言語モデル (LLMs) は、チェーン・オブ・ソート (CoT) 推論の判断としてますます使われている。
C2-Faithは、因果性(各ステップは以前の文脈から論理的に従うのか?
二つの因果検出,因果ステップの定位,カバレッジスコアの3つの課題において,フロンティア判事の評価を行った。
論文 参考訳(メタデータ) (2026-03-05T13:36:47Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。