論文の概要: Evaluate the Stack, Not the Layer: Do Deterministic and LLM Gates for Agent Actions Fail Independently?
- arxiv url: http://arxiv.org/abs/2610.07359v1
- Date: Mon, 05 Oct 2026 20:26:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.653666
- Title: Evaluate the Stack, Not the Layer: Do Deterministic and LLM Gates for Agent Actions Fail Independently?
- Title(参考訳): レイヤーではなくスタックを評価する: エージェントアクションの決定論的ゲートとLDMゲートは独立して失敗するか?
- Abstract要約: エージェントツールコールのゲートは、エラーが乗算されるという仮定に基づいて積み上げられる。
我々は3つのコーパスから1,119個のラベル付きエージェントの作用を適応的敵を伴わずにテストした。
- 参考スコア(独自算出の注目度): 2.9991161518367875
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Runtime gates for agent tool calls are stacked on the assumption that their errors multiply. We test it on 1,119 labelled agent actions from three corpora, without an adaptive adversary. The stack has one deterministic rule layer and four LLM judges, three of them re-collected with the served model recorded on every call. We read each stack as a number of multiplication-equivalent layers, n_mult, with its floor under perfect coupling. Under the STRICT miss definition (escalation to a human scored as not stopped), any two judges compose to about 1.2 to 1.4 layers (φ median +0.430, 6 of 6 pairs significant, floors 1.02 to 1.17). The rule layer plus one judge composes to 1.86 to 2.09 layers (φ median +0.014, 0 of 4 significant, floors 1.01 to 1.09). Under PRIMARY (escalation scored as caught) the bands are 1.21 to 1.57 and 1.80 to 2.13. Intervals separate on the pooled data, point estimates split on each corpus, and a third-vendor judge lands in the judge band. Solo accuracy does not predict what a layer adds: a cloud rule pack lowers the rule layer's solo miss rate by 20% and adds no new joint coverage. The difficulty share of judge coupling is not identifiable: 31.8% to 61.8% depending on the probe and the miss definition. One judge tier was served by an unrequested model version in 50 of 112 batches, concentrated on the external corpus. That event overturned a pre-declared analysis rule, and the scoring of review verdicts reversed five conclusions. We report both.
- Abstract(参考訳): エージェントツールコールのランタイムゲートは、エラーが乗算可能であるという仮定に基づいて積み上げられる。
我々は3つのコーパスから1,119個のラベル付きエージェントの作用を適応的敵を伴わずにテストした。
スタックには1つの決定論的ルール層と4つのLCMジャッジがあり、そのうち3つはすべての呼び出しに記録されたサーブモデルで再コンパイルされる。
我々は各スタックを複数の乗算等価層 n_mult として読み、そのフロアは完全な結合状態にある。
STRICTのミス定義では、2人の裁判官は1.2から1.4の層(φの中央値 +0.430, 6組のうち6つが重要なフロア1.02から1.17)を構成する。
規則層と1つの裁判官は、1.86から2.09層(φ中央値+0.014、4つの重要なフロアの0、1.01から1.09)に構成する。
PRIMARYでは、バンドは1.21から1.57、そして1.80から2.13である。
インターバルはプールされたデータに基づいて分離され、各コーパスでポイント推定が分割され、第3のベンダーの裁判官が審査バンドに着陸する。
クラウドルールパックは、ルールレイヤのソロミス率を20%低くし、新たなジョイントカバレッジを追加しない。
判定カップリングの難易度は、プローブとミス定義による31.8%から61.8%である。
112回のうち50回は未要求のモデルが提供され、外部のコーパスに集中していた。
この出来事は事前に宣言された分析ルールを覆し、レビューの評決の採点が5つの結論を覆した。
両方報告します。
関連論文リスト
- Frozen Judges, Moving Agents: Version-Dependent LLM-Judge Error and the Limits of Judge-Assisted Agent Evaluation [7.504639516424482]
言語モデル審査員はエージェントのアップグレードを前任者と比較するが、固定された審査員はバージョンに依存した誤りを犯すことがある。
公開コーディングエージェント35件、カスタマーサービスエージェント2件、専門家ラベル付きエージェントRewardBenchトラジェクトリ1,106件を分析した。
論文 参考訳(メタデータ) (2026-09-28T03:10:18Z) - Pinned and Still Unstable: Within-Judge Verdict Variance and the Noise Floor of LLM-as-Judge Leaderboards [0.0]
LLM評価は、審査員を固定されたモデルバージョンに固定し、温度ゼロで復号すると再現可能な判定が得られると仮定する。
この仮定は、LLM-as-Judgeがクラウドサービスインフラ上でどのように運用されているかという特性として失敗することを示す。
論文 参考訳(メタデータ) (2026-09-27T00:19:41Z) - JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places [34.429649156970015]
Jevを7つのベンチマークから9つのパネル上の3つのフラッシュレベルLCMの判定値と比較する。
Jevの精度は、27のペア比較のうち、少なくとも8つのペア比較において、それらと大きく異なる。
規則上の基準では、全てのLLM判事とJevは共にヒトのラッカーから出発する。
論文 参考訳(メタデータ) (2026-09-24T13:16:21Z) - Ask Which, Not How Good: Sizing Benchmarks Scored by an LLM [0.47745223151611654]
LLM判事によるベンチマークは、通常1点の10分の1の違いを判断するが、これらのベンチマークの解像度は測定されていない。
測定対象としてシステムを扱い,373,019の判断をシステム,項目,判断,相互作用成分に分解する。
論文 参考訳(メタデータ) (2026-08-17T09:08:49Z) - Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning [46.232038247686745]
フェデレートラーニング(FL)は、歯科診断AIにおけるプライバシー制約、不均一なデータ品質、一貫性のないラベル付けを緩和する。
複数のデータ破損シナリオを対象としたパノラマX線撮影において,FLと集中学習(CL)と局所学習(LL)を比較した。
論文 参考訳(メタデータ) (2025-09-08T11:07:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。