論文の概要: PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling
- arxiv url: http://arxiv.org/abs/2608.08700v1
- Date: Sun, 09 Aug 2026 13:25:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.919655
- Title: PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling
- Title(参考訳): PluginEval: 関数呼び出しにおける細粒度エラー属性の診断ベンチマーク
- Authors: Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu,
- Abstract要約: 大規模言語モデルは、ますます自律的なエージェントとして機能している。
現在のベンチマークには3つの制限がある。
Evalは、2段階のフレームワークで構築されたベンチマークである。
- 参考スコア(独自算出の注目度): 11.1017602726296
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable evaluation of tool routing is critical as Large Language Models increasingly operate as autonomous agents. Current benchmarks face three structural limitations: data distributions that follow a power law leave rare scenarios underrepresented; the absence of adversarial hard negatives obscures performance differences across models; and annotation pipelines depend on LLM judgments that have not been validated through execution. In this paper, we introduce PluginEval, a benchmark constructed through a two-stage framework that systematically mitigates these limitations. First, we formulate tool routing as a sequence of three decisions and separate generation from verification. LLMs propose candidate calls, while deterministic validation and real API execution provide reliable quality signals. Second, we decompose each plugin by capability, intent, and boundary to identify trigger and exclusion scenarios. We then generate queries at different difficulty levels to fill coverage gaps, including adversarial negatives targeting three failure modes, and return them to the first stage for annotation. This process creates a closed loop that iterates until coverage converges. For evaluation, we move beyond aggregate accuracy. An LLM judge anchored to gold annotations classifies failures as missed calls, spurious calls, or parameter errors, producing a detailed error profile for each model. We evaluate five model families, including proprietary models and models with open weights, analyze their performance across difficulty levels and error categories, and validate the judge through agreement with human annotations.
- Abstract(参考訳): ツールルーティングの信頼性評価は,大規模言語モデルが自律エージェントとしてますます運用されるため,極めて重要である。
現在のベンチマークでは、3つの構造的制限に直面している: 電力法に従うデータ分散は、稀なシナリオを未表現のまま残す; 敵対的なハードネガティブがないことは、モデル間でのパフォーマンスの違いを曖昧にする; アノテーションパイプラインは実行を通じて検証されていないLCM判断に依存する。
本稿では,これらの制約を体系的に緩和する2段階フレームワークによって構築されたベンチマークであるPluginEvalを紹介する。
まず、ツールルーティングを3つの決定のシーケンスとして定式化し、検証から生成する。
LLMは候補呼び出しを提案し、決定論的検証と実際のAPI実行は信頼性の高い品質信号を提供する。
次に、各プラグインを機能、意図、バウンダリで分解し、トリガと排他的シナリオを特定します。
次に、異なる難易度でクエリを生成して、3つの障害モードをターゲットにした逆陰性を含むカバレッジギャップを埋め、アノテーションのために第1ステージに返します。
このプロセスは、カバレッジが収束するまで繰り返すクローズドループを生成する。
評価は,集計精度を超えて行う。
金のアノテーションに固定されたLLM判事は、失敗をミスコール、スプリアスコール、パラメータエラーとして分類し、各モデルに対して詳細なエラープロファイルを生成する。
オープンウェイトを持つモデルやモデルを含む5つのモデルファミリを評価し,難易度やエラーカテゴリをまたいだ性能を分析し,人間のアノテーションと一致して判断を検証した。
関連論文リスト
- Gatekeepers and Hallucinations: A Layered Evaluation Framework for LLM-Driven Quantum Circuit Generation [0.0]
材料インフォームド変分量子固有解器(VQE)回路生成のための階層評価フレームワークを提案する。
5つの異なるLCM障害モード(幾何学幻覚、存在しないAPI使用、統合障害、制約違反、検証不可能な出力)を分類する。
評価プラットフォーム自身のソースコードの法医学的な監査により、サイレントフォールバック・テンプレート置換によって、ハーネスに2つの明らかなモデル障害が生じたことが確認された。
論文 参考訳(メタデータ) (2026-06-16T19:17:54Z) - On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance [0.7303825588015752]
そこで本研究では,ユーザが提供する命令とモデルインターナライズドプリエントがどのように相互作用するかを検討する。
ゼロショット誤差の3分の2近くが修正に抵抗していることが判明した。
高信頼誤差は特に修正に耐性がある。
論文 参考訳(メタデータ) (2026-05-30T01:21:14Z) - Agentic Model Checking [12.832868209928039]
本稿では,LLMエージェントと境界モデルチェックバックエンドを結合するパラダイムを提案する。
我々は、BMC-Agentのアプローチをインスタンス化し、CとRustのLLM生成カーネルおよびコンパイラコード上で評価する。
論文 参考訳(メタデータ) (2026-05-20T17:25:52Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning [0.6138671548064355]
大型言語モデル (LLMs) は、チェーン・オブ・ソート (CoT) 推論の判断としてますます使われている。
C2-Faithは、因果性(各ステップは以前の文脈から論理的に従うのか?
二つの因果検出,因果ステップの定位,カバレッジスコアの3つの課題において,フロンティア判事の評価を行った。
論文 参考訳(メタデータ) (2026-03-05T13:36:47Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。