論文の概要: SAAG: Structured Agent Assessment and Grounding
- arxiv url: http://arxiv.org/abs/2607.18245v1
- Date: Thu, 30 Apr 2026 19:33:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.087433
- Title: SAAG: Structured Agent Assessment and Grounding
- Title(参考訳): SAAG:構造化エージェント評価と接地
- Abstract要約: 本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
- 参考スコア(独自算出の注目度): 13.62148061055744
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Exact-match evaluation of agent-calling obscures qualitatively different failure modes: a model may select the right function yet hallucinate argument values, or satisfy a schema while choosing a agent for the wrong reason. Existing benchmarks collapse these distinctions into a single binary score, leaving practitioners unable to diagnose where agent calls fail. We propose SAAG a cascaded diagnostic framework that decomposes agent-calling evaluation into three sequential stages: registry conformance, structural completeness, and argument grounding, each producing interpretable stage-specific diagnostics. These diagnostics additionally enable iterative self-repair: on prediction failure, the stage-specific signal guides targeted correction without leaking ground-truth values. We evaluate this framework on a controlled benchmark derived from Glaive's function-calling dataset across registry sizes of 5, 10, and 15 agents using three local sub-4B-parameter models. Structured feedback consistently improves argument precision and reduces value hallucination relative to single-pass inference and uninformative binary feedback, while end-to-end F1 gains are modest and model-dependent. These results suggest that stage-decomposed diagnostic evaluation is a necessary lens for understanding and improving agent-calling reliability across model families and registry scales.
- Abstract(参考訳): エージェント呼び出しの厳密な評価は、定性的に異なる障害モードを曖昧にする: モデルは、引数値が幻覚的でない正しい関数を選択したり、間違った理由でエージェントを選択しながらスキーマを満足する。
既存のベンチマークはこれらの区別を1つのバイナリスコアに分解し、実践者はエージェント呼び出しがどこで失敗するかを診断することができない。
本稿では,エージェントコール評価を,レジストリ適合性,構造完全性,引数基底の3段階に分解し,それぞれが解釈可能なステージ固有の診断を行うケースケード診断フレームワークSAAGを提案する。
これらの診断はまた、反復的な自己修復を可能にする:予測失敗において、ステージ固有の信号ガイドは、接地真実の値を漏らさずに修正をターゲットにしている。
このフレームワークは,Glaiveの関数呼び出しデータセットから得られた,5,10,15エージェントを3つのローカルサブ-4Bパラメータモデルを用いて評価する。
構造化されたフィードバックは、引数の精度を一貫して改善し、シングルパス推論と非形式的バイナリフィードバックに対する値幻覚を低減します。
以上の結果から,ステージ分解診断評価は,モデルファミリおよびレジストリスケールにおけるエージェント呼び出し信頼性の理解と向上に必要であると考えられた。
関連論文リスト
- Fault Detection and Explainable Classification in Automotive HIL Validation via Denoising Autoencoders and In-Context Large Language Models [1.9435397960631864]
機械学習とディープラーニングは高度な故障診断を持っているが、ほとんどの教師付きモデルは大きなラベル付きデータセットを必要とする。
実時間検証における故障検出と分類のための汎用的で説明可能な2相フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-04T06:43:43Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening [0.8758828205574085]
協調的な多段階検証プロセスをシミュレートするマルチエージェント監査フレームワークを提案する。
臨床精神保健検診の感度領域において,このアーキテクチャを実証的に検証した。
本フレームワークは, 推論過程を知覚エージェント, 知識検索生成(RAG), CoT (Chain-of-Thought) 臨床推論, 重要な監査段階に分解する。
論文 参考訳(メタデータ) (2026-06-19T05:51:03Z) - Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications [17.69274632062373]
オープンエンドの会話エージェントは、早期診断ハンドオフとサイレントな臨床幻覚という、2つの重要な障害モードを伴いがちである。
LLM-as-a-judge'のルーティングを決定論的オーケストレーション制約に置き換えることで、両方の問題に対処するマルチエージェントフレームワークを提案する。
本稿では,150症例を対象に,ラマ3.1-70b-インストラクトモデルを用いたシミュレートされた患者エージェントを用いたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-06-16T15:39:19Z) - AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora [6.956097396264084]
AuthTraceは,主題的に密集した単一著者コーパスに基づいて構築された診断ベンチマークである。
AuthTraceは明示的な引用されたエビデンス、正確なファンインアノテーション、エビデンスリコール、エビデンス精度、答えの正当性を測定する統一パックレベルのプロトコルを提供する。
論文 参考訳(メタデータ) (2026-05-25T03:10:52Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。