論文の概要: Lightweight, Rubric-Guided Trajectory Evaluation for Production AI Agents
- arxiv url: http://arxiv.org/abs/2610.03315v1
- Date: Fri, 02 Oct 2026 13:51:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.404747
- Title: Lightweight, Rubric-Guided Trajectory Evaluation for Production AI Agents
- Title(参考訳): 軽量・ルーブリック誘導型AIエージェントの軌道評価
- Abstract要約: LLMをベースとしたエージェントの信頼性向上には軌道評価が不可欠である。
textitLiteTrajEvalは,予算に縛られたごみ軌道評価のための軽量なアーキテクチャである。
LiteTrajEvalは、コンパクトなドメイン固有のルールプロファイルをオフラインに導出し、各トラジェクトリをオンラインで前処理し、障害信号をマークし、固定されたグローバル予算の下でシリアライズし、単一誘導LDM判事を呼び出し、構造化された診断レポートを生成する。
- 参考スコア(独自算出の注目度): 3.3627373439543793
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Trajectory evaluation is essential for improving the reliability of LLM-based agents, but production use makes it expensive to run repeatedly. Modern agents generate long traces containing tool calls, observations, retries, and external outputs, while not all raw tokens are equally useful for diagnosis. We present \textit{LiteTrajEval}, a lightweight architecture for budget-bounded trajectory evaluation. LiteTrajEval derives compact domain-specific rule profiles offline, then preprocesses each trajectory online, marks heuristic failure signals, serializes it under a fixed global budget, and invokes a single rubric-guided LLM judge to produce structured diagnostic reports. Evaluated on public Magentic-One-style and $τ$-bench-style trajectory datasets, LiteTrajEval improves failure-localization alignment with human annotations by roughly 20--35 percentage points on Magentic-One and up to 23 percentage points on $τ$-retail compared with AgentRx, while reducing cost by about 6$\times$ and evaluation time by more than 8$\times$. This solution has also been deployed in our enterprise agentic platform.
- Abstract(参考訳): LLMをベースとしたエージェントの信頼性向上には軌道評価が不可欠である。
現代のエージェントは、ツールコール、観察、再試行、外部出力を含む長いトレースを生成するが、すべての生トークンは診断に等しく有用ではない。
本稿では,予算境界軌道評価のための軽量アーキテクチャであるtextit{LiteTrajEval} を提案する。
LiteTrajEvalは、コンパクトなドメイン固有のルールプロファイルをオフラインに導出し、各トラジェクトリをオンラインで前処理し、ヒューリスティックな障害信号をマークし、固定されたグローバル予算の下でシリアライズし、構造化された診断レポートを作成するために単一のルーリック誘導LDM判事を呼び出す。
公開Magentic-Oneスタイルと$τ$-benchスタイルのトラジェクトリデータセットに基づいて評価されたLiteTrajEvalは、Magentic-Oneで約20~35ポイント、AgentRxで最大23ポイント、コストを約6$\times$で削減し、評価時間を8$\times$で改善する。
このソリューションは当社のエンタープライズエージェントプラットフォームにもデプロイされています。
関連論文リスト
- Dependency-Aware Trajectory Refinement for Efficient Multi-Turn Agent Fine-Tuning [46.007931431049194]
そこで本研究では,各軌跡を球面依存性DAGとみなし,どのラウンドがグローバルにロード・ベアリングされているかを明らかにする。
これらの編集は決定論的で解釈可能である。
これらの洗練された軌道で訓練されたモデルは、推論コストの低いオリジナルの軌道で訓練されたモデルよりも一貫して優れていた。
論文 参考訳(メタデータ) (2026-09-16T10:11:58Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Automatic Configuration of LLM Post-Training Pipelines [4.833783769369]
AutoPipeは、LCMポストトレーニングの構成選択のための予算対応フレームワークである。
オフラインでAutoPipeは、データセットで条件付けられた学習からランクまでのサロゲートを、過去の実行から学習する。
オンラインでは、AutoPipeはオフラインガイダンスを使用してベイジアン最適化とデータセット固有の偏差をモデル化する。
論文 参考訳(メタデータ) (2026-03-19T11:26:56Z) - Luna-2: Scalable Single-Token Evaluation with Small Language Models [2.256035939593399]
リアルタイムガードレールは正確で安価で高速な評価を必要とする。
今日のデフォルトの LLM-as-a-judge (LLMAJ) は遅く、高価で、運用上非決定論的である。
本稿では,デコーダのみの小型言語モデル(SLM)を決定論的評価モデルに活用する新しいアーキテクチャであるLuna-2を提案する。
論文 参考訳(メタデータ) (2026-02-20T19:43:58Z) - Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs [1.2691047660244335]
大きな言語モデル(LLM)エージェントは、長いシステム命令と大きなツールカタログを毎回繰り返しながら、多くのステップで実行されることが多い。
Instruction-Tool Retrieval (ITR)は,段階ごとに最小限のシステムプロンプトフラグメントと最小限のツールサブセットを検索するRAG変異体である。
ITRはステップ単位のコンテキストトークンを95%削減し、適切なツールルーティングを32%改善し、エンドツーエンドのエピソードコストをモノリシックベースラインに対して70%削減する。
論文 参考訳(メタデータ) (2025-12-01T06:43:43Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - Autonomous Evaluation of LLMs for Truth Maintenance and Reasoning Tasks [20.072783454089098]
本稿では,大規模言語モデル (LLM) 評価を形式的タスクに拡張するための新しいベンチマークである AutoEval を提案する。
AutoEvalは最初のベンチマークパラダイムであり、人間のラベルなしでLLMの客観的評価をスケールするのに必要ないくつかの重要な利点を提供している。
論文 参考訳(メタデータ) (2024-10-11T00:56:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。