論文の概要: ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents
- arxiv url: http://arxiv.org/abs/2607.28037v1
- Date: Thu, 30 Jul 2026 11:18:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.525019
- Title: ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents
- Title(参考訳): ClawTrack: トレースレベル評価と実世界の自律エージェントの改善を目指して
- Authors: Xingjian Wu, Xuhang Zhu, Xingchen Liu, Junlin Liu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai,
- Abstract要約: エージェントが何を達成し、どのように達成するかを同時に測定するデュアルアセスメントベンチマークであるClawTrackを提示する。
ClawTrackは8つのドメインにわたる320のタスクと25以上の決定論的モックサービスで構成されている。
プロセスグレーダは、12,541のタスク固有の項目で固定された4次元(ゴールアライメント、効率性、情報利用、結果検証)に沿って各推論ターンをスコアする。
- 参考スコア(独自算出の注目度): 23.840537431318296
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLM-based agents are deployed in complex, multi-step workflows, a critical evaluation gap has emerged: most existing benchmarks judge only final outcomes, unable to distinguish reliable reasoning from lucky success or attribute failures to specific process deficiencies, hindering attribution in long-horizon tasks. In this work, we present ClawTrack, a dual-assessment benchmark that simultaneously measures what an agent achieves (Task Score) and how it achieves it (Process Score). ClawTrack comprises 320 tasks across 8 domains with 25+ deterministic mock services. A Process Grader scores each reasoning turn along four dimensions (goal alignment, efficiency, information utilization, and result verification), anchored by 12,541 task-specific rubric items. Evaluating 21 models over 16,000+ trials, we find that: (1) process scores effectively attribute success and failure to specific reasoning dimensions, filtering lucky passes invisible to outcome-only evaluation; (2) the four dimensions are complementary, with result verification as the systematic bottleneck; (3) the framework is robust to evaluator choice across different judge LLMs; and (4) process-based trajectory filtering yields consistent post-training improvements across model scales.
- Abstract(参考訳): LLMベースのエージェントが複雑なマルチステップのワークフローにデプロイされるにつれて、重要な評価ギャップが出現した。ほとんどの既存のベンチマークは最終結果のみを判断し、ラッキーな成功や特定のプロセスの欠陥に対する信頼性の高い推論や属性の失敗を区別することができず、長期的なタスクにおける帰属を妨げている。
本稿では,エージェントが達成するもの(Task Score)とそれを実現する方法(Process Score)を同時に測定する,二重評価ベンチマークであるClawTrackを紹介する。
ClawTrackは8つのドメインにわたる320のタスクと25以上の決定論的モックサービスで構成されている。
プロセスグレーダは、4次元(ゴールアライメント、効率性、情報利用、結果検証)に沿って各推論ターンをスコアし、12,541のタスク固有のルーリックアイテムをアンカーする。
16,000以上の試験で21モデルを評価したところ,(1) プロセススコアは, 特定の推論次元に対する成功と失敗を効果的に評価し, 結果のみに見えないラッキーパスをフィルタリングする,(2) 結果検証を系統的ボトルネックとして補完する,(3) プロセスベースの軌道フィルタリングは, 異なる判断 LLM 間での選択肢選択に頑健である,(4) プロセスベーストラジェクトリフィルタリングは, モデルスケール間で一貫したトレーニング後の改善をもたらす,という結果が得られた。
関連論文リスト
- Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking [0.0]
本稿では,小売会話システムの大規模評価を行うための管理型構成駆動パイプラインであるGenAI Evaluationを提案する。
このフレームワークは、有用性、真理性、明瞭性、音調アライメント、翻訳特化次元を評価する。
パイプラインのマクロF1スコアは0.93で、翻訳の精度は89%だった。
論文 参考訳(メタデータ) (2026-07-13T19:01:56Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Beyond Binary Correctness: Scaling Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks [4.09533297040075]
大規模言語モデルは、数学やプログラミングのような客観的に検証可能なタスクに優れており、評価は単体テストや一つの正しい答えに還元される。
LH-Benchは、二項正当性を超えて、主観的エンタープライズタスクにおける自律的長期実行をスコアする3ピラー評価設計である。
論文 参考訳(メタデータ) (2026-03-24T03:16:32Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance [92.72779885657373]
本稿では,視覚エンコーダの内部関数力学におけるモデル選択の基盤となるフレームワークを提案する。
提案手法は,各タスクをレイヤワイドコンダクタンスにより表現し,エントロピー正規化アライメントによる目標条件付きブロック重要度分布を導出する。
そこで本研究では,DCD(Directional Conductance Divergence)という,ソースタスクが対象の機能ブロックをいかに効果的にカバーするかを定量化する非対称な指標を提案する。
論文 参考訳(メタデータ) (2026-02-01T17:29:43Z) - CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks [53.88194225946438]
Chain-of-Thought for Detection (CoT4Det)は、知覚タスクを3つの解釈可能なステップに再構成するシンプルだが効率的な戦略である。
一般的な視覚言語能力を損なうことなく,CoT4Detは認識性能を著しく向上させることを示す。
論文 参考訳(メタデータ) (2025-12-07T05:26:30Z) - DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks [10.977990951788422]
DrawingBenchはエージェントLLMの信頼性を評価するための検証フレームワークである。
我々のフレームワークは、20のカテゴリに250の多様なプロンプトと4つの難易度から構成されている。
我々は1000回の試験で4つの最先端LCMを評価した。
論文 参考訳(メタデータ) (2025-12-01T01:18:21Z) - TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model [21.82904448561646]
大規模言語モデル(LLM)は複雑な推論タスクにおいて顕著な進歩を示している。
Best-of-N選択パラダイムは、複数の独立に生成された推論軌道から選択することで、スケーラブルなパフォーマンス改善をもたらす。
プロセスレベルのスコアリングのために,サンプルLLMの隠れ状態を利用する,効率的かつ効果的なBest-of-NフレームワークであるTrajSelectorを紹介した。
論文 参考訳(メタデータ) (2025-10-18T11:01:39Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。