論文の概要: TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation
- arxiv url: http://arxiv.org/abs/2608.11236v1
- Date: Fri, 31 Jul 2026 07:35:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.590192
- Title: TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation
- Title(参考訳): TRACE Bench: タスク駆動型ロールプレイエージェントチェックリストの評価
- Abstract要約: TRACE Benchはタスク駆動型エージェントチェックリスト評価フレームワークである。
各ロールプロファイルをオフラインで固定チェックリストに分解し、User Agentを使用してターゲットロールプレイモデルと自然に会話する。
- 参考スコア(独自算出の注目度): 18.790627074364963
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Roleplay evaluation should do more than assign a single score: it should reveal which role requirements were tested, which failed, and which dialogue evidence supports the judgment. We propose TRACE Bench, a task-driven agentic checklist evaluation framework. It decomposes each role profile offline into a fixed checklist, then uses a User Agent to converse naturally with the target roleplay model while privately updating checklist states from model responses. Scores therefore trace back to checklist items and supporting dialogue turns rather than a black-box holistic impression. For coverage cross-validation, we audit released M2 free-dialogue transcripts from the MiniMax Role-play Benchmark against the same role-derived checklist. The released free-chat transcripts cover only 73.74% of key role-profile points, whereas TRACE Bench reaches 99.91% coverage in fewer turns. Robustness experiments show stable rankings under repeated runs and User Agent replacement. Across 26 models, TRACE Bench reports overall rankings together with capability breakdowns and checklist traces. It also supports Closed-Loop Benchmark Evolution, distilling verification methods proven effective in failed traces so later evaluations can more reliably elicit and examine observed failure modes.
- Abstract(参考訳): ロールプレイ評価は、1つのスコアを割り当てる以上のことをすべきであり、どのロール要件がテストされたか、どのロール要件が失敗し、どのダイアログエビデンスが判断を支持するかを明らかにするべきである。
タスク駆動型エージェントチェックリスト評価フレームワークであるTRACE Benchを提案する。
各ロールプロファイルをオフラインで固定されたチェックリストに分解し、User Agentを使用してターゲットロールプレイモデルと自然に会話し、モデル応答からチェックリスト状態をプライベートに更新する。
スコアはブラックボックスの全体的な印象ではなく、チェックリスト項目に遡り、対話をサポートする。
クロスバリデーションのカバレッジについては、MiniMax Role-play BenchmarkからM2free-dialogue transcriptsを同じロール由来のチェックリストに対して監査します。
リリースされた無料の文字起こしは73.74%に過ぎず、TRACE Benchは99.91%にも達した。
ロバストネスの実験では、繰り返し実行される安定したランキングとユーザエージェントの置き換えが示されている。
26モデルを超えるTRACE Benchは、全体的なランキングと機能ブレークダウンとチェックリストトレースを報告している。
また、クローズドループベンチマーク進化(Closed-Loop Benchmark Evolution)もサポートしている。
関連論文リスト
- Grounded Checklist Partial Credit for Agent Skill Trajectories [5.028537745773042]
グラウンドドチェックリスト部分クレジット(GCPC)は、エージェント軌跡の人為的な部分クレジット評価である。
12のタスクから96のトラジェクトリに対する人間の評価は、G CPCが人間の進捗評価とより密接に一致していることを示している。
パイプラインはターミナルベンチやSWEベンチにも移行し、スキル条件による評価を超えた適用性を示す。
論文 参考訳(メタデータ) (2026-08-26T06:17:19Z) - Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI [6.058290832294911]
エージェントベンチマークは、リポジトリの編集、Web研究、端末の使用、長期のインタラクションをますます評価している。
最近の報奨ベンチマークとシステムレポートは、エージェントが代わりに公開ソリューションを回復し、評価成果物を読み、ジェネレータ構造を推論し、フィードバックを操作し、不正なスコアリングパスの恩恵を受けることができることを示している。
我々は、プロトコルの有効性を定式化し、露出を特定し、エージェントがどのように使用したかを決定し、その結果のスコアが誤解を招くかどうかを評価するポストホック監査であるHackDetectを導入する。
論文 参考訳(メタデータ) (2026-07-24T14:55:19Z) - Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation [3.079997053226693]
本報告では,4つの主要なツールコール・ベンチマーク・ファミリーの体系的妥当性と評価について述べる。
496人の専門家がレビューしたベンチマークタスクのうち、92人の評価者と人間の意見の不一致が18.5%のミスアライメントレートに対応している。
ツールコール評価失敗、トレースレベルの監査成果物、修正された評価項目の統一分類を導入し、ツールの実行、タスク完了、結果検証を別々に計測する指標について議論する。
論文 参考訳(メタデータ) (2026-06-30T21:10:42Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Rollout Cards: A Reproducibility Standard for Agent Research [15.381365113892848]
論文は、レポートされたスコアでシステムを比較し、それらのスコアの背後にロールアウトレコードを残すことは、検査が困難である。
エージェント的なタスクでは、評価がロールアウトの異なる部分を選択したり、異なるレポートルールを適用する場合、同じ振る舞いが異なるレポートスコアを受け取ることができるため、これが重要です。
50の人気のあるトレーニングと評価レポジトリの構造化監査では、ヘッドラインスコアとともに、実行が失敗、エラー、あるいはスキップされた回数を報告していないことが判明した。
論文 参考訳(メタデータ) (2026-05-12T13:54:31Z) - Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation [8.049844623361725]
インタラクティブエージェントベンチマークは、結果チェックを通じてエージェントの実行をバイナリ結果にマッピングする。
これらのチェックは、表面レベル信号に依存するか、エージェントの実際のアクションパスをキャプチャできない。
既存のベンチマークに対して、結果エビデンスレポート層を導入します。
論文 参考訳(メタデータ) (2026-05-11T12:20:15Z) - TeamBench: Evaluating Agent Coordination under Enforced Role Separation [37.301600461027654]
TeamBenchは、オペレーティングシステムの強化されたロール分離の下でエージェント調整を評価するためのベンチマークである。
TeamBenchは仕様アクセス、ワークスペース編集、Planner、Executor、Verifierロール間の最終認証を分離する。
論文 参考訳(メタデータ) (2026-05-08T00:48:45Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories [61.38499597241457]
我々は,LLM審査員によるWebエージェント評価の有効性を評価する最初のベンチマークであるAgentRewardBenchを提案する。
ベンチマークを用いて,12名のLLM審査員を評価し,全てのベンチマークでLLMが排他的でないことを発見した。
また、一般的なベンチマークで使用されるルールベースの評価は、Webエージェントの成功率を過小評価する傾向にあることも見出した。
論文 参考訳(メタデータ) (2025-04-11T19:49:22Z) - ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning [63.77667876176978]
大規模言語モデルでは、最終回答を正当化するためにステップバイステップの推論を生成するように促された場合、ダウンストリームタスクの解釈可能性が改善されている。
これらの推論ステップは、モデルの解釈可能性と検証を大幅に改善するが、客観的にそれらの正確性を研究することは困難である。
本稿では、従来のテキスト生成評価指標を改善し拡張する、解釈可能な教師なし自動スコアのスイートであるROSを提案する。
論文 参考訳(メタデータ) (2022-12-15T15:52:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。