論文の概要: HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following
- arxiv url: http://arxiv.org/abs/2607.25398v2
- Date: Wed, 29 Jul 2026 19:12:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.260583
- Title: HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following
- Title(参考訳): HANDBOOK.md: 長期的エージェント教育のベンチマーク
- Authors: Liudas Panavas, Sebastian Minus, Bradley Monton, Derek Ray, Suhaas Garre, Sushant Mehta, Edwin Chen,
- Abstract要約: Handbook_mdは65のエージェントタスクのベンチマークである。
タスクは5つのドメイン(ファイナンス、医療請求、保険、物流、人事)と10の架空の会社にまたがる。
各タスクは、要求されたアクションが発生し、禁止されたアクションが起こらなかったことの両方をチェックする、プログラム的な基準のルーリックを持っています。
- 参考スコア(独自算出の注目度): 0.8998688639218773
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language-model agents are increasingly deployed under standing instructions: a system prompt, a policy file, or a skills document is placed in context, and the agent is trusted to let it govern every action that follows. Existing benchmarks rarely test this deployment pattern directly; they measure whether an agent can complete a task, not whether a long, binding policy document actually constrains its behavior over an extended tool-use horizon. We present HANDBOOK_md, a benchmark of 65 agentic tasks modeled on how enterprise employees follow company handbooks. Each task places an agent in a self-contained company environment, a file workspace together with mock email, chat, calendar, issue-tracking, and commerce services exposed over the Model Context Protocol, and instructs it to carry out routine professional work governed by an expert-written standard operating procedure of 20 to 124 pages. Tasks span five domains (finance, medical billing, insurance, logistics, and HR) and ten fictional companies. To resist memorization, every task modifies one of ten base handbooks, altering the specific rules and thresholds on which grading turns, so no two tasks share a policy. Grading is fully deterministic: each task carries a rubric of programmatic criteria (824 in total) that check both that required actions occurred and that prohibited actions did not. Under strict grading, where a trial passes only if every criterion is satisfied, the best of thirty evaluated model configurations passes 36.2% of trials, and most frontier configurations remain below 25%. Failures follow consistent patterns: agents let a plausible in-environment request override the standing policy, perform a required check and then act against its result, lose rule details over long horizons, and report compliance they did not achieve. We release all tasks, environments, and the evaluation harness.
- Abstract(参考訳): システムプロンプト、ポリシーファイル、あるいはスキルドキュメントがコンテキストに置かれ、エージェントはそれに続くすべてのアクションを管理できるように信頼される。
エージェントがタスクを完了できるかどうかを計測し、長いバインディングポリシー文書が、拡張ツール使用地平線上で実際にその振る舞いを制約するかどうかを計測する。
HANDBOOK_mdは、企業従業員が企業のハンドブックをどうフォローするかをモデル化した65のエージェントタスクのベンチマークである。
各タスクは、エージェントを自己完結した企業環境、ファイルワークスペース、モックメール、チャット、カレンダー、イシュートラッキング、コマースサービスと共にModel Context Protocol上に公開し、専門家によって書かれた20から124ページの標準的な操作手順によって管理される定期的なプロフェッショナルな作業を実行するように指示する。
タスクは5つのドメイン(ファイナンス、医療請求、保険、物流、人事)と10の架空の会社にまたがる。
暗記に抵抗するために、各タスクは10のベースハンドブックのうちの1つを変更し、グレーディングが回転する特定のルールとしきい値を変更するため、2つのタスクはポリシーを共有しない。
それぞれのタスクは、要求されたアクションが発生し、禁止されたアクションが起こらなかったことの両方をチェックする、プログラム的基準(合計824)のルーリックを持ちます。
厳格な格付けでは、全ての基準が満たされた場合にのみトライアルが通過し、評価された30のモデル構成のうち最高のものはトライアルの36.2%を通り、ほとんどのフロンティア構成は25%以下である。
エージェントは、信頼できる環境内要求を待機ポリシーをオーバーライドし、必要なチェックを実行し、その結果に対して行動し、長い地平線を越えてルールの詳細をなくし、彼らが達成しなかったコンプライアンスを報告します。
すべてのタスク、環境、評価ハーネスをリリースします。
関連論文リスト
- Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation [37.16322609017877]
Messierは、30のベンチマーク、714のエージェント、11,891のタスク、74,205の検証を含む957,253レコードの統一コーパスである。
M Messierは公開ベンチマークのスコアを集約し、6つの未表現の専門分野と科学分野にわたる5エージェントの実行を補完する。
論文 参考訳(メタデータ) (2026-07-28T15:50:19Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning [52.23991730630292]
大規模言語モデルは、パラメトリックな知識から答えるのではなく、文書を推論するエージェントとして、ますます多くデプロイされている。
大規模な、散らかった職場ファイルの集合にスパース証拠を配置し、一貫性のない用語、単位、時間規則を調整し、答えを計算する。
私たちは、362の質問と9,664の認証ドキュメントと372Mのトークンの8つのドメインコレクションをペアリングするベンチマークであるAgoraを紹介します。
論文 参考訳(メタデータ) (2026-06-23T12:57:18Z) - Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents [8.419155861590548]
本稿では,SKILL.mdファイルを可読性のあるタスクコントラクトとして整理するための,GovernSpecにインスパイアされた設計フレームワークであるコントラクトスキルを提案する。
このフレームワークは、コントラクトスキル、GovernSpec YAMLコントラクト、モデルコンテキストプロトコル(MCP)サーフェス、ツールアダプタ、ランタイムガードレール、トレース、評価システムの境界を明確にしている。
論文 参考訳(メタデータ) (2026-05-21T15:40:05Z) - CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows? [150.84850629123287]
現実的な医療業務のエンドツーエンドの自動化は、現在のベンチマークで不足している3つの機能を強調します。
$-Benchは3つのドメインにわたる長期医療のベンチマークである。
30以上のエージェントハーネス/モデル構成で、最高のエージェントはタスクの28.0%しか解決せず、厳格なパス3では20%をクリアし、単一のセッションですべてのタスクを実行するとパフォーマンスは3.8%に低下する。
論文 参考訳(メタデータ) (2026-05-15T22:34:31Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。