論文の概要: Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models
- arxiv url: http://arxiv.org/abs/2609.13005v1
- Date: Fri, 11 Sep 2026 16:04:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.801334
- Title: Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models
- Title(参考訳): アプリケーションマニュアルの課題:言語モデルのための長期手続き推論におけるギャップの探索
- Abstract要約: 大規模言語モデル(LLM)は、幅広い自然言語タスクにおいて高い性能を達成している。
本稿では,長期的手続き的推論のベンチマークであるタスク・オーバー・アプリケーション・マニュアル(TAM)を紹介する。
ICD-10-CMクリニカルコーディングと米国の連邦判決という2つの領域から現実世界のタスクをキュレートしてTAMを構築する。
- 参考スコア(独自算出の注目度): 2.6851230921077742
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have achieved strong performance on a wide range of natural language tasks, and recent benchmarks suggest that they are increasingly adept at multi-hop reasoning. However, these benchmarks are typically short-horizon, requiring only a small number of retrieval or inference steps, and provide limited evidence of reliability on real-world tasks that involve following manuals spanning hundreds of pages with complex, interdependent guidelines. In this paper, we introduce Tasks over Application Manuals (TAM), a benchmark for evaluating long-horizon procedural reasoning. We construct TAM by curating real-world tasks from two domains: ICD-10-CM clinical coding (mapping medical conditions to diagnostic codes) and U.S. federal sentencing (computing crime sentencing guideline outcomes, specifically offense levels), with human-validated labels. Each task requires following an authoritative manual with tens of thousands of rules and executing a sequence of interdependent steps across different sections to produce an exact answer. We evaluate general-purpose prompting approaches, including retrieval-augmented generation, ReAct-style prompting, and an agent-harness baseline on GPT-5, and find that the best exact-match performance remains extremely low: 1% on ICD-10-CM coding and 15.5% on sentencing tasks. These results show that current benchmarks may overestimate LLM reasoning ability and miss a key challenge: reliably following long, rule-based procedures. The complete TAM data and code are publicly available.
- Abstract(参考訳): 大規模言語モデル(LLM)は、幅広い自然言語タスクにおいて高いパフォーマンスを達成しており、最近のベンチマークでは、マルチホップ推論に適応していることが示唆されている。
しかし、これらのベンチマークは通常短水平であり、少数の検索や推論ステップしか必要とせず、複雑な相互依存ガイドラインを持つ数百ページに及ぶマニュアルを追従する実際のタスクに対する信頼性の限られた証拠を提供する。
本稿では,長期的手続き的推論を評価するためのベンチマークである,アプリケーションマニュアル上のタスク(TAM)について紹介する。
ICD-10-CMクリニカルコーディング(医療条件を診断基準にマッピングする)と米国連邦判決(犯罪判決結果、特に犯罪レベルを計算する)の2つの領域から現実世界のタスクをキュレートし、TAMを構築する。
各タスクは、数万のルールを持つ権威マニュアルに従って、異なるセクションにわたる相互依存ステップのシーケンスを実行し、正確な答えを生成する必要がある。
我々は,GPT-5における検索強化生成,ReActスタイルのプロンプト,エージェントハーネスベースラインなどの汎用的なプロンプト手法の評価を行った。
これらの結果は、現在のベンチマークがLLM推論能力を過大評価し、重要な課題を見逃す可能性があることを示している。
完全なTAMデータとコードは公開されている。
関連論文リスト
- MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding [83.0805548642958]
MTAC-IFBenchは、ソフトウェア開発におけるインストラクションフォローのための包括的なベンチマークである。
6つのプライマリと18のセカンダリカテゴリにまたがるさまざまな制約を持つ、多ターンプログレッシブなソフトウェア開発指示が特徴である。
MTAC-IFBenchは、マルチターン命令フォローにおける既存のコードエージェントの重大な欠陥を認識し、インタラクションセッションが長くなるにつれてパフォーマンスが急速に低下する。
論文 参考訳(メタデータ) (2026-09-14T03:57:37Z) - SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models [59.90381306452982]
ソフトウェアエンジニアリングのための大規模言語モデル(LLM)の評価は、タスクカバレッジの狭さ、言語バイアス、現実世界の開発者との整合性の不足によって制限されている。
SWE-1は、不均一なコード関連評価を構造化および生産整合性のあるフレームワークに統合する包括的なベンチマークである。
SWE-は8つのタスクタイプ、8つのプログラミングシナリオ、10のプログラミング言語にまたがる。
論文 参考訳(メタデータ) (2025-11-07T18:01:32Z) - Re-Evaluating Code LLM Benchmarks Under Semantic Mutation [8.58692613099365]
本稿では,コードベンチマークの迅速感度を調査するための実証的研究について述べる。
本稿では,プロンプトテンプレートのセマンティクスと構造を両立させる手法として,プロンプトテンプレートを改良する汎用フレームワークを提案する。
この結果から, 急激な変化であっても, 性能が著しく変化することが示唆された。
論文 参考訳(メタデータ) (2025-06-20T15:30:36Z) - ImpliRet: Benchmarking the Implicit Fact Retrieval Challenge [50.93758649363798]
Impliretは、推論の課題をドキュメント側処理にシフトするベンチマークである。
我々は,この環境下で苦戦している,疎水・密集したレトリバーの幅を評価した。
論文 参考訳(メタデータ) (2025-06-17T11:08:29Z) - TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine [22.179602943420907]
我々は,大規模なTCM言語モデルを評価するために特別に設計された,最初の総合マルチモーダルQAデータセットであるTCM-Ladderを紹介する。
このデータセットは、基礎理論、診断、草本式、内科、外科、薬物療法、小児科を含む、TCMの複数の中核分野をカバーする。
データセットは自動と手動のフィルタリングプロセスを組み合わせて構築され、52,000以上の質問で構成されている。
論文 参考訳(メタデータ) (2025-05-29T23:13:57Z) - AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios [51.46347732659174]
LLM(Large Language Models)は、現実世界のエージェントアプリケーションにおいて高度な機能を示す。
AgentIFは、エージェントシナリオでLLM命令に従う能力を体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T17:31:10Z) - Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation [1.7268889851975326]
私たちは、テスト駆動開発(TDD)タスクにおいて、大規模言語モデル(LLM)を評価するための新しいベンチマークであるWebApp1Kを紹介します。
自然言語のプロンプトに依存する従来のアプローチとは異なり、我々のベンチマークでは、LLMがテストケースから直接機能を解釈し実装する能力を強調しています。
論文 参考訳(メタデータ) (2025-05-13T23:47:12Z) - SCoRE: Benchmarking Long-Chain Reasoning in Commonsense Scenarios [33.72114830484246]
SCoRE(Scenario-based Commonsense Reasoning Evaluation)は、エンティティ、リレーション、論理ルールのシナリオスキーマからマルチホップ質問を合成するベンチマークである。
SCoREには100kのバイリンガル(中国語と英語の)複数選択質問が含まれており、推論チェーンは2-11ホップにまたがり、様々な難易度にグループ化されている。
論文 参考訳(メタデータ) (2025-03-08T13:40:10Z) - HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly [34.205934899868346]
HELMETは7つの多様なアプリケーション中心のカテゴリを包含する総合ベンチマークである。
NIAHのような合成タスクは、下流のパフォーマンスを確実に予測できない。
ほとんどのLCLMは完全なNIAHスコアを達成しているが、タスクが完全コンテキスト推論を必要とする場合、オープンソースモデルはクローズドなスコアよりも大幅に遅れている。
論文 参考訳(メタデータ) (2024-10-03T17:20:11Z) - MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains [54.117238759317004]
大規模マルチタスクエージェント理解(MMAU)ベンチマークは、複雑な環境設定を必要としない包括的なオフラインタスクを特徴としている。
ツールユース、DAG(Directed Acyclic Graph)QA、データサイエンスと機械学習コーディング、コンテストレベルのプログラミング、数学の5分野にわたるモデルを評価する。
3K以上の異なるプロンプトを含む20の精巧に設計されたタスクにより、MMAUはLLMエージェントの強度と限界を評価するための包括的なフレームワークを提供する。
論文 参考訳(メタデータ) (2024-07-18T00:58:41Z) - PEARL: Prompting Large Language Models to Plan and Execute Actions Over
Long Documents [78.27865456183397]
長い文書に対する推論を改善するためのフレームワークであるPEARLを提案する。
PEARLの各ステージは、最小限の人間の入力でゼロショットまたは少数ショットのプロンプトによって実装される。
PEARLをQuALITYデータセットの挑戦的なサブセットで評価し、長い物語テキストに対して複雑な推論を必要とする質問を含む。
論文 参考訳(メタデータ) (2023-05-23T23:06:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。