論文の概要: Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
- arxiv url: http://arxiv.org/abs/2607.13034v1
- Date: Tue, 14 Jul 2026 17:59:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.247759
- Title: Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
- Title(参考訳): AIエージェントはタスクの単純さを知っているか? -複雑度を考慮した推論と実行に向けて-
- Authors: Junjie Yin, Xinyu Feng,
- Abstract要約: 大規模言語モデル(LLM)エージェントは、ますます多段階のエンジニアリングと情報処理を自動化する。
彼らはしばしば、最大コンテキストファーストの戦略に従い、ファイルや依存関係を読み取り、一行の編集を小さなコードベースの監査に切り替える。
タスク対応型実行-スコープ推定の欠如を論じる。
- 参考スコア(独自算出の注目度): 1.733151600403503
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents increasingly automate multi-step engineering and informatics workflows, yet they rarely ask how much effort a task actually requires. They often follow a maximum-context-first strategy--re-reading files and dependencies they have already seen--turning a one-line edit into a small code-base audit. We argue the missing capability is task-aware execution-scope estimation: judging a task's difficulty, the information it truly needs, and the shortest reliable path before committing budget. We formalize minimum-sufficient execution and the Agent Cognitive Redundancy Ratio (ACRR), and propose E3 (Estimate, Execute, Expand): the agent estimates an initial operating point, executes a minimum viable path, and expands scope only when verification fails. On MSE-Bench--a deterministic benchmark of 121 edits in a capability-controlled simulator--E3 matches the strongest baseline's 100% success while cutting cost by 85%, tokens by 91%, and inspected files by 92%, and further beats a strong adaptive retrieval baseline by 16%; the gains survive held-out instruction wording and essentially every cost weighting. A companion real-model harness (LLM-Case) corroborates the effect on a live gpt-4o agent editing a real open-source library, with every candidate patch graded by actually running the project's real pytest suite against a measured oracle: the over-reading is milder but real, and E3 is the leanest and fastest policy at comparable task success--its one shortfall a provider rate-limit, not a wrong edit. We frame this as a controlled probe of execution redundancy, not a measurement of any deployed agent, and position task-aware execution as a step toward engineering-grounded AI (EGAI)--agents whose effort is anchored in the engineering reality of the task. We release the framework and benchmark.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、ますます多段階のエンジニアリングと情報処理のワークフローを自動化する。
彼らはしばしば、最大コンテキストファーストの戦略に従い、ファイルや依存関係を読み取り、一行の編集を小さなコードベースの監査に切り替える。
タスクの難しさ、それが本当に必要とする情報、予算をコミットする前に最も信頼できる経路を判断する。
我々は、最小十分実行とエージェント認知冗長率(ACRR)を定式化し、E3(推定、実行、拡張):エージェントが初期動作点を推定し、最小実行可能なパスを実行し、検証が失敗した場合にのみスコープを拡大する。
MSE-Bench - 能力制御シミュレータで121の編集を行う決定論的ベンチマーク--E3は、最強ベースラインの100%の成功と、コストを85%削減し、トークンを91%削減し、ファイルを92%検査し、さらに強力な適応型検索ベースラインを16%上回った。
コンパニオンリアルモデルハーネス(LLM-Case)は、実際のオープンソースライブラリを編集するライブgpt-4oエージェントに対する効果を、プロジェクトの実際のピペストスイートを実際に測定されたオラクルに対して実行することによって、グレードされたすべてのパッチで裏付ける。
我々は、これを、デプロイされたエージェントの測定ではなく、実行冗長性の制御されたプローブとみなし、タスクのエンジニアリング現実に根ざしたエンジニアリングベースAI(EGAI)へのステップとしてタスク認識実行を配置する。
フレームワークとベンチマークをリリースします。
関連論文リスト
- AgentAbstain: Do LLM Agents Know When Not to Act? [19.223843408018997]
既存の評価は、エージェントがいつ禁じるべきかを知るのではなく、タスクの成功に焦点を当てている。
エージェント禁忌のための最初の体系的評価枠組みとして,ツールを用いたLDMエージェントの動作を検知するキャリブレーション能力について述べる。
AgentAbstainは、エージェントネイティブな分類に基づくペアタスクのベンチマークである。
論文 参考訳(メタデータ) (2026-07-11T00:57:36Z) - RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents [0.0]
RigorBenchは、AIコーディングエージェントのプロセス規律を測定する最初のベンチマークである。
プランニングフィデリティ、検証カバレッジ、回復効率、吸収品質、原子遷移積分の5つの柱にまたがるハーネスを評価している。
その結果,構造化プロセスの規律はプロセス品質のスコアを平均41%向上させ,下流結果の正しさを17%向上させることがわかった。
論文 参考訳(メタデータ) (2026-06-21T21:41:34Z) - ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End? [28.383940617377856]
ORAgentBenchは、自律エージェントを運用研究タスクで評価するための実行基盤ベンチマークである。
さまざまな運用シナリオにまたがる107のヒューマンレビュータスクが含まれており、それぞれに自然言語で簡潔な複数ファイルデータ、設定アーティファクト、必要なスキーマがパッケージされている。
14のフロンティアエージェントモデルによる実験では、現在のエージェントは信頼性の高いORの実践から程遠いままである。
論文 参考訳(メタデータ) (2026-06-18T04:43:23Z) - GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows [90.35728421223673]
GTA-2はジェネラル・ツール・エージェント(GTA)の階層的なベンチマークである
現実世界の認証に基づいて構築され、実際のユーザクエリ、デプロイツール、マルチモーダルコンテキストを活用する。
実験では、フロンティアモデルは既に原子タスクに苦戦しているが、トップモデルは14.39%の成功しか達成していない。
論文 参考訳(メタデータ) (2026-04-17T05:36:00Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents [30.48395228595732]
Aresは、マルチステップエージェントタスク用に調整された、ステップごとの動的推論作業選択のためのフレームワークである。
我々は、ステップ完了に要する最小の推論労力を識別するデータ生成パイプラインを開発する。
ツール使用エージェントのTAU-Bench,ディープ検索エージェントのBrowseComp-Plus,WebエージェントのWebArenaなど,さまざまなエージェントタスクに対してAlesを評価した。
論文 参考訳(メタデータ) (2026-03-09T03:17:29Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。