論文の概要: What Makes Software Issue Resolution Tasks Difficult for Agents?
- arxiv url: http://arxiv.org/abs/2608.18280v1
- Date: Tue, 18 Aug 2026 19:59:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.20042
- Title: What Makes Software Issue Resolution Tasks Difficult for Agents?
- Title(参考訳): ソフトウェア問題解決の課題はエージェントにとって困難か?
- Abstract要約: 問題解決タスクのエージェント成功率に対応するソフトウェアタスクの構造特性について検討する。
コーディングエージェントトラジェクトリの最大オープンデータセットであるCoderForge-Previewについて,大規模な実証的研究を行った。
- 参考スコア(独自算出の注目度): 5.974359772961166
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background. Advances in agentic systems are simultaneously, and rapidly, saturating benchmarks. Despite this often discussed phenomena, benchmark scores remain difficult to interpret due to the lack of control and characterization of task difficulty. More specifically, we currently have little understanding of what makes one task harder than another, and to what extent task difficulty is predictable from static task properties. Aims. We propose a measurement framework to investigate and systematically quantify what structural properties of software tasks correspond to agent success rates for issue resolution tasks. Method. We conducted a large scale empirical study on CoderForge-Preview, the largest open dataset of coding agent trajectories to date, by extracting features across task patch, repository and prompt. We evaluated the predictive power of each feature against task outcomes using ensemble methods, SHAP attribution, and effect size analysis. Results We found that task difficulty is substantially predictable from static features (AU C = 0.863) and is largely driven by patch fragmentation and repository scale. Prompt linguistic features become visible among top contributors for tasks in the mid-band, revealing a layered structure of difficulty. Conclusion. The difficulty of an issue resolution task is encoded in its structure. This enables static, pre-hoc difficulty estimation and lays the groundwork for difficulty-controlled benchmark construction for evaluation of agents.
- Abstract(参考訳): 背景。
エージェントシステムの進歩は、同時に、急速に飽和するベンチマークである。
しばしば議論される現象にもかかわらず、ベンチマークスコアは、制御の欠如とタスクの難しさの特徴づけのため、解釈が難しいままである。
具体的には、現在、あるタスクが他のタスクよりも難しい理由と、静的なタスクプロパティからタスクの難易度を予測できる程度についてはほとんど理解していません。
エイムズ。
本稿では,ソフトウェアタスクの構造的特性が課題解決タスクのエージェント成功率にどう対応しているかを調査し,体系的に定量化するための測定フレームワークを提案する。
方法。
CoderForge-Previewは,タスクパッチ,リポジトリ,プロンプトにまたがる特徴を抽出することによって,これまでで最大のオープンなコーディングエージェントトラジェクトリデータセットである。
我々は,各特徴のタスク結果に対する予測力について,アンサンブル法,SHAP属性,効果サイズ分析を用いて評価した。
その結果,タスクの難易度は静的特徴(AU C = 0.863)からかなり予測可能であり,パッチの断片化とリポジトリのスケールによって大きく左右されることがわかった。
急激な言語的特徴は、中間バンドのタスクのトップコントリビュータの間で見え、難易度の高い階層構造が明らかになる。
結論。
課題解決タスクの難しさは、その構造に符号化される。
これにより、静的で事前の難易度推定が可能となり、エージェント評価のための難易度制御されたベンチマーク構築の基礎となる。
関連論文リスト
- Predicting Task Difficulty Without Rollouts [0.0]
我々は,コーディング,数学,機械学習,Webナビゲーション,関数呼び出し,その他の領域にまたがる17のエージェントベンチマークを対象に,テキスト列の難易度予測について検討した。
我々は,AUCが難易度推定を隠蔽し,トークンレベルのエントロピーを有用な予測信号として同定し,予測された難易度と観測された難易度の間の残差が,汚染や不実現性などの隠れた環境欠陥を如何に隠蔽するかを示す。
論文 参考訳(メタデータ) (2026-08-06T09:33:09Z) - TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems [18.833806809109536]
エージェントシステムは、バグ修正などのソフトウェアエンジニアリングジョブを自動化するために広く研究されている。
既存の自動故障診断アプローチはタスク実行軌跡を活用するが、その効果は軌道長と複雑性の増加とともに低下する。
リポジトリレベルのコーディングタスクには、冗長なプログラム構造や冗長なコードコンテキストなど、トラジェクトリにはノイズが伴っている。
我々は,リポジトリレベルのコーディングトラジェクトリのための最初の障害診断フレームワークであるTrajAuditを提案する。
論文 参考訳(メタデータ) (2026-05-26T05:24:37Z) - Agent psychometrics: Task-level performance prediction in agentic coding benchmarks [24.348135523715815]
本稿では,エージェントプログラミング体制に合わせて,個々のタスクにおける成功や失敗を予測する枠組みを提案する。
我々のアプローチは、イシューステートメント、リポジトリコンテキスト、ソリューション、テストケースなど、タスクから抽出された豊富な機能を備えたアイテム応答理論(IRT)を拡張します。
論文 参考訳(メタデータ) (2026-04-01T07:59:59Z) - 4OPS: Structural Difficulty Modeling in Integer Arithmetic Puzzles [0.0]
算術パズルゲームは、数学的推論タスクの難しさを研究するための制御された設定を提供する。
我々は、到達可能な目標を列挙し、最小操作の証人を抽出し、大規模ラベリングを可能にする、正確な動的プログラミング解法を開発する。
難易度は、正確な目撃者から導かれる、解釈可能な構造的属性の小さなセットによって完全に決定されることを示す。
論文 参考訳(メタデータ) (2026-03-26T12:01:39Z) - Operationalising the Superficial Alignment Hypothesis via Task Complexity [49.93635747700126]
本稿では,タスクの目標性能を達成する最短プログラムの長さという,タスク複雑性と呼ばれる新しい指標を提案する。
私たちの結果は、タスク適応には驚くほど少ない情報が必要であり、たいていは数キロバイトです。
論文 参考訳(メタデータ) (2026-02-17T18:59:39Z) - Breakpoint: Scalable evaluation of system-level reasoning in LLM code agents [40.37993572657772]
本稿では,コード修復タスクを自動的に生成するベンチマーク手法であるBreakpointを紹介する。
我々の手法は、最も簡単なタスクの55%から最も難しいタスクの0%まで、最先端のモデルの成功率で任意の難易度にスケール可能であることを実証する。
論文 参考訳(メタデータ) (2025-05-30T19:23:51Z) - Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks? [74.88417042125985]
複雑さの異なるタスクにおいて、様々な品質レベルで監視データを提供する様々なデータ駆動戦略について検討する。
ハードタスクの監視における結果エラー率が高い場合でも、そのようなデータによるトレーニングは、より簡単なサブタスクの監督を完璧に上回ります。
また,本研究の結果から,タスク・インスペクションとサブタスク・インスペクションを補完することで,顕著なパフォーマンス向上が期待できることがわかった。
論文 参考訳(メタデータ) (2024-10-27T17:55:27Z) - Exposing and Addressing Cross-Task Inconsistency in Unified
Vision-Language Models [80.23791222509644]
一貫性のないAIモデルは、人間のユーザーによって不安定で信頼できないと見なされている。
最先端のビジョン言語モデルは、タスク間の驚くほど高い一貫性のない振る舞いに悩まされている。
本稿では,大規模で自動生成されるクロスタスクコントラスト集合上で計算されたランク相関に基づく補助訓練目標を提案する。
論文 参考訳(メタデータ) (2023-03-28T16:57:12Z) - Fast Inference and Transfer of Compositional Task Structures for
Few-shot Task Generalization [101.72755769194677]
本稿では,タスクがサブタスクグラフによって特徴づけられる,数発の強化学習問題として定式化する。
我々のマルチタスクサブタスクグラフ推論器(MTSGI)は、トレーニングタスクから、まず、サブタスクグラフの観点から、一般的なハイレベルなタスク構造を推測する。
提案手法は,2次元グリッドワールドおよび複雑なWebナビゲーション領域において,タスクの共通基盤構造を学習し,活用し,未知のタスクへの適応を高速化する。
論文 参考訳(メタデータ) (2022-05-25T10:44:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。