論文の概要: What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents
- arxiv url: http://arxiv.org/abs/2607.06184v1
- Date: Tue, 07 Jul 2026 12:09:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.508126
- Title: What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents
- Title(参考訳): リゾルダーレートが秘めているもの:コーディングエージェントの軌道構造診断
- Authors: Rui Shu, Chun Yong Chong, Xin Zhou, Yun Peng, Zihan Wu, Xu Han, Zeyang Zhuang, Guowen Yuan, Yuan Wang,
- Abstract要約: コーディングエージェントは、ほぼ完全に解決率でランク付けされる。
単一のパス/フェイルラベルは、なぜ実行が失敗したのか、なぜ承認された実行が追加のステップ、時間、トークンを費やしたのかについて何も述べていない。
TraceProbeは、リゾルフレートが隠すものを回復するトラジェクトリに依存しないフレームワークである。
- 参考スコア(独自算出の注目度): 14.988334585821939
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding agents are ranked almost entirely by resolve rate: whether their final patch passes the target tests. Yet two agents can reach the same outcome through very different processes, and a single pass/fail label says nothing about why a run failed or why an accepted run spent extra steps, time, or tokens. This process evidence lives in the trajectory, which records a run's searches, reads, edits, tool calls, validation, and reversions. However, raw traces are heterogeneous and hard to compare across runs. We present TraceProbe, a trajectory-diagnostic framework that recovers what resolve rate hides. TraceProbe normalizes each raw run into a canonical nine-type action taxonomy with deterministic effect labels, then applies two rule-based modules: Insight names single-trajectory anti-patterns adapted from established debugging practice (e.g., search loops, verification skips), while Converge aligns pairs of runs and classifies where their behavior diverges under controlled references. Applying TraceProbe to 2,500 trajectories from five production settings on SWE-Bench Verified, we find that (i) file choice is too coarse to separate success from failure, whereas function selection and completion behavior localize it; (ii) Insight anti-patterns act mainly as corpus-level difficulty clues, with search loops the most stable; and (iii) even resolved runs differ in how quickly they reach relevant code and how much failed work they incur. Trajectory structure thus adds auditable diagnostic context to outcomes by localizing inspection targets, suggesting failure hypotheses, and prioritizing runs for review.
- Abstract(参考訳): コーディングエージェントは、最終パッチがターゲットテストに合格するかどうかという、ほぼ完全に解決率でランク付けされる。
ひとつのパス/フェイルラベルには、実行が失敗した理由や、承認された実行が追加のステップ、時間、トークンに費やした理由については何も書かれていない。
このプロセスのエビデンスは、実行中の検索、読み込み、編集、ツールコール、バリデーション、リバージョンを記録する軌道に存在している。
しかし、生の痕跡は不均一であり、実行中の比較は困難である。
TraceProbeは、リゾルフレートが隠すものを回復するトラジェクトリに依存しないフレームワークである。
TraceProbeは、標準の9種類のアクション分類を決定論的エフェクトラベルで正規化し、2つのルールベースのモジュールを適用する。 Insight name single-trajectory anti-patternsは、確立されたデバッグプラクティス(例えば、検索ループ、検証スキップ)から適応され、Convergeは、ペアのランを調整し、それらの振る舞いが制御された参照の下で分岐する場所を分類する。
TraceProbeをSWE-Benchの5つのプロダクション設定から2500のトラジェクトリに適用すると、そのことが分かる。
i) ファイルの選択は失敗から成功を区別するには大きすぎるが、関数の選択と完了動作はそれをローカライズする。
二 インサイトアンチパターンは、主にコーパスレベルの難解な手がかりとして機能し、探索ループが最も安定している。
(iii) 解決された実行は、関連するコードにどの程度の速さで到達し、どれだけの失敗を犯したかで異なります。
トラジェクトリ構造は、検査対象のローカライズ、失敗仮説の提案、レビュー実行の優先順位付けによって、結果に監査可能な診断コンテキストを追加する。
関連論文リスト
- REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces [10.98846592145896]
大規模言語モデル(LLM)エージェントは、長いプラン・アンド・エグゼクティブトレースを通じて複雑なタスクを解決するが、完了したトレース内のエラーを見つける能力はまだ遅れている。
本稿では,このギャップを解消する手法として,候補となるエラーステップの診断,診断固有のパッチによるリプレイによるテスト,および検証結果のフリップを比較的証拠として用いて最終帰属を洗練させる手法を提案する。
論文 参考訳(メタデータ) (2026-06-08T06:11:57Z) - ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling [57.42714978834704]
ExCommは、探索段階のエージェントテストタイムスケーリングのための通信プロトコルである。
ExCommは、強いテスト時間スケーリングベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-21T07:38:44Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - CodeTracer: Towards Traceable Agent States [40.51936201889185]
異種実行アーティファクトを解析し,抽出器を進化させるトレースアーキテクチャであるCodeTracerを提案する。
CodeTracerは、永続的なメモリを持つ階層的なトレースツリーとして、完全な状態遷移履歴を再構築する。
障害発生元とその下流チェーンを特定するために、障害オンセットのローカライゼーションを実行する。
論文 参考訳(メタデータ) (2026-04-13T15:52:03Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。