論文の概要: TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories
- arxiv url: http://arxiv.org/abs/2605.31308v1
- Date: Fri, 29 May 2026 13:40:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.641549
- Title: TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories
- Title(参考訳): TraceGraph: エージェントトラジェクトリの診断と改善のための共有決定ランドスケープ
- Authors: Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang,
- Abstract要約: グラフベースのフレームワークであるTraceGraphを紹介した。
各タスクに対して、TraceGraphは、モデルIDが導入される前に、プールされたロールアウトから観測可能なアクション・オブザーブレーション状態のグラフを構築する。
次に、結果インフォームされた生産的なコアとトラップリージョンをオーバーレイし、各ロールアウトを3つのイベント – アクセス、トラップ露出、修復 – で要約する。
- 参考スコア(独自算出の注目度): 61.51984029109709
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent benchmarks increasingly record rich interaction trajectories, yet evaluation often reduces each rollout to a pass rate or reward score. We introduce TraceGraph, a graph-based framework that turns released multi-model agent trajectories into shared decision landscapes. For each task, TraceGraph builds a graph over observable action-observation states from pooled rollouts before model identity is introduced. It then overlays outcome-informed productive cores and trap regions, and summarizes each rollout with three events: Access, Trap exposure, and Repair. Across trajectories spanning five benchmark splits, TraceGraph profiles reveal navigation differences hidden by aggregate scores and show that splits differ in whether they reward avoiding traps or recovering from them. The same TraceGraph landscape also motivates a trap-aware recovery pipeline for SWE-bench: aruntime detector fires on states matching historical trap regions, then lightweight continuation policies are evaluated from the same prefix. On fired states, the best pooled single-factor policy raises official resolved rate from 40.4% to 43.5% on the per-provider fired subset and from 41.0% to 44.8% on common-fired instances, with provider-specific active components. Overall, TraceGraph provides a process vocabulary for asking what agent benchmarks test, where models diverge on a shared landscape, and how failure regions can guide downstream improvement.
- Abstract(参考訳): エージェントベンチマークは、リッチなインタラクションの軌跡をますます記録するが、評価は各ロールアウトをパスレートや報酬スコアに還元することが多い。
グラフベースのフレームワークであるTraceGraphを紹介した。
各タスクに対して、TraceGraphは、モデルIDが導入される前に、プールされたロールアウトから観測可能なアクション・オブザーブレーション状態のグラフを構築する。
次に、結果インフォームされた生産的なコアとトラップリージョンをオーバーレイし、各ロールアウトを3つのイベント – アクセス、トラップ露出、修復 – で要約する。
5つのベンチマークスプリットにまたがるトラジェクトリ全体において、TraceGraphプロファイルは、アグリゲートスコアによって隠されたナビゲーションの違いを明らかにし、それらがトラップを回避するか、それらから回復するかで、分割が異なることを示す。
同じTraceGraphランドスケープは、SWE-bench用のトラップ対応リカバリパイプラインも動機付けている。
発火状態において、最高のプールされた単一要素ポリシーは、公式な解決率を40.4%から43.5%に引き上げ、プロジェクタごとの発火サブセットを41.0%から44.8%に引き上げ、プロバイダ固有のアクティブなコンポーネントを伴って、一般的なインスタンスを41.0%から44.8%に引き上げる。
全体として、TraceGraphは、エージェントベンチマークがテストするか、モデルが共有ランドスケープに分散するか、障害領域が下流改善をどのようにガイドするかを問うためのプロセス語彙を提供する。
関連論文リスト
- Can Graph-Based Microservice Performance Detection Be Used for Microservice Intrusion Detection? [0.0]
本稿では、グラフベースのマイクロサービスパフォーマンス検出が、マイクロサービス侵入検出の基礎となるかどうかを問う。
Docker Composeベースの合成Eコマースマイクロサービスベンチマークをデプロイし、通常のワークロード下で5つの攻撃タイプにわたって50のコントロールされたトライアルを実行し、メトリクス、ログ、分散トレースを収集します。
21,438個の要求グラフの6方向分類のための2層グラフ畳み込みネットワークを訓練し、96.2%の精度で、グラフレベルのランダムスプリットの下でマクロF1を0.955とする。
論文 参考訳(メタデータ) (2026-05-22T23:30:38Z) - GraphCogent: Mitigating LLMs' Working Memory Constraints via Multi-Agent Collaboration in Complex Graph Understanding [13.356521655409422]
大規模言語モデル(LLM)は、小規模なグラフ推論タスクでは有望な性能を示すが、複雑なクエリで現実のグラフを扱うと失敗する。
グラフ推論を特殊な認知プロセス(センス、バッファ、実行)に分解する協調エージェントフレームワークであるGraphCogentを提案する。
論文 参考訳(メタデータ) (2025-08-17T14:28:38Z) - GraphRunner: A Multi-Stage Framework for Efficient and Accurate Graph-Based Retrieval [3.792463570467098]
GraphRunnerは、新しいグラフベースの検索フレームワークで、計画、検証、実行の3つの異なる段階で動作する。
推論エラーを著しく低減し、実行前に幻覚を検出する。
GRBenchデータセットによる評価は、GraphRunnerが既存のアプローチを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-07-11T18:10:01Z) - UniGoal: Towards Universal Zero-shot Goal-oriented Navigation [68.45058159533376]
汎用的なゼロショットゴール指向ナビゲーションのための一般的なフレームワークを提案する。
本稿では,オブジェクトカテゴリ,インスタンスイメージ,テキスト記述など,異なる目標を統一する一様グラフ表現を提案する。
我々のUniGoalは、3つの研究されたナビゲーションタスクに対して1つのモデルで最先端のゼロショット性能を実現する。
論文 参考訳(メタデータ) (2025-03-13T17:59:48Z) - A Comprehensive Graph Pooling Benchmark: Effectiveness, Robustness and Generalizability [17.075744814372936]
我々は、17のグラフプーリング方法と28のグラフデータセットを含む包括的なベンチマークを構築した。
このベンチマークは3次元のグラフプーリング法の性能を体系的に評価する。
論文 参考訳(メタデータ) (2024-06-13T12:04:40Z) - Joint Feature Learning and Relation Modeling for Tracking: A One-Stream
Framework [76.70603443624012]
特徴学習と関係モデリングを統合した新しい一ストリーム追跡(OSTrack)フレームワークを提案する。
このようにして、相互誘導により識別的目標指向特徴を動的に抽出することができる。
OSTrackは、複数のベンチマークで最先端のパフォーマンスを実現しており、特に、ワンショットトラッキングベンチマークのGOT-10kでは印象的な結果を示している。
論文 参考訳(メタデータ) (2022-03-22T18:37:11Z) - Graph-PCNN: Two Stage Human Pose Estimation with Graph Pose Refinement [54.29252286561449]
グラフPCNNと呼ばれる2段階のグラフベースおよびモデルに依存しないフレームワークを提案する。
第1段階では、粗局化結果を得るために熱マップ回帰ネットワークを適用し、ガイドポイントと呼ばれる一連の提案キーポイントをサンプリングする。
第2段階では、各案内点について、ローカライゼーションにより異なる視覚特徴を抽出する。
ガイドされた点間の関係は、より正確なローカライゼーション結果を得るためにグラフポーズ精製モジュールによって探索される。
論文 参考訳(メタデータ) (2020-07-21T04:59:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。