論文の概要: Fantastic Adaptive Taxonomies and How to Use Them
- arxiv url: http://arxiv.org/abs/2607.16387v1
- Date: Fri, 17 Jul 2026 17:41:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.139349
- Title: Fantastic Adaptive Taxonomies and How to Use Them
- Title(参考訳): 幻想的な適応型分類法とその利用法
- Authors: Mert Cemri, Andrei Cojocaru, Melissa Pan, Shu Liu, Shubham Agarwal, Alexander Krentsel, Jay Tang, Kannan Ramchandran, Joseph E. Gonzalez, Matei Zaharia, Alex Dimakis, Ion Stoica,
- Abstract要約: AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
- 参考スコア(独自算出の注目度): 100.20614173157708
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An agent system's execution traces record how it fails, and procedures that improve such a system without changing model weights (trajectory selection, prompt and workflow optimization, runtime monitoring) read these traces for feedback. Yet raw traces are a poor medium for accumulating that feedback: long, instance-specific, and lacking a stable vocabulary for recurring failures. We argue that an agent system should instead maintain an explicit representation of how it fails, induced from its own behavior and reusable wherever failure feedback is needed. AdaMAST builds this representation by converting a target system's traces into a compact, evidence-grounded failure taxonomy: named failure codes organized along three fixed axes (system-level, role-specific, and domain-specific), with every name, definition, and evidence pattern induced from the traces; no code is hand-authored, no trace human-annotated. The taxonomy is not merely a post-hoc diagnostic but a shared feedback interface, improving agents in three ways. In agent-system search, taxonomy-coded diagnoses of failed candidates outperform free-form reflection on all five benchmarks we test. At runtime, taxonomy feedback raises SWE-agent's resolution on SWE-bench Verified Mini from 60% with free-text reflection to 70%, and improves Claude Code from 64.0% to 70.7% as a runtime skill. In trajectory selection, AdaMAST-Judge, a verifier built on the induced codes, improves best-of-5 accuracy on Terminal-Bench 2.0 by 8-15 points over Pass@1. The vocabulary itself is compact (an order-of-magnitude compression that preserves trace distinctions), human-faithful (matching expert failure annotations more closely than a hand-crafted reference vocabulary), and adaptive (taxonomies induced for different domains share few codes). Adaptive failure taxonomies close the loop between the traces agents produce and the procedures that improve them.
- Abstract(参考訳): エージェントシステムの実行トレースは、モデルウェイトを変更することなくそのようなシステムを改善する手順(軌道選択、プロンプトとワークフローの最適化、実行時の監視)が、これらのトレースをフィードバックのために読み取る。
しかし、生のトレースは、そのフィードバックを蓄積するには不十分な媒体である。
エージェントシステムは、どのように失敗するかを明確に表現し、その振る舞いから引き起こされ、障害フィードバックが必要な場所で再利用可能なものにする必要がある、と我々は主張する。
AdaMASTは、ターゲットシステムのトレースをコンパクトでエビデンスベースの障害分類に変換することで、この表現を構築している: 3つの固定軸(システムレベル、ロール固有、ドメイン固有)に沿って組織された名前付き障害コード。
分類は単なるポストホック診断ではなく、共有されたフィードバックインターフェースであり、エージェントを3つの方法で改善する。
エージェント・システム・サーチにおいて、失敗候補の分類コード診断は、我々がテストした5つのベンチマーク全てにおいて、自由形式のリフレクションよりも優れている。
実行時に、分類フィードバックはSWE-bench Verified Miniに対するSWE-agentの解決を60%から70%に引き上げ、実行スキルとしてClaude Codeを64.0%から70.7%に改善した。
軌道選択において、誘導コード上に構築された検証器であるAdaMAST-Judgeは、Terminal-Bench 2.0の5点の精度をPass@1よりも8~15ポイント向上する。
語彙そのものはコンパクト(トレースの区別を保ったオーダー・オブ・マグニチュード圧縮)、人間に忠実(専門家の失敗アノテーションを手作りの参照語彙よりも密にマッチング)、適応(異なるドメインに対して誘導されるタキソノミ)である。
適応的障害分類は、トレースエージェントが生成するループとそれを改善する手順の間のループを閉じる。
関連論文リスト
- TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems [36.221246203666745]
MOSSは、生産エージェント基板上でソースレベルで自己書き換えを行うシステムである。
平均成績は0.25から0.61に上昇し、人間の介入なしに1サイクルで上昇する。
論文 参考訳(メタデータ) (2026-05-21T17:48:33Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation [3.23600523782706]
CRYSTAL (Clear Reasoning via Yielded Steps, Traceability, and Logic)は6,372インスタンスの診断ベンチマークである。
本稿では,意味的類似性マッチングによるステップレベルの精度とリコールをスコアするMatch F1と,乱れた推論連鎖をペナルティ化するOrdered Match F1の2つの相補的指標を提案する。
CPR-CurriculumはGRPOによるMatch F1の32%の改善を実現している。
論文 参考訳(メタデータ) (2026-03-13T15:48:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。