論文の概要: AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows
- arxiv url: http://arxiv.org/abs/2607.16345v1
- Date: Thu, 16 Jul 2026 21:33:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.116353
- Title: AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows
- Title(参考訳): AEVAL: エージェントスキルワークフローの逸話から決定論的テストへ
- Abstract要約: AEVAL(Agentic Evaluation)はCI統合フレームワークで、このプラクティスをエージェントスキルのための決定論的かつ再現可能なテストパイプラインに置き換える。
鍵となる要素は、実行子とグレーダの間の構造的分離であり、微妙だが広汎な障害モードを防止する。
AEVALは、スプリアス100%パスレートを再現可能なファースト・アタプティブ・フェール信号に変換する。
- 参考スコア(独自算出の注目度): 1.6785141970297952
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern agentic systems increasingly rely on skills: installable packages of natural language and code that teach an LLM agent to perform a domain task. As skill repositories grow, developers need automated quality signals on every change, yet evaluation today is largely anecdotal: a developer asks an agent to "try the skill," watches a demo, and forms a subjective impression. This yields neither reproducibility across runs nor comparability across versions, and scales poorly to marketplaces where one regression can silently break dozens of downstream workflows. We present AEVAL (Agentic Evaluation), a CI-integrated framework that replaces this practice with a deterministic, reproducible test pipeline for agentic skills. Every skill change triggers a test event: the skill runs against a developer-declared evaluation contract (eval.config) inside an automated executor, emitting a structured, evidence-grounded quality signal that downstream CI can route on. A key ingredient is a structural separation between executor and grader, preventing a subtle but pervasive failure mode: an agent that silently self-corrects during execution and then grades its own patched outputs as passing. Our contributions are: (i) a deterministic, change-triggered evaluation protocol with per-skill contracts and per-run artifact schemas; (ii) a formalization of self-correction bias as a distinct failure mode of naive agentic evaluators; (iii) an executor/grader separation with a first-attempt grading rule and explicit self-correction tracking; and (iv) a tiered, grounded-evidence fix-suggestion scheme (LV1 causal, LV2 quality) posted as inline merge-request comments. Validated on real skills in a production agentic stack across multiple agent SDKs, AEVAL converts spurious 100% pass rates into reproducible first-attempt fail signals with an auditable record of every executor fix.
- Abstract(参考訳): 現代のエージェントシステムはますますスキルに依存している: 自然言語とLLMエージェントにドメインタスクを実行するためのプログラムのインストール可能なパッケージ。
スキルレポジトリが成長するにつれて、開発者はすべての変更に対して自動品質信号が必要ですが、今日の評価は大半が逸話的です。
これにより、実行時の再現性やバージョン間のコンパラビリティは向上せず、ひとつのレグレッションが数十のダウンストリームワークフローをサイレントに破壊できるようなマーケットプレースにスケールすることができない。
私たちは、CI統合フレームワークであるAEVAL(Agentic Evaluation)を、エージェントスキルのための決定論的かつ再現可能なテストパイプラインに置き換えます。
すべてのスキル変更がテストイベントをトリガーする。スキルは自動エグゼキュータ内の開発者宣言型評価契約(eval.config)に対して実行され、下流CIがルーティング可能な構造化されたエビデンスベースの品質信号が発行される。
重要な要素は、実行時とグレーダーの間の構造的分離であり、微妙だが広範にわたる障害モードを防ぎ、実行中に静かに自己修正し、通過時に自身のパッチアウトプットをグレードするエージェントである。
私たちの貢献は次のとおりです。
i) スキル単位の契約と実行単位のアーティファクトスキーマを備えた決定論的かつ変更トリガー付き評価プロトコル
二 自己補正バイアスの定式化を、主観的エージェント評価者の個別の失敗モードとして行うこと。
三 第一段階の格付け規則及び明示的な自己訂正追跡による執行者・学級分離
(iv)インライン・マージ・リクエストのコメントとして掲載されたタイアップされた根拠付き固定提案スキーム(LV1因果、LV2品質)。
複数のエージェントSDKにまたがるプロダクションエージェントスタックの実際のスキルに基づいて、AEVALは、スプリアス100%パスレートを再現可能なファースト・アタプティブ・フェール信号に変換し、エグゼクタフィックスの監査可能なレコードを生成する。
関連論文リスト
- HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - VeriSkill: A Self-Evolution Framework for Program Verification Skills [19.114016708981023]
プログラム検証のための自己進化フレームワークであるVeriSkillを提案する。
検証失敗をスキル不足とみなし、診断シグネチャを再利用可能なレッスンに蒸留し、候補スキルを反復的に洗練する。
論文 参考訳(メタデータ) (2026-07-30T06:15:29Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems [82.01232437066487]
AgentXはプロダクションデプロイされたマルチエージェントシステムで、このプロダクション機能を再構築する。
自律的に生成し、実装し、評価し、レコメンデーション実験から学ぶ。
AgentXは4つの密結合したステージをクローズドループでオーケストレーションする。
論文 参考訳(メタデータ) (2026-06-25T10:42:28Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems [36.221246203666745]
MOSSは、生産エージェント基板上でソースレベルで自己書き換えを行うシステムである。
平均成績は0.25から0.61に上昇し、人間の介入なしに1サイクルで上昇する。
論文 参考訳(メタデータ) (2026-05-21T17:48:33Z) - Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents [0.3733676450456031]
テスト時間スケーリングフレームワークであるTrace2Skillを提案する。
新しいモデルをトレーニングしたり、より多くの候補ソリューションをサンプリングする代わりに、Trace2Skillはエージェントの自然言語スキルを進化可能なポリシーとして扱う。
成功と失敗モードのために繰り返しロールアウトトレースをマイニングし、それらを密集した診断やオラクルのレッスンに変換し、オラクル、ミューテータ、セレクタループを使用してタスク固有のスキルを生成する。
論文 参考訳(メタデータ) (2026-05-20T23:10:49Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation [4.723302382132762]
シリコングレードの正しさは、 (i) シミュレーション中心の評価の限られたカバレッジと信頼性、 (ii) 回帰と修復幻覚、 (iii) エージェントハンドオフ間で意図が再解釈される意味的ドリフトによってボトルネックが残っている。
エージェントの意図を整合させる設計契約を確立するマルチエージェントフレームワークであるVeri-Sureを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:10:23Z) - AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering [8.201374511929538]
AgentDevelは、現行のエージェントを反復的に実行するリリースエンジニアリングパイプラインである。
実行トレースから実装盲の症状レベルの品質信号を生成する。
主要な症状パターンを集約し、監査可能なエンジニアリング仕様を生成する。
論文 参考訳(メタデータ) (2026-01-08T05:49:01Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。