論文の概要: Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore
- arxiv url: http://arxiv.org/abs/2607.00345v1
- Date: Wed, 01 Jul 2026 02:41:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.684479
- Title: Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore
- Title(参考訳): Registry-Governed Agent Lifecycle:AWS AgentCoreによる評価駆動登録、プロモーション、廃止によるEDDOpsのコンパイル
- Authors: Richard Kang, Vincent Wang,
- Abstract要約: 本稿では,AWS Bedrock AgentCore上で評価駆動開発・運用(EDDOps)の実践者指向のインスタンス化を提案する。
EDDOpsは、評価を端末チェックポイントではなく、エージェントライフサイクル全体の継続的管理機能として位置付ける。
評価エビデンスによって,ベンチマークレベルのエクササイズからモデル選択を支配的経済判断に変換する方法を示す。
- 参考スコア(独自算出の注目度): 0.5156484100374058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise adoption of LLM agents requires model selection methods that balance quality, reliability, safety, latency, and cost. Evaluation-Driven Development and Operations (EDDOps) positions evaluation as a continuous governing function across the agent lifecycle rather than a terminal checkpoint. This paper presents a practitioner-oriented instantiation of EDDOps on AWS Bedrock AgentCore and proposes a cost-to-performance framework for selecting foundation models in enterprise agent architectures. We make three contributions: a conceptual synthesis explaining why traditional TDD/BDD methods are insufficient for non-deterministic LLM agents; an architectural mapping of the EDDOps reference architecture onto AgentCore Runtime, Evaluations, Agent Registry, and CloudWatch observability; and an empirical cost-to-performance decision framework validated through a proof-of-concept comparing three foundation models across two deployment paths. Using trace data from 30 single-turn invocations across six agents, 9 multi-turn evaluations, and registry-integrated governance, we show how evaluation evidence can convert model selection from a benchmark-ranking exercise into a governed economic decision. The results suggest that managed agent platforms can support EDDOps when they provide trace-native observability, pluggable evaluator frameworks, and governed registry-based discovery.
- Abstract(参考訳): 企業におけるLLMエージェントの採用には、品質、信頼性、安全性、レイテンシ、コストのバランスをとるモデル選択方法が必要である。
評価駆動開発と運用(EDDOps)は、端末チェックポイントではなく、エージェントライフサイクル全体にわたって評価を継続的管理機能として位置付ける。
本稿では,AWS Bedrock AgentCore上でのEDDOpsの実践者指向のインスタンス化を提案し,エンタープライズエージェントアーキテクチャの基本モデルを選択するための費用対パフォーマンスのフレームワークを提案する。
従来のTDD/BDDメソッドが、非決定論的LLMエージェントに不十分な理由を説明する概念的な合成、EDDOpsリファレンスアーキテクチャをAgentCore Runtime、評価、エージェントレジストリ、CloudWatchオブザーバビリティにアーキテクチャマッピングする、そして、2つのデプロイメントパスにわたる3つの基盤モデルを比較する概念実証を通じて検証された実証的なコスト対パフォーマンス決定フレームワークである。
6エージェントにわたる30回のシングルターン呼び出し、9回のマルチターン評価、レジストリ統合ガバナンスのトレースデータを用いて、評価証拠がベンチマークレベルのエクササイズからモデル選択を支配的経済決定に変換する方法を示す。
結果として、マネージドエージェントプラットフォームは、トレースネイティブなオブザーバビリティ、プラグイン可能な評価フレームワーク、管理されたレジストリベースのディスカバリを提供する際に、EDDOpsをサポートすることができることが示唆されている。
関連論文リスト
- The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration [10.076972559007116]
ARIS(Auto-Research-in-sleep)は、自律的な研究のためのオープンソースの研究ハーネスである。
ARISは、クロスモデル対外コラボレーションを通じて機械学習の研究を調整する。
論文 参考訳(メタデータ) (2026-05-04T18:10:15Z) - AgentSim: A Platform for Verifiable Agent-Trace Simulation [3.2058241360543254]
AgentSimは、RAGエージェントをシミュレートするオープンソースプラットフォームである。
これは、任意のドキュメントコレクションに対するエージェント推論の検証可能な段階的なトレースを生成する。
マルチモデル検証パイプラインとアクティブなHuman-in-the-loopプロセスを組み合わせる。
論文 参考訳(メタデータ) (2026-04-29T13:19:38Z) - Reasoning Provenance for Autonomous AI Agents: Structured Behavioral Analytics Beyond State Checkpoints and Execution Traces [0.0]
Agent Execution Record (AER) は構造化された推論プリミティブであり、すべてのステップで第一級クエリ可能なフィールドとしてインテント、観察、推論をキャプチャする。
AERが集団レベルの行動分析を可能にする方法を示す: 推論パターンマイニング、信頼度校正、クロスエージェント比較、モックリプレイによる反事実回帰テスト。
論文 参考訳(メタデータ) (2026-03-23T08:27:54Z) - From Prompt-Response to Goal-Directed Systems: The Evolution of Agentic AI Software Architecture [0.0]
Agentic AIは、ステートレスでプロンプト駆動型生成モデルからゴール指向システムへのアーキテクチャ移行を表す。
本稿では、知的エージェント理論と現代のLCM中心のアプローチを結びつけることによって、この遷移を考察する。
この研究は、標準化されたエージェントループ、登録、監査可能な制御機構への収束を特定する。
論文 参考訳(メタデータ) (2026-02-11T03:34:48Z) - Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem [90.17610617854247]
本稿では,エージェントモデルの生産パイプラインを最適化する基盤インフラであるエージェント学習エコシステム(ALE)を紹介する。
ALEは、重量最適化のためのトレーニング後のフレームワークであるROLL、軌道生成のためのサンドボックス環境マネージャであるROCK、効率的なコンテキストエンジニアリングのためのエージェントフレームワークであるiFlow CLIの3つのコンポーネントで構成されている。
ROMEはALEが基盤として100万件以上のトラジェクトリをトレーニングしたオープンソースエージェントです。
論文 参考訳(メタデータ) (2025-12-31T14:03:39Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm [60.36837655498119]
本稿では,トラジェクトリをベースとしたエージェント・ベンチマーク・複雑度進化フレームワークを提案する。
このフレームワークは、既存のベンチマークから元のタスクを受け取り、エージェントがそれをより難しい新しいタスクに進化させるよう促す。
GAIAベンチマークの実験では、TRACEフレームワークはタスクの複雑さを継続的に向上し、正確性の信頼性を向上させる。
論文 参考訳(メタデータ) (2025-10-01T01:52:52Z) - Agent-as-a-Judge: Evaluate Agents with Agents [61.33974108405561]
本稿ではエージェント・アズ・ア・ジャッジ(Agent-as-a-Judge)フレームワークを紹介し,エージェント・システムを用いてエージェント・システムの評価を行う。
これはLLM-as-a-Judgeフレームワークの有機的拡張であり、タスク解決プロセス全体の中間フィードバックを可能にするエージェント的特徴を取り入れている。
55のリアルな自動化AI開発タスクのベンチマークであるDevAIを紹介します。
論文 参考訳(メタデータ) (2024-10-14T17:57:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。