論文の概要: Reasoning Provenance for Autonomous AI Agents: Structured Behavioral Analytics Beyond State Checkpoints and Execution Traces
- arxiv url: http://arxiv.org/abs/2603.21692v1
- Date: Mon, 23 Mar 2026 08:27:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.56405
- Title: Reasoning Provenance for Autonomous AI Agents: Structured Behavioral Analytics Beyond State Checkpoints and Execution Traces
- Title(参考訳): 自律型AIエージェントの理由:状態チェックポイントと実行トレースを超えた構造化された行動分析
- Abstract要約: Agent Execution Record (AER) は構造化された推論プリミティブであり、すべてのステップで第一級クエリ可能なフィールドとしてインテント、観察、推論をキャプチャする。
AERが集団レベルの行動分析を可能にする方法を示す: 推論パターンマイニング、信頼度校正、クロスエージェント比較、モックリプレイによる反事実回帰テスト。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI agents transition from human-supervised copilots to autonomous platform infrastructure, the ability to analyze their reasoning behavior across populations of investigations becomes a pressing infrastructure requirement. Existing operational tooling addresses adjacent needs effectively: state checkpoint systems enable fault tolerance; observability platforms provide execution traces for debugging; telemetry standards ensure interoperability. What current systems do not natively provide as a first-class, schema-level primitive is structured reasoning provenance -- normalized, queryable records of why the agent chose each action, what it concluded from each observation, how each conclusion shaped its strategy, and which evidence supports its final verdict. This paper introduces the Agent Execution Record (AER), a structured reasoning provenance primitive that captures intent, observation, and inference as first-class queryable fields on every step, alongside versioned plans with revision rationale, evidence chains, structured verdicts with confidence scores, and delegation authority chains. We formalize the distinction between computational state persistence and reasoning provenance, argue that the latter cannot in general be faithfully reconstructed from the former, and show how AERs enable population-level behavioral analytics: reasoning pattern mining, confidence calibration, cross-agent comparison, and counterfactual regression testing via mock replay. We present a domain-agnostic model with extensible domain profiles, a reference implementation and SDK, and outline an evaluation methodology informed by preliminary deployment on a production platformized root cause analysis agent.
- Abstract(参考訳): AIエージェントが人間の監督されたコピロットから、自律的なプラットフォームインフラストラクチャに移行するにつれ、調査の人口間での推論行動を分析する能力は、インフラストラクチャーの要求に迫られている。
状態チェックポイントシステムはフォールトトレランスを可能にし、可観測性プラットフォームはデバッグのための実行トレースを提供し、テレメトリ標準は相互運用性を保証する。
現在のシステムは、第一級のスキーマレベルのプリミティブとしてネイティブに提供されていないものは、プロビデンスを構造化した推論である。
本稿では,すべてのステップにおいて,意図,観察,推測を第一級問合せ可能なフィールドとしてとらえる構造化推論プリミティブであるエージェント実行記録(AER)を紹介する。
我々は、計算状態の持続性と推論の証明との区別を形式化し、一般に後者は前者から忠実に再構成することはできないと主張し、AERが集団レベルでの行動分析(推論パターンマイニング、信頼度校正、クロスエージェント比較、モックリプレイによる反事実回帰テスト)を可能にしていることを示す。
本稿では,拡張可能なドメインプロファイル,参照実装,SDKを備えたドメインに依存しないモデルを提案する。
関連論文リスト
- Terminal Agents: A Survey of AI Agents in Command-Line Environments [102.48222742145474]
大規模言語モデルエージェントは、ターミナルを通してますます行動するが、既存の調査は、ソフトウェア工学、ツールの使用、コンピュータ利用の研究にまたがって端末による振る舞いを分散させている。
我々は,端末エージェントを,端末コマンドの実行,テキストフィードバック,ステートフルな環境相互作用を介し,進行を伴う動作を主とするシステムとみなす。
我々の合成は、実現された行動はモデル、インターフェース、ハーネス、ランタイム、環境によって共同で形成されていることを示している。
論文 参考訳(メタデータ) (2026-08-20T18:16:44Z) - The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation [0.0]
本稿では,AIエージェントの評価における重要な方法論と,高度な可観測性基盤の不可欠な役割について考察する。
本稿では,エージェントシステムの契約層として機能することを目的とした,初期段階のベンダ中立フレームワークである評価コンテキストプロトコル(ECP)を提案する。
本稿では,LangChain,LlamaIndex,CrewAI,PydanticAIのアダプタを含むオープンソースリファレンス実装について述べる。
論文 参考訳(メタデータ) (2026-08-18T07:14:36Z) - Formal Verification of Agentic Systems over Operational Data [59.98246281888422]
大規模言語モデル(LLM)によって駆動されるエージェントシステムは、永続的な運用データを扱う現実世界にますます展開されている。
既存のアプローチはそのようなシステムレベルの保証を提供していません。
本稿では, 1 つの LLM とツールオーケストレーションハーネスからなるエージェントシステムのリレーショナル操作データに対する検証について述べる。
論文 参考訳(メタデータ) (2026-08-04T13:01:30Z) - Criticality-Based Guard Rail Validation for AI Agent Decisions in Autonomous Telecom Networks [0.0]
Guard Rail Validation(GRV)は、実行前にAI駆動決定をインターセプトし、検証するための標準化可能なランタイムアーキテクチャである。
本稿では、アーキテクチャ、アルゴリズムプロシージャ、O-RANデプロイメントモデルを示し、通信における既知のAI/ML攻撃に対する脅威カバレッジを評価する。
論文 参考訳(メタデータ) (2026-07-02T14:21:26Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora [24.484384823423216]
既存のベンチマークでは、情報ノイズを考慮せず、複数ソースの事実矛盾を無視し、論理的計画に視覚的認識を根ざす必要性を見落としている。
エージェントの堅牢性と信頼性の増大に対応するために設計された検証可能なベンチマークであるVeriTripを紹介する。
論文 参考訳(メタデータ) (2026-05-27T16:14:47Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - TRUE: A Trustworthy Unified Explanation Framework for Large Language Model Reasoning [0.2538209532048867]
大規模言語モデル(LLM)は複雑な推論タスクにおいて強力な能力を示してきたが、その意思決定プロセスは解釈が難しいままである。
本稿では,実行可能推論検証,実現可能な領域指向非巡回グラフ(DAG)モデリング,因果故障モード解析を統合したTrustworthy Unified Explanation Framework(TRUE)を提案する。
論文 参考訳(メタデータ) (2026-02-21T17:00:54Z) - From Prompt-Response to Goal-Directed Systems: The Evolution of Agentic AI Software Architecture [0.0]
Agentic AIは、ステートレスでプロンプト駆動型生成モデルからゴール指向システムへのアーキテクチャ移行を表す。
本稿では、知的エージェント理論と現代のLCM中心のアプローチを結びつけることによって、この遷移を考察する。
この研究は、標準化されたエージェントループ、登録、監査可能な制御機構への収束を特定する。
論文 参考訳(メタデータ) (2026-02-11T03:34:48Z) - The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis [24.51410516475904]
The Prompt Injection (PI) landscape, including attack, Defenses, and their evaluation practices。
我々は,コンテキストに依存したインタラクション設定下でエージェントの振る舞いを体系的に評価する新しいベンチマークであるAgentPIを紹介する。
我々は,文脈依存推論が不可欠である現実的なエージェント設定に一般化することができないが,文脈依存的入力を抑えることで,既存のベンチマークにおいて多くの防御が有効であることを示す。
論文 参考訳(メタデータ) (2026-02-11T02:47:10Z) - Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation [5.191980417814362]
LLMエージェントは、ほとんどの環境が静的で、必要な情報がモデルのコンテキストウインドウに適合する場合、排他的になる。
直腸型薬剤は、この体制では特に脆い。
本稿では,LLMが限定的な局所的エビデンスマイニングとラベリングを行うためのフレームワークであるEoGを提案する。
論文 参考訳(メタデータ) (2026-01-25T17:27:19Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning [63.77667876176978]
大規模言語モデルでは、最終回答を正当化するためにステップバイステップの推論を生成するように促された場合、ダウンストリームタスクの解釈可能性が改善されている。
これらの推論ステップは、モデルの解釈可能性と検証を大幅に改善するが、客観的にそれらの正確性を研究することは困難である。
本稿では、従来のテキスト生成評価指標を改善し拡張する、解釈可能な教師なし自動スコアのスイートであるROSを提案する。
論文 参考訳(メタデータ) (2022-12-15T15:52:39Z) - Relational Action Bases: Formalization, Effective Safety Verification,
and Invariants (Extended Version) [67.99023219822564]
我々はリレーショナルアクションベース(RAB)の一般的な枠組みを紹介する。
RABは両方の制限を解除することで既存のモデルを一般化する。
データ対応ビジネスプロセスのベンチマークにおいて、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2022-08-12T17:03:50Z) - Learning Causal Models of Autonomous Agents using Interventions [11.351235628684252]
我々は、AIシステムがシミュレータで高レベルの命令シーケンスを実行することができるエージェントアセスメントモジュールの分析を拡張した。
このような原始的なクエリ応答能力は、システムのユーザ解釈可能な因果関係モデルを効率的に導出するのに十分であることを示す。
論文 参考訳(メタデータ) (2021-08-21T21:33:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。