論文の概要: Deterministic Replay for AI Agent Systems
- arxiv url: http://arxiv.org/abs/2607.16200v1
- Date: Thu, 30 Apr 2026 12:00:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.028694
- Title: Deterministic Replay for AI Agent Systems
- Title(参考訳): AIエージェントシステムのための決定論的リプレイ
- Abstract要約: 大規模な言語モデルを外部ツールやAPIと組み合わせるAIエージェントシステムは本質的に非決定論的である。
既存の可観測性プラットフォームは実行ログをキャプチャするが、独立して実行を再現することはできない。
エージェント実行の決定論的リプレイのための開発者ファーストのCLIフレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: AI agent systems that couple large language models (LLMs) with external tools and APIs are inherently non-deterministic: LLM sampling variance, external API state, CDN infrastructure headers, and execution-environment noise collectively prevent any prior agent run from being faithfully re-executed. Existing observability platforms capture execution logs but cannot reproduce a run in isolation. We present agrepl, a developer-first CLI framework for deterministic replay of agent executions. agrepl intercepts all external interactions at the transport layer via a man-in-the-middle (MITM) proxy, serialises them as structured execution traces, and replays them in a strictly isolated environment with zero outbound network access. We formalise the agent execution model, define the request-key matching function K(s), and prove the determinism invariant. We introduce a noise-aware diff algorithm classifying HTTP header divergence into signal and noise tiers. Empirical evaluation across five workloads (n = 250 replay instances) demonstrates replay fidelity F = 1.0 and a median per-step latency reduction of 98.3%. agrepl is implemented in Go, ships as a single static binary, and is released under the MIT licence. Keywords: AI agents, deterministic replay, LLM debugging, reproducibility, MITM proxy, execution tracing, record/replay systems.
- Abstract(参考訳): LLMサンプリング分散、外部API状態、CDNインフラストラクチャヘッダ、実行環境ノイズなど、大きな言語モデル(LLM)と外部ツールとAPIを結合するAIエージェントシステムは本質的に非決定論的です。
既存の可観測性プラットフォームは実行ログをキャプチャするが、独立して実行を再現することはできない。
本稿では,エージェントの実行を決定論的にリプレイする開発者ファーストのCLIフレームワークであるagreplを紹介する。
agreplは、man-in-the-middle(MITM)プロキシを介してトランスポート層のすべての外部インタラクションをインターセプトし、構造化された実行トレースとしてシリアライズし、アウトバウンドネットワークアクセスゼロの厳密な隔離された環境で再生する。
我々はエージェント実行モデルを定式化し、リクエストキーマッチング関数K(s)を定義し、決定論不変性を証明する。
我々は、HTTPヘッダの発散を信号層とノイズ層に分類するノイズ対応差分アルゴリズムを提案する。
5つのワークロード(n = 250リプレイインスタンス)にわたる実証的な評価では、リプレイ忠実度F = 1.0と、ステップ毎のレイテンシの中央値の98.3%が示されている。
agreplはGoで実装され、単一の静的バイナリとして出荷され、MITライセンス下でリリースされている。
キーワード:AIエージェント、決定論的リプレイ、LCMデバッグ、再現性、MITMプロキシ、実行トレース、レコード/リプレイシステム。
関連論文リスト
- AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes [38.37599802008238]
商用LLM APIは特定の基盤モデルを宣伝するが、提供されたバックボーンは静かに代用され、定量化され、あるいはラップされることがある。
既存の監査はすべて、テキスト出力チャネルからバックボーンアイデンティティを決定する。
本稿では,AgentProv(AgentProv)について紹介する。
論文 参考訳(メタデータ) (2026-08-30T08:22:12Z) - LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems [2.124730017640531]
Sovereign Agentic Loops (SAL) は、モデルが正当化された構造化意図を出力する制御プレーンアーキテクチャである。
SALは難読化膜を結合し、識別に敏感な状態へのモデルアクセスを制限し、監査性と再生のために暗号的にリンクされたEvidence Chainを結合する。
OpenKedgeのクラウドインフラストラクチャ用プロトタイプでは、SALはポリシー層における安全でない意図の93%をブロックし、一貫性チェックを通じて残りの7%を拒否し、12.4msの中央値レイテンシを追加した。
論文 参考訳(メタデータ) (2026-04-24T00:56:55Z) - HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads [0.0]
モチベーションのインシデントでは、11の並列エージェントのうち3つがコネクションリセットとHTTP 502エラーで死亡しました。
HIVEMINDは5つのOSにインスパイアされたスケジューリングプリミティブを適用し,非協調並列実行による障害モードを除去する透過的なHTTPプロキシである。
論文 参考訳(メタデータ) (2026-04-18T18:59:33Z) - AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering [3.2126925586839623]
第一級原理として実行基盤検証を導入する。
我々はこの原理をマルチエージェントフレームワークである AgentFORGE でインスタンス化する。
AgentFORGEtokenはSWE-BENCH Lite上で40.0%の解像度を達成する。
論文 参考訳(メタデータ) (2026-04-13T13:51:13Z) - The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check [54.08619694620588]
本稿では,2つの異なるエージェントパラダイムであるEmbodied AgentsとTool-Calling AgentsにまたがるdLLMの包括的評価を行う。
Agentboard と BFCL では,現在の dLLM が信頼できるエージェントバックボーンとして機能しないという,"ビットレッスン" が報告されている。
論文 参考訳(メタデータ) (2026-01-19T11:45:39Z) - AgentSight: System-Level Observability for AI Agents Using eBPF [10.37440633887049]
既存のツールは、エージェントの高レベルな意図(LSMプロンプトを介して)または低レベルな行動(例えば、システムコール)を観察するが、これら2つのビューを関連付けることはできない。
AgentOpsはハイブリッドアプローチを使用して,このセマンティックギャップをブリッジする,AgentOpsオブザーバビリティフレームワークです。
AgentSightはTLS暗号化されたLLMトラフィックをインターセプトしてセマンティックインテントを抽出し、カーネルイベントを監視してシステム全体の効果を観察し、これら2つのストリームをプロセス境界を越えて因果的に関連付ける。
論文 参考訳(メタデータ) (2025-08-02T01:43:39Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - Reinforcement Learning for Long-Horizon Interactive LLM Agents [56.9860859585028]
インタラクティブデジタルエージェント(IDA)は、ステートフルなデジタル環境のAPIを利用して、ユーザの要求に応じてタスクを実行する。
対象環境で直接IDAを訓練する強化学習(RL)手法を提案する。
我々は、近似ポリシー最適化のデータおよびメモリ効率の亜種である LOOP を導出する。
論文 参考訳(メタデータ) (2025-02-03T18:35:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。