論文の概要: When Can Agents Safely Checkpoint, Fork, Restore, and Merge? Exact Checking for Execution Edits
- arxiv url: http://arxiv.org/abs/2608.22928v1
- Date: Mon, 24 Aug 2026 08:03:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.959132
- Title: When Can Agents Safely Checkpoint, Fork, Restore, and Merge? Exact Checking for Execution Edits
- Title(参考訳): エージェントはいつ、安全なチェックポイント、フォーク、リストア、マージできるのか?
- Authors: Yusheng Zheng, Xiaoyu Song, Yanpeng Hu, Lebin Cheng, Yuxi Huang, Wei Zhang,
- Abstract要約: エージェントランタイムは、タスクを再起動することなく、実行をチェックポイントし、フォークし、チェックポイントをリストアし、ブランチをマージすることができる。
これらの操作の実行を編集と呼び、Checkpointは後の使用のために現在の実行を記録し、Fork、Restore、Mergeは次にエージェントが何をするかを変更します。
ランタイムは実行レコードを使用して、編集がどの過去のアクションを考慮し、どの結果が必要かを決定し、その後の実行を安全に保たなければならない。
我々は、編集が安全かどうかを正確に決定するアルゴリズムを与える。それは、継続するためのすべての安全な方法を返すか、存在しないことを証明します。
- 参考スコア(独自算出の注目度): 5.91067661612028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent runtimes can Checkpoint an execution, Fork it, Restore a checkpoint, or Merge branches without restarting a task. We call these operations execution edits, with Checkpoint recording the current execution for later use and Fork, Restore, and Merge changing what the Agent will do next. An execution edit cannot undo an earlier authorization or a tool request already sent. An unsafe edit can therefore authorize the same tool action twice, discard a result the task still requires, or conflict with a call that began before the edit. The Agent is untrusted, so the runtime uses its execution record to determine which past actions an edit must account for and which required results it must preserve to keep the subsequent execution safe. Yet existing Agent systems support such operations without deriving what each edit must preserve from the running execution, whereas prior methods for computing safe behavior take that requirement as input. We give an algorithm that decides exactly whether an edit is safe. It returns all safe ways to continue, or proves that none exists. To make this decision, the algorithm lists every way the task can finish without violating policy. It removes any way that could make a still-required result impossible to finish later. If none remain, it returns a checkable proof that no safe implementation exists. Otherwise, the remaining ways describe exactly what the runtime may allow. Our formal results cover Checkpoint and the six forms of Fork, Restore, and Merge, together with extensions, atomic enforcement, and the information every exact checker needs. Lean mechanizes the finite checker and runtime invariant, and tests validate all six edit forms. The source code, Lean proofs, and executable tests are available in the public GitHub repository at https://github.com/eunomia-bpf/agent-check-restore-safety.
- Abstract(参考訳): エージェントランタイムは、タスクを再起動することなく、実行をチェックポイントし、フォークし、チェックポイントをリストアし、ブランチをマージすることができる。
これらの操作の実行を編集と呼び、Checkpointは後の使用のために現在の実行を記録し、Fork、Restore、Mergeは次にエージェントが何をするかを変更します。
実行編集は、以前の承認や既に送信されたツール要求を解除することはできない。
したがって、安全でない編集は、同じツールアクションを2回承認したり、タスクがまだ必要とする結果を捨てたり、編集前に開始された呼び出しと衝突したりすることができる。
エージェントは信頼できないため、ランタイムは実行レコードを使用して、編集がどの過去のアクションを考慮すべきか、どの結果が必要かを判断し、その後の実行を安全に保たなければならない。
しかし、既存のエージェントシステムは、各編集が実行中の実行から保持しなければならないものを引き出すことなく、そのような操作をサポートする。
編集が安全かどうかを正確に決定するアルゴリズムを提供する。
あらゆる安全な方法で継続するか、あるいは存在しないことを証明します。
この決定を下すために、アルゴリズムは、ポリシーに違反することなく、タスクが終了するあらゆる方法をリストアップする。
それは、まだ要求された結果が後で終わるのを不可能にするいかなる方法も取り除きます。
もし何も残っていなければ、安全な実装が存在しないというチェック可能な証明を返す。
そうでなければ、残りの方法はランタイムが何を許すかを正確に記述する。
私たちの公式な結果は、Checkpointと、Fork、Restore、Mergeの6つのフォームを、拡張、アトミックな執行、そして、チェッカーに必要なすべての情報とともにカバーしています。
リーンは有限チェッカーと実行時の不変性を機械化し、テストは6つの編集フォームすべてを検証する。
ソースコード、Lean proof、実行可能テストは、https://github.com/eunomia-bpf/agent-check-restore-safetyのGitHubリポジトリで公開されている。
関連論文リスト
- Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Agent Security Needs Redefinition through a Holistic Framework [46.88917910966891]
被告は、命令が悪意あるように見えるかどうかを問う。ベンチマークは、エージェントが有害な鳴き声を行うかどうかを問う。
我々は,エージェントの軌道全体にわたって連続的に評価されなければならない4つの特性を通じて,コンテキストセキュリティを運用する。
論文 参考訳(メタデータ) (2026-07-24T06:43:09Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - Cordon: Semantic Transactions for Tool-Using LLM Agents [11.567293065381918]
本稿では,コミット前にエージェント効果のステージングと検証を行うトランザクションランタイムシステムであるCordonを紹介する。
適度な承認とレイテンシのオーバーヘッドで、良質なタスク補完を保ちながら、不可逆的な効率の失敗を減らす。
論文 参考訳(メタデータ) (2026-06-16T06:21:14Z) - Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents [99.67681154381803]
Test-time Rule Acquisition and Compiled Enforcement (TRACE)は、コーディングエージェントランタイムのためのスキル層パイプラインである。
開発者が事前に記述した実行時チェックとは異なり、TRACEスキルはユーザのチャット修正に由来する。
論文 参考訳(メタデータ) (2026-06-11T10:43:40Z) - Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines [24.766671285910935]
コーディングエージェントはますますシステムオペレーションに統合されている。
これにより、セキュリティテストがシステムの問題になる。
この実行層セキュリティ境界を探索するための、実行地上のレッドチームテストフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-01T04:20:25Z) - LACUNA: Safe Agents as Recursive Program Holes [3.2613419151327343]
LLMエージェントはますますコードを記述することで振る舞うが、エージェントを駆動するランタイムとモデルが記述するコードの間には分割が持続する。
我々は、安全性を維持しながら、この分割を閉じるエージェントのためのプログラミングモデルであるLACUNAを紹介する。
我々のプリミティブは、通常の制御フローとしてReActループ、サブエージェント、スキル、並列分解、マルチモデル計画を表現する。
論文 参考訳(メタデータ) (2026-05-27T15:27:25Z) - Verify-Gated Completion as Admission Control in a Governed Multi-Agent Runtime: A Bounded Architecture Case Study [0.6875312133832079]
制御されたマルチエージェントランタイムの入出力制御パターンとして,検証ゲート補完について検討する。
観測条件下では,読み取り専用検証ゲートとパケット化入力記録が検査可能で,フェールクロースされた。
論文 参考訳(メタデータ) (2026-05-18T07:52:13Z) - On the Reliability of Computer Use Agents [47.20065484006984]
コンピュータ利用エージェントの信頼性の低下の原因を3つの要因から検討する。
信頼性は、タスクの指定方法と、エージェントの動作が実行毎に変化する方法の両方に依存します。
論文 参考訳(メタデータ) (2026-04-20T05:59:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。