論文の概要: DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback
- arxiv url: http://arxiv.org/abs/2605.22781v1
- Date: Thu, 21 May 2026 17:36:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 20:14:18.613252
- Title: DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback
- Title(参考訳): DeltaBox:ミリ秒レベルのサンドボックスチェックポイント/ロールバックによるステートフルAIエージェントのスケーリング
- Authors: Yunpeng Dong, Jingkai He, Yuze Hou, Dong Du, Zhonghu Xu, Si Yu, Yubin Xia, Haibo Chen,
- Abstract要約: 既存のメカニズムは状態全体を複製し、C/Rあたり数百ミリ秒から秒のレイテンシを発生させる。
本稿では,AIエージェントに対する変更ベースのトランザクションC/Rを実現するため,新しいOSレベルの抽象化であるDeltaStateを提案する。
2つの新しいメカニズムによりミリ秒単位のC/Rを実現する新しいエージェントであるDeltaBoxを提案する。
- 参考スコア(独自算出の注目度): 4.718590395003422
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-powered AI agents require high-frequency state exploration (e.g., test-time tree search and reinforcement learning), relying on rapid checkpoint and rollback (C/R) of the complete sandbox state, including files and process state (e.g., memory, contexts, etc.). Existing mechanisms duplicate the entire state, causing hundreds of milliseconds to seconds of latency per C/R, which severely bottlenecks deep search and large-scale fan-outs. This paper observes that subsequent checkpoints in AI agents are highly similar. Therefore, instead of full duplication, a sandbox should only duplicate the changes between consecutive checkpoints (Key Insight). However, it is non-trivial to realize the idea, mainly due to the missing OS supports. This paper proposes a new OS-level abstraction, DeltaState, to enable the change-based transactional C/R for AI agents with two co-designed OS mechanisms. First, DeltaFS enables change-based filesystem C/R by organizing the file states into layers and dynamically freezing the writable layer and inserting a new one during checkpoint, reducing file updates to copy-on-write, and making rollback a simple layer switch. Second, DeltaCR enables change-based process state C/R using incremental dumps, and accelerates rollback by bypassing traditional pipelines to directly fork() from a frozen template process. We then present DeltaBox, a novel agent sandbox achieving millisecond level C/R through the two new mechanisms. Evaluations on SWE-bench and RL micro-benchmarks show DeltaBox completes checkpoint and rollback in millisecond-level latency (14ms and 5ms, respectively), empowering agents to explore substantially more nodes under fixed time budgets.
- Abstract(参考訳): LLMベースのAIエージェントは、ファイルやプロセス状態(例えば、メモリ、コンテキストなど)を含む完全なサンドボックス状態の迅速なチェックポイントとロールバック(C/R)に依存する、高周波な状態探索(例えば、テストタイムツリー探索と強化学習)を必要とする。
既存のメカニズムは状態全体を複製し、C/Rあたり数百ミリ秒から秒のレイテンシを引き起こし、ディープサーチと大規模ファンアウトを著しくボトルネックにした。
本稿では,AIエージェントのその後のチェックポイントが極めて類似していることを確認する。
従って、完全な複製の代わりに、サンドボックスは連続するチェックポイント(Key Insight)間の変更だけを複製すべきである。
しかし、主にOSがサポートされていないため、このアイデアを実現するのは簡単ではない。
本稿では,2つのOS機構を持つAIエージェントに対して,変更ベースのトランザクションC/Rを実現するための,新しいOSレベルの抽象化であるDeltaStateを提案する。
まず、DeltaFSは変更ベースのファイルシステムC/Rを実現し、ファイル状態をレイヤに整理し、書き込み可能なレイヤを動的に凍結し、チェックポイント中に新しいレイヤを挿入し、ファイル更新をコピーオンライトに削減し、ロールバックをシンプルなレイヤスイッチにする。
次にDeltaCRは、インクリメンタルダンプを使用して変更ベースのプロセス状態C/Rを可能にし、従来のパイプラインをバイパスして、凍結されたテンプレートプロセスから直接fork()にロールバックを高速化する。
次に、2つの新しいメカニズムを通じてミリ秒単位のC/Rを達成する新しいエージェントであるDeltaBoxを紹介する。
SWE-benchとRLマイクロベンチマークの評価によると、DeltaBoxはミリ秒レベルのレイテンシ(それぞれ14msと5ms)でチェックポイントとロールバックを完了し、エージェントが固定時間予算の下ではるかに多くのノードを探索できるようにする。
関連論文リスト
- Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes [7.156242393967948]
75%以上のエージェントがリカバリ関連状態を発生しないため、ほとんどのチェックポイントは不要である。
Checkpoint-and-Restore for Agent SandBoxesは、エージェントやC/Rバックエンドを変更することなく、このギャップをブリッジする透過的なホストサイドランタイムである。
シェル集約型およびコード修正ワークロードでは、Crabはリカバリの正しさを8%(チャットのみ)から100%に引き上げ、チェックポイントトラフィックを最大87%削減し、フォールトフリー実行時間の1.9%以内に留まる。
論文 参考訳(メタデータ) (2026-04-30T17:20:19Z) - Scaling Test-Time Compute for Agentic Coding [126.72747643609274]
本稿では,ロールアウト軌跡のコンパクトな表現に基づくエージェントコーディングのためのテスト時間スケーリングフレームワークを提案する。
当社のフレームワークは,各ロールアウトを,その健全な仮説,進捗,障害モードを保存する構造的な要約に変換する。
提案手法は,SWE-Bench Verified および Terminal-Bench v2.0 におけるフロンティア符号化エージェントの性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-04-16T17:39:33Z) - LiveVectorLake: A Real-Time Versioned Knowledge Base Architecture for Streaming Vector Updates and Temporal Retrieval [0.0]
LivevusLakeは2階層の時間的知識ベースアーキテクチャで、現在の知識をリアルタイムにセマンティック検索できる。
システムは、コンプライアンス、監査可能性、ポイント・イン・タイム検索のための完全なバージョン履歴を維持している。
論文 参考訳(メタデータ) (2025-11-24T11:15:39Z) - Instruction-Level Weight Shaping: A Framework for Self-Improving AI Agents [0.0]
大規模言語モデル (LLMs) は流動的であるが、ほとんどは事前訓練後に静的である。
新しい知識やシフトする知識は、通常、検索強化世代(RAG)や微調整と共に追加される。
ILWS(Instruction-Level Weight Shaping)を提案する。
キュレートされたシステム命令は、各セッション後に更新された外部の監査可能な擬似パラメータとして機能する。
論文 参考訳(メタデータ) (2025-08-29T21:34:39Z) - Command-V: Pasting LLM Behaviors via Activation Profiles [67.07238260037839]
Command-Vはバックプロパゲーションフリーな行動伝達法である。
既存の残留活性化アダプタをドナーモデルからコピーし、その効果を受信モデルに貼り付ける。
論文 参考訳(メタデータ) (2025-06-23T21:21:49Z) - On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention [53.22963042513293]
大規模言語モデル(LLM)は、自己アテンションを通じてグローバルトークンの依存関係をキャプチャするが、長い入力に対する計算とメモリコストに直面する。
まず,二状態線形注意(Dual-state linear attention, A)を提案する。これは2つの隠れ状態を保持する設計であり,その1つは,リニアアテンションアーキテクチャの典型的な短距離バイアスを緩和し,リニアアテンションを追尾するものである。
本稿では,DSLA層を段階的に置き換えるオンライン適応蒸留フレームワークであるDSLA-Serveを紹介する。
論文 参考訳(メタデータ) (2025-06-11T01:25:06Z) - RT-Cache: Training-Free Retrieval for Real-Time Manipulation [13.338672711391999]
RT-Cacheは、ロボットのためのトレーニング不要の検索・アズ・コントロールパイプラインである。
現行のフレームを埋め込んでマルチステップスニペットを検索して再生し、ステップ単位のモデルコールを置き換える。
階層的な検索は、100万スケールのルックアップをサブ秒以下に維持し、コストを計算からストレージにシフトさせる。
論文 参考訳(メタデータ) (2025-05-14T00:41:44Z) - DSI++: Updating Transformer Memory with New Documents [95.70264288158766]
DSI++は、DSIが新たなドキュメントをインクリメンタルにインデクシングするための継続的な学習課題である。
新たな文書の連続的な索引付けは,それまでの索引付け文書をかなり忘れてしまうことを示す。
文書の擬似クエリをサンプルとして生成メモリを導入し、連続的なインデックス付け中に補足することで、検索タスクの忘れを防止する。
論文 参考訳(メタデータ) (2022-12-19T18:59:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。