論文の概要: Planarian: Managing Agent State with Statepoints
- arxiv url: http://arxiv.org/abs/2609.35366v1
- Date: Mon, 28 Sep 2026 15:09:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 06:09:59.084118
- Title: Planarian: Managing Agent State with Statepoints
- Title(参考訳): Planarian: エージェントステートをステートポイントで管理する
- Abstract要約: LLMエージェントはファイルを反復的に変更し、ローカルツールを呼び出し、リモートサービスと対話することで複雑なタスクを解決する。
Planarianは、エージェントがミスを解除し、代替案を並行して探すことを可能にし、タスク品質を最大15倍改善する。
- 参考スコア(独自算出の注目度): 3.8564479340396627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents solve complex tasks by iteratively changing files, invoking local tools, and interacting with remote services, which modifies state across their local environment and remote services. Today, agents and users must manage these changes explicitly, whether reverting exploratory actions or recovering from erroneous ones. Doing so safely requires coordinated actions, yet current agent harnesses lack unified abstractions and mechanisms for managing local and remote state consistently and efficiently. We describe Planarian, an agent runtime with state management that enables agents and users to recover from erroneous actions and explore alternative executions over consistent local and remote environment state. Planarian introduces the abstraction of agent statepoints, which are consistent, restorable point-in-time versions of the environment state. Planarian exposes three state-management primitives to agents and users: (i) snapshot creates a new statepoint spanning local and remote state without requiring external services to support checkpoints: it relies on efficient incremental process and file system snapshotting to capture local sandboxed state, and transparently records compensating actions to undo remote state changes; (ii) rollback restores the environment to a previous statepoint by reverting to a prior local checkpoint and replaying compensating actions for remote state changes; and (iii) fork creates multiple isolated branches from a statepoint, enabling the agent to explore alternatives in parallel. We show that Planarian enables agents to undo mistakes and explore alternatives in parallel, improving task quality by up to 15x, and allows users to recover from erroneous actions with only 3% overhead.
- Abstract(参考訳): LLMエージェントは、ファイルの反復的な変更、ローカルツールの呼び出し、リモートサービスとのインタラクションによって複雑なタスクを解決する。
今日では、エージェントやユーザは、探索行動の復帰や誤動作からの回復など、これらの変更を明示的に管理しなければならない。
しかし、現在のエージェントは、ローカルおよびリモートの状態を管理するための統一された抽象化とメカニズムを欠いている。
エージェントとユーザが誤ったアクションから回復し、一貫したローカルおよびリモート環境状態上での代替実行を探索できる状態管理を備えたエージェントランタイムであるPlanarianについて説明する。
Planarianは、環境状態の一貫性があり、復元可能なポイントインタイムバージョンであるエージェントステートポイントの抽象化を導入している。
Planarianは3つの状態管理プリミティブをエージェントとユーザに公開する。
i) スナップショットは、チェックポイントをサポートするために外部サービスを必要としない、ローカルおよびリモートの状態にまたがる新しいステートポイントを生成します。
(ii)ロールバックは、前のローカルチェックポイントに戻り、リモート状態変更の補償アクションを再生することにより、環境を以前のステートポイントに復元する。
3)forkはステートポイントから複数の独立したブランチを生成し、エージェントが並列に代替を探索することを可能にする。
Planarianは、エージェントがミスを解消し、代替案を並列に探索し、タスク品質を最大15倍改善し、3%のオーバーヘッドで誤ったアクションから回復できることを示します。
関連論文リスト
- Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents [56.434418859203085]
大規模言語モデル(LLM)エージェントは、多段階の環境相互作用を通じて、長い水平タスクに対処する。
単一の誤動作は、その後の状態や観測を変更でき、時間とともにエラーが複雑になる。
信頼性回復はロールバック境界制御問題として扱われるべきである。
論文 参考訳(メタデータ) (2026-09-16T08:26:14Z) - LocalLSTC: A Long Short-Term Control Architecture for Locally Deployed GUI Agents [13.261859864631063]
トレーニング不要なアーキテクチャであるLocalLSTCを導入し、時間的スコープによる制御を組織化し、永続的なクロスステップ状態を維持する。
長期制御は、アクティブなサブゴール、サブゴールアライメントのエビデンス、および相互作用間の実行時のフィードバックを維持し、短期実行は現在のステップに対する有界なコミットメントを実現している。
Qwen3.6-27Bでは、LocalLSTCはOSWorldで64.7%のSR-100、WindowsAgentArenaで65.3%に達し、両方のベンチマークで最強のローカル結果を上回った。
論文 参考訳(メタデータ) (2026-08-26T13:20:27Z) - AgentRewind: Recoverable Execution for Long-Horizon LLM Agents [32.44158037765297]
我々は,エージェントコンテキストと制御環境の整列チェックポイントを記録するランタイムリカバリフレームワークであるAgentRewindを紹介する。
また,タスク完了と長期工学的課題の部分的進捗を評価するベンチマークであるMettleBenchを構築した。
論文 参考訳(メタデータ) (2026-08-14T15:20:35Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Agentao: A Policy-Governed Runtime Harness for Embeddable Tool-Using LLM Agents [12.945900896175447]
LLMエージェントは、ツールの呼び出し、ローカル状態の変更、永続メモリの使用、外部プロトコルとのインタラクションを行う実行システムとしてますます機能する。
本稿では,ツール利用 LLM エージェントを対象としたローカルファーストランタイムである Agentao について述べる。
論文 参考訳(メタデータ) (2026-07-04T10:37:01Z) - AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions [78.49000936275773]
我々は、一般的な汚職下でのコンピュータ利用エージェントの堅牢性を評価するために設計されたベンチマークであるAgentHijackを紹介する。
MLLMをベースとした各種デスクトップタスクを評価し, 汚職の小さな事例であっても, 大幅な性能劣化が生じることを確認した。
本稿では,動作の要約と環境チェックに責任を負う見物人として,アクションジェネレータと接地機能を統合したフレームワークであるAgent Hijack-Agentを提案する。
論文 参考訳(メタデータ) (2026-05-25T11:09:22Z) - Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution [50.50276752935017]
AgentReviveは、レジリエントなマルチエージェント進化のためのMarkovステートアウェアフレームワークである。
我々の手法はソフト状態遷移を通じてエージェントの協調を動的に管理する。
ステートアウェアなエージェントスケジューリングによってトークンの消費を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-17T09:38:18Z) - HearthNet: Edge Multi-Agent Orchestration for Smart Homes [5.081228499547384]
HearthNetは、スマートホームのためのエッジマルチエージェントオーケストレーションシステムである。
コンテキスト、実行履歴を外部化し、計画、検証、承認、動作を分離する。
プロトタイプはコモディティエッジハードウェアとAndroidデバイスで動作します。
論文 参考訳(メタデータ) (2026-03-16T15:29:37Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。