論文の概要: PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution
- arxiv url: http://arxiv.org/abs/2607.16636v1
- Date: Sat, 18 Jul 2026 04:46:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.213233
- Title: PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution
- Title(参考訳): PhyAgentOS:認知計画と身体的実行を分離した身体的エージェントのための自己進化型オペレーティングシステム
- Authors: Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin,
- Abstract要約: 我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
- 参考スコア(独自算出の注目度): 49.776611937968
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action models, world models, and agentic planners each advance physical intelligence, yet their composition lacks a common execution abstraction, shared state, semantic verification, and persistent experience across heterogeneous embodiments. We present PhyAgentOS, a runtime foundation delivering scheduling, verification, memory, benchmarking, and safety as system-level services. Its Session-Centered Runtime treats a session, not an action, as the minimum unit of scheduling, compatibility preflight, supervised execution, evidence collection, and acceptance. To decouple cognition from physical execution, the cognition-physics boundary is a file system: the State-as-a-File protocol materializes cross-layer state as Markdown with YAML, yielding inspectable, versionable records without code dependencies between Agent and Runtime layers. These views form a unified cognitive state space aligning intent, capabilities, environment, execution, and experience. The SessionVerifier distinguishes execution termination from semantic task completion via evidence-grounded verdicts of success, failure, or replan. Verified outcomes are consolidated through epistemic memory into reusable knowledge and corrective lessons, closing a trial-and-error loop without retraining. Benchmarking reuses the deployment session and verification path, so results trace to real execution. Layered safety constrains both policy-driven and agent-driven execution: preflight, action bridges, SafetyGuard, heartbeat monitoring, and target-local constraints. Validation is progressive: games test cognitive planning, simulation adds dynamics and control, real robots add hardware noise, with the cognitive layer held constant. PhyAgentOS is benchmarked on Optimus-67, StarDojo, and DST-Dojo, validated on 19+ simulated and physical embodiments, and gains on LIBERO, Calvin, and RoboCasa365 across multiple VLA models.
- Abstract(参考訳): 視覚言語-アクションモデル、世界モデル、エージェントプランナーはそれぞれ物理的な知性を前進させるが、それらの構成には共通の実行抽象化、共有状態、セマンティック検証、異種エボディメント全体にわたる永続的な経験が欠けている。
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するランタイム基盤であるPhyAgentOSを紹介します。
そのSession-Centered Runtimeは、スケジューリング、互換性のプレフライ、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱います。
State-as-a-Fileプロトコルは、YAMLでマークダウンとして層間状態を実体化し、エージェント層とランタイム層の間のコード依存なしに検査可能なバージョン管理可能なレコードを生成する。
これらの見解は、意図、能力、環境、実行、経験を整合させる統一された認知状態空間を形成する。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づく検証を通じて区別する。
検証された結果は、認識記憶を通じて再利用可能な知識と修正的教訓に集約され、再訓練せずに試行錯誤ループを閉じる。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
レイヤ化された安全性は、プレフライ、アクションブリッジ、セーフティガード、心拍モニタリング、ターゲットローカルな制約といった、ポリシ駆動とエージェント駆動の両方の実行を制約する。
ゲームテストの認知計画、シミュレーションはダイナミクスとコントロール、実際のロボットはハードウェアノイズを追加し、認知層は一定に保持される。
PhyAgentOSはOptimus-67、StarDojo、DST-Dojoでベンチマークされ、19以上のシミュレートされた物理的エボディメントで検証され、複数のVLAモデルでLIBERO、Calvin、RoboCasa365で改善されている。
関連論文リスト
- TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - From Detection to Action: Using LLM Agents for Fault-Tolerant Control [0.21313236831585222]
我々は,耐故障性制御のためのエージェント型大規模言語モデル(LLM)フレームワークを提案する。
故障検出出力を、植物固有の知識に基づく制約対応回復行動に変換する。
我々は,各プロセスのダイナミックスと互換性のある遅延予算内で,意味的基盤を持つエージェントが有効なリカバリ決定を導出できることを示す。
論文 参考訳(メタデータ) (2026-06-26T12:13:58Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Towards Security-Auditable LLM Agents: A Unified Graph Representation [22.355591892994642]
本稿ではエージェントセキュリティ監査のための統合構造表現であるエージェントBOMを提案する。
エージェントBOMは、クロスセッションメモリ中毒やツール誤用など、ステルス攻撃チェーンを再構築できることを示す。
Agent-BOMは複雑なエージェントエコシステムにおける根本原因分析とセキュリティ適応のための統一的で監査可能な基盤を提供する。
論文 参考訳(メタデータ) (2026-05-07T18:14:29Z) - A Physical Agentic Loop for Language-Guided Grasping with Execution-State Monitoring [5.437966695589128]
我々は、接地された実行状態上で動作する有界な実施エージェントとして言語誘導の把握を再構築する。
未修正の学習操作プリミティブをラップする物理エージェントループを導入する。
眼内カメラD405を用いた移動マニピュレータのループを検証した。
論文 参考訳(メタデータ) (2026-04-08T08:01:35Z) - A Trace-Based Assurance Framework for Agentic AI Orchestration: Contracts, Testing, and Governance [0.22940141855172028]
本稿では,Large Language Models (LLM) を用いたエージェントAIシステムの保証フレームワークを提案する。
実行は、明示的なステップとトレースコントラクトを備えたメッセージ・アクション・トレース(MAT)として実装される。
このフレームワークは、有界摂動に対する予算付き反例探索として定式化されたストレステストを含む。
論文 参考訳(メタデータ) (2026-03-18T10:23:48Z) - ESAA: Event Sourcing for Autonomous Agents in LLM-Based Software Engineering [0.0]
本稿では,ESAA(Event Sourcing for Autonomous Agents)アーキテクチャについて述べる。
アーキテクチャは、イベントソーシングパターンにインスパイアされた、認知意図とプロジェクトの状態突然変異を分離する。
2つのケーススタディは、アーキテクチャを検証し、単一エージェントのシナリオを超えたアーキテクチャのスケーラビリティの実証的な証拠を提供する。
論文 参考訳(メタデータ) (2026-02-26T16:45:59Z) - CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents [60.98294016925157]
AIエージェントは、悪意のあるコンテンツがエージェントの行動をハイジャックして認証情報を盗んだり、金銭的損失を引き起こすような、インジェクション攻撃に弱い。
CUAのためのシングルショットプランニングでは、信頼できるプランナーが、潜在的に悪意のあるコンテンツを観察する前に、条件付きブランチで完全な実行グラフを生成する。
このアーキテクチャ分離は命令インジェクションを効果的に防止するが、ブランチステアリング攻撃を防ぐには追加の対策が必要であることを示す。
論文 参考訳(メタデータ) (2026-01-14T23:06:35Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。