論文の概要: TypeGo: An OS Runtime for Embodied Agents
- arxiv url: http://arxiv.org/abs/2607.05482v1
- Date: Mon, 06 Jul 2026 15:47:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.278266
- Title: TypeGo: An OS Runtime for Embodied Agents
- Title(参考訳): TypeGo: Embodied AgentsのOSランタイム
- Abstract要約: 大規模言語モデル(LLM)は、自然言語からのエンボディエージェントの振る舞いを計画することができる。
我々は、エンボディされたエージェントのためのオペレーティングシステムスタイルのランタイムを論じ、このアイデアを初期のプロトタイプであるTypeGoでインスタンス化する。
- 参考スコア(独自算出の注目度): 2.9912913279642908
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) can plan behavior for embodied agents from natural language, but treating the LLM as a request/response oracle on the critical path is fundamentally at odds with real-time control and concurrent goals. We argue for an operating-system-style runtime for embodied agents, and instantiate this idea in an early prototype, TypeGo. TypeGo structures LLM-based planning as asynchronous loops at multiple timescales that overlap with execution, and manages the agent's physical body like an OS manages hardware: the Skill Kernel arbitrates typed physical subsystems among concurrent per-task processes, a scheduler preempts them and resumes or replaces each by source, and speculative skill streaming hides LLM latency behind ongoing motion, while a fast first-action path yields visible feedback within a second. Users program behavior through natural language prescriptions that TypeGo dispatches to the LLM-based planners or compiles into low-latency interrupt handlers. Our prototype of Kalos, a Unitree Go2 quadruped, provides preliminary evidence for the design: in our current task suite, it cuts per-step delay by 50% over step-by-step planning and time-to-first-action by 73% over monolithic planning, while admitting concurrent tasks at low scheduling overhead.
- Abstract(参考訳): 大規模言語モデル(LLM)は、自然言語からのエンボディエージェントの動作を計画できるが、LLMをクリティカルパス上の要求/応答のオラクルとして扱うことは、基本的にリアルタイム制御と同時ゴールに反する。
我々は、エンボディされたエージェントのためのオペレーティングシステムスタイルのランタイムを論じ、このアイデアを初期のプロトタイプであるTypeGoでインスタンス化する。
TypeGoは、実行と重なり合う複数の時間スケールでLLMベースのプランニングを非同期ループとして構成し、OSのようにエージェントの物理体を管理する。Skill Kernelは、同時タスク毎のプロセス間で、型付けされた物理サブシステムを仲裁し、スケジューラはそれらをプリエンプションし、ソースによってそれぞれを再開または置き換え、投機的なスキルストリーミングは、進行中の動作の遅延を隠蔽し、高速なファーストアクションパスは、1秒以内に可視的なフィードバックをもたらす。
ユーザは、TypeGoがLSMベースのプランナーにディスパッチする自然言語処方薬または低遅延割り込みハンドラにコンパイルする振る舞いをプログラムする。
現在のタスクスイートでは、ステップ毎の遅延を50%削減し、モノリシックな計画よりも73%削減します。
関連論文リスト
- PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration [2.2726869886741383]
本稿では, LLMに基づくタスク推論と, Directed Acyclic Graph表現と制約対応オンラインスケジューリングを統合した新しいフレームワークOSDAGを提案する。
5つのベンチマークシナリオの実験では、OSDAGは対話ベースの手法に比べて5~15倍高速な推論時間を実現し、シーケンシャルベースラインよりも最大38%のペースパンを削減し、競争的な成功率を維持している。
論文 参考訳(メタデータ) (2026-06-13T11:22:34Z) - From I/O to Code with Discovery Agent [103.88427301265669]
IO2Codeの発見エージェントであるDIO-Agentを提案する。
本手法は,プログラム空間上の進化的探索としてIO2Codeをフレーム化する。
大規模な実験により、DIO-Agentは従来のプログラムバイサンプル法とSOTA進化エージェントベースラインの両方を一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-05-14T18:57:32Z) - RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution [36.644786364066796]
RunAgentは、自然言語プランを解釈し、制約やルーリックを通じて段階的に実行するマルチエージェントプラン実行プラットフォームである。
RunAgent はベースライン LLM や最先端の PlanGEN 法より優れていることを示す。
論文 参考訳(メタデータ) (2026-05-01T17:29:45Z) - From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution [1.8222732878503212]
LLMベースのエージェントを構築するための主要なパラダイムはエージェントループ(Agent Loop)である。
この観点では、エージェントループとグラフベースの実行エンジンを単一のセマンティック連続体に配置する。
暗黙の文脈から暗黙の静的DAGへ制御フローを上昇させるSGHを提案する。
論文 参考訳(メタデータ) (2026-04-13T12:16:45Z) - SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning [104.01865949020304]
エージェント・マルチモーダル・大規模言語モデル(MLLM)は,反復的な視覚的ツールの実行によって顕著な推論能力を達成する。
しかし、カスケード認識、推論、ツール呼び出しループは、重要なシーケンシャルなオーバーヘッドをもたらす。
このオーバーヘッドはエージェントディープと呼ばれ、禁止されたレイテンシを発生させ、システムレベルのスループットを著しく制限します。
本稿では,エージェントレベルの投機的アクセラレーションフレームワークであるSpecEyesを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:45:47Z) - VerifyLLM: LLM-Based Pre-Execution Task Plan Verification for Robots [44.99833362998488]
本研究では,シミュレータや実環境で実行する前に,タスクプランを自動的に検証するアーキテクチャを提案する。
このモジュールは、Large Language Modelsの推論機能を使用して、論理的一貫性を評価し、計画の潜在的なギャップを特定する。
我々は,タスク計画の信頼性と効率の向上に寄与し,自律システムにおける堅牢な事前実行検証の必要性に対処する。
論文 参考訳(メタデータ) (2025-07-07T15:31:36Z) - Autellix: An Efficient Serving Engine for LLM Agents as General Programs [59.673243129044465]
大規模言語モデル(LLM)アプリケーションは、単純なチャットボットを超えて、動的で汎用的なエージェントプログラムへと進化している。
既存のLLMサービスシステムは、プログラムと呼び出し間の依存関係を無視し、最適化のための大きな機会を欠いている。
プログラムを第一級市民として扱い、エンドツーエンドのレイテンシを最小限に抑えるLLMサービスシステムであるAutellixを紹介する。
論文 参考訳(メタデータ) (2025-02-19T18:59:30Z) - Robotouille: An Asynchronous Planning Benchmark for LLM Agents [7.574421886354134]
非同期計画は、時間遅延、多種多様な長期タスクの理由付け、他のエージェントとの協力を必要とするエージェントにとって不可欠である。
我々は、長時間の非同期シナリオを処理するエージェントの能力をテストするために設計されたベンチマーク環境であるRobotouilleを紹介する。
結果から,ReAct(gpt4-o)は同期タスクでは47%,非同期タスクでは11%に過ぎなかった。
論文 参考訳(メタデータ) (2025-02-06T05:50:37Z) - Tree-Planner: Efficient Close-loop Task Planning with Large Language Models [63.06270302774049]
Tree-Plannerは、大きな言語モデルでタスクプランニングを3つの異なるフェーズに再構成する。
Tree-Plannerは高い効率を維持しながら最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-10-12T17:59:50Z) - Neuro-Symbolic Causal Language Planning with Commonsense Prompting [67.06667162430118]
言語プランニングは、より単純な低レベルステップに分解することで、複雑な高レベルな目標を実装することを目的としている。
以前の手法では、大規模な言語モデルからそのような能力を得るために、手動の例えか注釈付きプログラムが必要である。
本稿では,LLMからの手続き的知識をコモンセンス・インフュージョン・プロンプトにより引き起こすニューロシンボリック因果言語プランナー(CLAP)を提案する。
論文 参考訳(メタデータ) (2022-06-06T22:09:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。