論文の概要: SKILL.state: Scalable Long-Horizon Agent Skills
- arxiv url: http://arxiv.org/abs/2608.26263v1
- Date: Wed, 26 Aug 2026 18:00:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.137478
- Title: SKILL.state: Scalable Long-Horizon Agent Skills
- Title(参考訳): SKILL.state: スケーラブルなロングホライゾンエージェントスキル
- Abstract要約: 我々は、追加のみの会話履歴を明示的で変更可能な実行状態に置き換えるランタイムアーキテクチャであるSKILL.stateを提案する。
以上の結果から,明示的実行状態は拡張性のある長期エージェントスキルに対して,効果的かつアーキテクチャに依存しない抽象化であることが示された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) increasingly act as autonomous agents executing complex, long-running procedural skills. Existing agent runtimes maintain execution by continually appending observations, actions, and intermediate reasoning traces to an ever-growing conversation history, causing latency degradation and context-poisoning failures over long horizons. We present SKILL.state, a runtime architecture that replaces append-only conversational history with an explicit, mutable execution state. At each execution step, the model receives only the immutable skill specification, the current structured execution state, and the latest observation. Intermediate reasoning is discarded immediately after producing a validated state update, preventing prompt growth with execution history. Across diverse datasets, models, and execution environments, SKILL.state improves task accuracy while substantially reducing cumulative token consumption. Our results demonstrate that explicit execution state is an effective and architecture-agnostic abstraction for scalable long-horizon agent skills.
- Abstract(参考訳): 大規模言語モデル(LLM)は、複雑で長期にわたる手続き的なスキルを実行する自律的なエージェントとしての役割をますます高めている。
既存のエージェントランタイムは、観測、アクション、中間的推論を継続的に追加することで実行を維持している。
我々は、追加のみの会話履歴を明示的で変更可能な実行状態に置き換えるランタイムアーキテクチャであるSKILL.stateを提案する。
各実行ステップにおいて、モデルは不変のスキル仕様、現在の構造化された実行状態、最新の観察のみを受け取る。
検証された状態更新を生成した直後に中間的推論が破棄され、実行履歴による迅速な成長が防止される。
多様なデータセット、モデル、実行環境にわたって、SKILL.stateは累積トークン消費を大幅に削減し、タスクの正確性を向上させる。
以上の結果から,明示的実行状態は拡張性のある長期エージェントスキルに対して,効果的かつアーキテクチャに依存しない抽象化であることが示された。
関連論文リスト
- Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure [29.25570731801935]
StructAgentは、コンパクトで検証可能なタスク進捗を維持するための状態中心のフレームワークである。
明確な進捗チェックポイント、エビデンス駆動のタスク補完、ターゲットとする障害回復、ツールサポートされた実行を可能にします。
デスクトップ環境を超えてMinecraftに一般化し、私たちのデザインの汎用性を実証します。
論文 参考訳(メタデータ) (2026-07-13T10:48:25Z) - ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents [41.517468049737936]
ロングホライゾンの実施するエージェントは、ナビゲーション、探索、アプローチ、操作を専門家に委任する傾向にある。
タスク状態の不整合(Task-state misalignment)、すなわち、プランナーのアクティブステージ、実行時のエビデンス、記憶されたコンテキスト、委任されたエグゼクティブが、もはや同じ次のステップの決定を正当化しないタスクレベルの整合性障害(Task-level consistency failure)について研究する。
我々は,段階を明示的な契約として表現し,実行時の観察結果をエビデンスパケットに変換し,スコープ付き更新を適用する検査可能なアライメントフレームワークであるContextFlowを提案する。
論文 参考訳(メタデータ) (2026-05-19T03:49:17Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Agents Learn Their Runtime: Interpreter Persistence as Training-Time Semantics [4.774525456207306]
ツール拡張LDMは、自然言語推論と実行可能なPythonアクションをインターリーブするエージェントとして、ますます多くデプロイされている。
インタプリタの永続化は単に実行時の足場なのか、それともエージェントがインタープリタの使い方を学習する方法を形作るトレーニングデータの特性なのかを問う。
ワンショットソリューションを避けるために設計された、部分的に観測可能な最適化タスクの手続き的に生成されたファミリーであるOpaque Knapsackを紹介する。
論文 参考訳(メタデータ) (2026-03-01T18:08:02Z) - Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents [20.481392033796265]
私たちは、リアクティブな振る舞いを超えて、構造化され、状態認識され、実行基盤の推論に移行する必要があると論じています。
明示的な構造、永続的かつ進化的な状態、そして実行時のフィードバックの統合によって、SEエージェントがより一貫性と信頼性のある推論を行うのにどう役立つかを概説する。
論文 参考訳(メタデータ) (2026-02-04T15:07:53Z) - Haste Makes Waste: Evaluating Planning Abilities of LLMs for Efficient and Feasible Multitasking with Time Constraints Between Actions [56.88110850242265]
本稿では,現実の調理シナリオに基づいた新しいベンチマークフレームワークRecipe2Planを紹介する。
従来のベンチマークとは異なり、Recipe2Planは並列タスク実行による調理時間を最適化するためにエージェントに挑戦する。
論文 参考訳(メタデータ) (2025-03-04T03:27:02Z) - CItruS: Chunked Instruction-aware State Eviction for Long Sequence Modeling [52.404072802235234]
本稿では,下流タスクに有用な注目度を隠蔽状態の消去プロセスに統合する新しいモデリング手法であるChunked Instruction-Aware State Eviction(CItruS)を紹介する。
トレーニング不要な手法は,メモリ予算が同じ条件下で,複数の強いベースライン上での長いシーケンス理解および検索タスクにおいて,優れた性能を示す。
論文 参考訳(メタデータ) (2024-06-17T18:34:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。