論文の概要: ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents
- arxiv url: http://arxiv.org/abs/2605.19314v1
- Date: Tue, 19 May 2026 03:49:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:09.105037
- Title: ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents
- Title(参考訳): ContextFlow: 長距離エージェントのための階層型タスク状態アライメント
- Abstract要約: ロングホライゾンの実施するエージェントは、ナビゲーション、探索、アプローチ、操作を専門家に委任する傾向にある。
タスク状態の不整合(Task-state misalignment)、すなわち、プランナーのアクティブステージ、実行時のエビデンス、記憶されたコンテキスト、委任されたエグゼクティブが、もはや同じ次のステップの決定を正当化しないタスクレベルの整合性障害(Task-level consistency failure)について研究する。
我々は,段階を明示的な契約として表現し,実行時の観察結果をエビデンスパケットに変換し,スコープ付き更新を適用する検査可能なアライメントフレームワークであるContextFlowを提案する。
- 参考スコア(独自算出の注目度): 41.517468049737936
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon embodied agents increasingly delegate navigation, search, approach, and manipulation to specialist executors. As these executors become stronger, the main bottleneck shifts from local skill execution to maintaining a coherent task frontier across planning, monitoring, memory, and execution. We study task-state misalignment, a task-level consistency failure in which the planner's active stage, runtime evidence, remembered context, and delegated executor no longer justify the same next-step decision. This failure can lead to unsupported handoffs, stage lock, executor-context mismatch, and unnecessary replanning. We propose ContextFlow, an inspectable alignment framework that represents stages as explicit contracts, converts runtime observations into evidence packets, and applies scoped updates including continue, refine, transfer, promote, and repair. ContextFlow keeps specialist executors responsible for local closed-loop control while making task-frontier alignment explicit and auditable. Experiments and demonstration traces on long-horizon embodied tasks illustrate how evidence-grounded scoped updates diagnose and mitigate recurring task-state failures.
- Abstract(参考訳): ロングホライゾンの実施するエージェントは、ナビゲーション、探索、アプローチ、操作を専門家に委任する傾向にある。
これらの実行者が強くなるにつれて、主なボトルネックは、ローカルのスキル実行から、計画、監視、メモリ、実行をまたいだ一貫性のあるタスクフロンティアの維持へと移行します。
タスク状態の不整合(Task-state misalignment)、すなわち、プランナーのアクティブステージ、実行時のエビデンス、記憶されたコンテキスト、委任されたエグゼクティブが、もはや同じ次のステップの決定を正当化しないタスクレベルの整合性障害(Task-level consistency failure)について研究する。
この失敗は、サポート対象のハンドオフ、ステージロック、エグゼキュータ-コンテキストミスマッチ、不要なリプレーニングにつながる可能性がある。
本研究では,段階を明示的なコントラクトとして表現し,実行時の観察結果をエビデンスパケットに変換し,継続,精細化,転送,促進,修復といったスコープ付き更新を適用した,検査可能なアライメントフレームワークであるContextFlowを提案する。
ContextFlowは、クローズドループコントロールを担当する専門家のエグゼクタを維持しながら、タスク-フロンティアアライメントを明確かつ監査可能にする。
長期にわたる実施タスクの実験とデモトレースは、エビデンス的なスコープ付き更新が繰り返し発生するタスク状態の障害を診断し緩和する方法を示している。
関連論文リスト
- Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation [1.37013665345905]
ROBUST TAMPは、リアクティブTAMPのためのモジュール式LLM/VLM誘導計画フレームワークである。
システムは、完了アクション履歴と構造化されたリプランイベントコンテキストを用いて、可視的なシーン状態とリプランを再構築する。
6つのRLBench/CoppeliaSimキッチンと、非ターゲットオブジェクト発見、関節-コンテナ相互作用、時間的操作を含むグリル変種で評価を行う。
論文 参考訳(メタデータ) (2026-08-28T08:44:47Z) - SKILL.state: Scalable Long-Horizon Agent Skills [0.0]
我々は、追加のみの会話履歴を明示的で変更可能な実行状態に置き換えるランタイムアーキテクチャであるSKILLを紹介する。
以上の結果から,明示的実行状態は拡張性のある長期エージェントスキルに対して,効果的かつアーキテクチャに依存しない抽象化であることが示された。
論文 参考訳(メタデータ) (2026-08-26T18:00:06Z) - AgentRewind: Recoverable Execution for Long-Horizon LLM Agents [32.44158037765297]
我々は,エージェントコンテキストと制御環境の整列チェックポイントを記録するランタイムリカバリフレームワークであるAgentRewindを紹介する。
また,タスク完了と長期工学的課題の部分的進捗を評価するベンチマークであるMettleBenchを構築した。
論文 参考訳(メタデータ) (2026-08-14T15:20:35Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL [72.7712729541565]
自己回帰(AR)ビデオ拡散モデルにより、ビデオチャンクをキャッシュされたビジュアルコンテキストでチャンクで合成することで、低レイテンシなストリーミング生成を可能にする。
1つのグローバルプロンプトは、どのサブイベントを各チャンクで実現すべきかを指定しないが、ステップワイズプロンプトにナビゲート的に切り替えると、しばしば遅延反応、ブレンドステップセマンティクス、プロンプト遷移間のエラー伝播につながる。
我々は、時間分解とステップ条件付き実行を協調的に最適化し、時間分解可能なARビデオ生成のためのプランナー-実行型強化学習フレームワークであるTempActでこれらの課題に対処する。
論文 参考訳(メタデータ) (2026-06-26T12:19:28Z) - Cordon: Semantic Transactions for Tool-Using LLM Agents [11.567293065381918]
本稿では,コミット前にエージェント効果のステージングと検証を行うトランザクションランタイムシステムであるCordonを紹介する。
適度な承認とレイテンシのオーバーヘッドで、良質なタスク補完を保ちながら、不可逆的な効率の失敗を減らす。
論文 参考訳(メタデータ) (2026-06-16T06:21:14Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - Event-Driven Proactive Assistive Manipulation with Grounded Vision-Language Planning [14.022917047438375]
リクエスト駆動型アシストからイベント駆動型プロアクティブアシストへの移行を紹介します。
イベントモニタとのインタラクション進捗を追跡するイベント駆動フレームワークを提案する。
我々は,実際のテーブルトップ数ブロック協調作業において,そのフレームワークを評価する。
論文 参考訳(メタデータ) (2026-03-25T05:14:04Z) - RuntimeSlicer: Towards Generalizable Unified Runtime State Representation for Failure Management [23.96013849484881]
メトリクス、トレース、ログは、システム実行時の振る舞いを補完するビューを提供する。
Slicerは、メトリクス、トレース、ログを1つの整列したシステム状態の埋め込みにエンコードするタスクに依存しない表現モデルを事前トレーニングする。
State-Aware Task-Oriented Tuningは、ランタイム状態の教師なしパーティショニングを実行し、ダウンストリームタスクに対する状態条件適応を可能にする。
論文 参考訳(メタデータ) (2026-03-23T02:35:13Z) - A Trace-Based Assurance Framework for Agentic AI Orchestration: Contracts, Testing, and Governance [0.22940141855172028]
本稿では,Large Language Models (LLM) を用いたエージェントAIシステムの保証フレームワークを提案する。
実行は、明示的なステップとトレースコントラクトを備えたメッセージ・アクション・トレース(MAT)として実装される。
このフレームワークは、有界摂動に対する予算付き反例探索として定式化されたストレステストを含む。
論文 参考訳(メタデータ) (2026-03-18T10:23:48Z) - Robust and Efficient Tool Orchestration via Layered Execution Structures with Reflective Correction [55.13278005189741]
私たちは、高レベルのツール依存関係をキャプチャする階層化された実行構造を学ぶために、ツールオーケストレーションをモデル化します。
本稿では,局所的にエラーを検出し,修正するスキーマ対応反射補正機構を提案する。
この設計では、エラーを個々のツールコールに限定し、実行軌跡全体の再計画を避ける。
論文 参考訳(メタデータ) (2026-02-21T22:20:01Z) - V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks [6.820118518027692]
V-CAGEは、大規模なセマンティックアライメントデータセットを生成するクローズドループフレームワークである。
本研究では,シーン合成における幾何学的整合性を実現する文脈認識型インスタンス化機構を提案する。
また、階層的な命令分解モジュールを用いて、抽象意図と低レベル制御のギャップを埋める。
論文 参考訳(メタデータ) (2026-01-21T16:41:51Z) - Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents [28.061156787350395]
Task-Decoupled Planning (TDP)は、絡み合った推論をタスク・デカップリングに置き換えるトレーニング不要のフレームワークである。
TDPは、ワークフローを中断することなく、推論とアクティブなサブタスクへのリプレーニングを限定する。
TravelPlanner、ScienceWorld、HotpotQAの結果は、TDPがトークン消費を最大82%削減しながら、強力なベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2026-01-12T14:30:10Z) - DyFlow: Dynamic Workflow Framework for Agentic Reasoning [79.19799197382478]
DyFlowは動的ワークフロー生成フレームワークで、タスク要求とリアルタイム中間フィードバックに基づいて推論手順を適応的に構築し、調整する。
社会的推論,生物医学的タスク,数学的問題解決,コード生成など,さまざまな領域でDyFlowを体系的に評価する。
結果は、DyFlowが既存のベースラインを大幅に上回り、Pass@kの改善を実現し、さまざまなドメインにわたって堅牢な一般化を示すことを示した。
論文 参考訳(メタデータ) (2025-09-30T10:36:23Z) - Haste Makes Waste: Evaluating Planning Abilities of LLMs for Efficient and Feasible Multitasking with Time Constraints Between Actions [56.88110850242265]
本稿では,現実の調理シナリオに基づいた新しいベンチマークフレームワークRecipe2Planを紹介する。
従来のベンチマークとは異なり、Recipe2Planは並列タスク実行による調理時間を最適化するためにエージェントに挑戦する。
論文 参考訳(メタデータ) (2025-03-04T03:27:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。