論文の概要: When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents
- arxiv url: http://arxiv.org/abs/2608.01428v1
- Date: Sun, 02 Aug 2026 18:17:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.227163
- Title: When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents
- Title(参考訳): ボトルネックになったときのリプランニング : 身体的エージェントの予算的リプランニング
- Abstract要約: 本稿では、予算制御ループとして再計画を定式化するコントローラBRACEについて述べる。
コスト対応のプログレッシブトークンプルーニング手法であるE-RECAPを導入する。
Meta Habitat、RoboFactory、AirSimの他、E-RECAPを使用したBRACEは、リプランニングコールトークン数を62-92%削減する。
- 参考スコア(独自算出の注目度): 1.7674345486888505
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied agents replan frequently to recover from execution drift, partial observability, and coordination hazards, but each LLM-based replanning call can consume an accumulated textual context that grows over time and across agents. Once this context becomes large, replanning latency develops heavy tails and can miss real-time deadlines even when task success remains high, a failure mode that is hard to detect from average latency or success alone. We present BRACE, a controller that formulates replanning as a budgeted control loop by deciding whether to replan, selecting a replanning mode, and allocating an explicit token budget and latency service-level objective (SLO) while accounting for optional efficiency modules. As a reusable component, we introduce E-RECAP, a cost-aware progressive token pruning method that predicts token utility and prunes replanning contexts across transformer layers while preserving critical head and tail tokens. Across Meta Habitat, RoboFactory, and AirSim, BRACE with E-RECAP reduces replanning-call token counts by 62-92% and SLO violation rates from 85.5-100.0% to 4.7-50.0% in settings where task success is already saturated. In a harder RoboFactory setting where open-loop, frozen-plan, and No BRACE all fail, BRACE + E-RECAP reaches 80.0% success with 4.6% SLO violations, demonstrating that tail-aware per-call budgeting is effective across embodied platforms.
- Abstract(参考訳): 身体的エージェントは、実行のドリフト、部分的可観測性、調整のハザードから回復するために頻繁にリプランされるが、各LSMベースのリプランニングコールは、時間とともにエージェント間で成長する蓄積されたテキストコンテキストを消費することができる。
この状況が大きくなると、リプランングのレイテンシは重くなり、タスクの成功率が高くてもリアルタイムの期限を逸脱する可能性がある。
BRACEは,計画の見直し,再計画モードの選択,明示的なトークン予算と遅延サービスレベル目標(SLO)の割り当てを,オプションの効率モジュールを考慮しつつ行うことで,予算制御ループとして再計画を定式化するコントローラである。
再利用可能なコンポーネントであるE-RECAPは、トークンの有用性を予測し、重要な頭と尾のトークンを保存しながら、トランスフォーマー層間でコンテキストを計画するプログレッシブトークンプルーニング手法である。
Meta Habitat、RoboFactory、AirSimの他、BRACE with E-RECAPはリプランコールトークンの数を62-92%削減し、SLO違反率は85.5-100.0%から4.7-50.0%に短縮した。
オープンループ、フリーズプラン、No BRACEがすべて失敗するRoboFactoryでは、BRACE + E-RECAPが80.0%成功し、4.6%のSLO違反が発生している。
関連論文リスト
- LePlanner: An Iterative Amortized Controller For World Models [0.0]
本研究では,凍結したワールドモデル予測器を用いて遅延動作シーケンスの構築と洗練を学習する,償却反復制御器LePlannerを提案する。
LePlannerは、最初期の地平線で目標に達するようコントローラに促し、そこに留まるよう、到着と保持の目的で訓練されている。
成功率はPushTが98%、Reacherが100%、TwoRoomsが100%、OGBench Cubeが92%である。
論文 参考訳(メタデータ) (2026-09-12T10:01:21Z) - Planning or Learning: Reliability and Cost in Multi-Asset Maintenance [0.8258557806969798]
ラン・トゥ・フェイルデータを用いたマルチアセスメント維持のための計画と強化学習を実証的に比較した。
プランニングは、信頼性をハード制約として実施し、総コストが障害罰の規模に大きく依存しないゼロ障害ポリシーを生成する。
本研究は,マルチアセスメント保守における信頼性とコストのトレードオフを明らかにし,計画とRLが相補的なアプローチであることを示唆する。
論文 参考訳(メタデータ) (2026-09-11T22:10:59Z) - A Self-Triggered Agentic Push Recommendation System [77.13502692161426]
プッシュ通知は、大規模プラットフォームにおける重要なレコメンデーションシナリオである。
本稿では,プロアクティブ・セルフトリガー・エンド・ツー・エンドのエージェント・プッシュ・レコメンデーションシステムを提案する。
STEPSはすでにDouyinに10億人以上のユーザーを抱えている。
論文 参考訳(メタデータ) (2026-08-03T09:20:53Z) - SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents [74.84742205422825]
コスト効率のよい長軸ゲーム制御のための適応型デュアルコントローラフレームワークSPIKEを提案する。
Strategic Controllerは低周波のグローバル計画、障害解析、リカバリを実行し、Reactive Controllerは厳格なトークン予算の下で高速なローカル実行を処理する。
Event Triggerは、視覚的な変化、タスクの進捗、繰り返しアクション、障害信号を監視して、制御がいつ反応性を保つか、あるいは戦略的な推論にエスカレートするかを判断する。
この設計は、複数のリアクティブステップにまたがる戦略的な提案を再利用し、計画が不安定になると局所的なオーバライドをサポートし、余分な議論が役に立つ瞬間に高価な推論を予約する。
論文 参考訳(メタデータ) (2026-05-18T16:43:32Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - MAFIG: Multi-agent Driven Formal Instruction Generation Framework [17.52930666720453]
スケジューリングシステムにおける緊急事態は、しばしばシステムの安定性を損なう局所的な機能障害を引き起こし、システム崩壊を引き起こす。
既存のメソッドは、ロバストなスケジューリングやリアクティブなスケジューリング、事前定義されたルールや再スケジュール戦略による緊急処理に依存している。
我々は,クラウド大規模言語モデルの意思決定能力を軽量なローカルモデルに伝達するために,損失駆動型局所蒸留機構を導入する。
論文 参考訳(メタデータ) (2026-04-13T04:47:20Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making [68.12864562049957]
身体ロボットシステムは、高レベルの推論をサポートするために、大規模言語モデル(LLM)ベースのエージェントにますます依存している。
エージェントはいつ、いつ、いつ行動すべきか?
本稿では,エンボディエージェントのリソース・アウェア・オーケストレーションのための階層的なフレームワークであるRARRL(Resource-Aware Reasoning via Reinforcement Learning)を提案する。
論文 参考訳(メタデータ) (2026-03-17T15:38:50Z) - iScheduler: Reinforcement Learning-Driven Continual Optimization for Large-Scale Resource Investment Problems [30.109981943437006]
共有再生資源下での事前制約されたタスクのスケジューリングは、現代のコンピューティングプラットフォームの中心である。
強化学習駆動型反復スケジューリングフレームワークiSchedulerを提案する。
実験の結果、iSchedulerは競争力のあるリソースコストを得ると同時に、強力な商用ベースラインに対して最大43$timesの時間で実現可能であることがわかった。
論文 参考訳(メタデータ) (2026-01-30T11:20:58Z) - Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction [4.323124094061299]
リアルタイムのシーケンシャル制御エージェントは、しばしば推論遅延によってボトルネックとなる。
本稿では,TD-MPC2を用いたモデルベース制御に投機的実行の予測理論を適応させるフレームワークを提案する。
提案手法は,500から282までの計画推測数を削減し,エンドツーエンドのステップ遅延を25%改善し,リターン率をわずか7.1%に抑えた強い制御性能を維持した。
論文 参考訳(メタデータ) (2025-12-19T05:34:52Z) - No-Regret Learning Under Adversarial Resource Constraints: A Spending Plan Is All You Need! [56.80767500991973]
アクション選択の前に報酬とコストが観測される$(i)$オンラインリソース割当と、アクション選択後、完全なフィードバックや盗賊フィードバックの下で、リソース制限付きオンライン学習である$(ii)$オンラインリソース割当に焦点を当てた。
報酬とコスト分布が時間とともに任意に変化する場合、これらの設定でサブ線形後悔を達成することは不可能であることが知られている。
我々は、支出計画に従う基準線に対する半線形後悔を実現する一般的な(基本的)二重的手法を設計し、また、支出計画が予算のバランスの取れた配分を保証すると、アルゴリズムの性能が向上する。
論文 参考訳(メタデータ) (2025-06-16T08:42:31Z) - ALAS: A Stateful Multi-LLM Agent Framework for Disruption-Aware Planning [2.1331883629523634]
本稿では,4つの基本的なLLM障害に対処するフレームワークであるAdaptive LLM Agent System (ALAS)を提案する。
ALASは各計画をロール特殊化エージェントに分解し、それらを自動状態トラッキングに装備し、軽量なプロトコルを介して調整する。
実世界の大規模ジョブショップスケジューリングベンチマークにおいて、ALASは静的シーケンシャルな計画のための新しい最良の結果を設定し、予期せぬ破壊を伴う動的リアクティブシナリオを最適化する。
論文 参考訳(メタデータ) (2025-05-18T17:27:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。