論文の概要: Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning
- arxiv url: http://arxiv.org/abs/2606.31260v1
- Date: Tue, 30 Jun 2026 07:37:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.127346
- Title: Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning
- Title(参考訳): 右・右・右・右・右・右・右・右・右・右・右・右・右・左・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・右・
- Abstract要約: 身体的なタスクプランニングは、エージェントに自然言語の命令を物理的なシーンで実行可能なアクションのシーケンスに変換するように要求する。
近年のプロンプトベースおよび強化学習プランナーは、流動的なアクションテキストを生成するが、ターゲットの世界において、生成したプランが有効であるという安価な決定論的チェックは欠落している。
データ構築、検証、報酬設計のための共有インターフェースとして、1つのBDDLが機能することを示します。
- 参考スコア(独自算出の注目度): 8.807543162466557
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied task planning asks an agent to turn a natural-language instruction into an executable sequence of actions in a physical scene, and is a building block for household, assistive, and service robots. Recent prompting-based and reinforcement-learning planners generate fluent action text but lack a cheap deterministic check that the produced plan is valid in the target world, while high-fidelity simulation is too slow to serve as an inner-loop training signal. The general problem is therefore how to obtain verifiable supervision and rewards for embodied planners without relying on string-level matching or full simulation. Here we show that a single BDDL specification, automatically constructed from open-world video evidence or curated tasks, can serve as a shared interface for data construction, plan verification, and reward design. A video-to-BDDL parser, an LLM verifier, and a lightweight symbolic engine together supply dense feedback at millisecond latency. We further introduce GroupAdapt, a difficulty-aware length schedule that uses the in-batch group pass rate as a zero-cost signal so that hard prompts get wider length tolerance and automatically tighten as their pass rate improves. Under the guidance of the proposed verifier and GroupAdapt schedule, the 8B planner attains a Strict-Pass score of 97.3 on BEHAVIOR-1000, yielding a 25.9 percent relative improvement over the Qwen3-8B baseline. This result exceeds the strongest large-model baseline by 3.5 percent, while simultaneously compressing the response length by 79 percent to 207 tokens, demonstrating both effectiveness and efficiency.
- Abstract(参考訳): 身体的なタスクプランニングは、エージェントに対して、自然言語の指示を物理的なシーンで実行可能な一連のアクションに変換するように求め、家庭、補助ロボット、サービスロボットのためのビルディングブロックである。
最近のプロンプトベースおよび強化学習プランナーは、流動的な動作テキストを生成するが、高忠実度シミュレーションは、インナーループ訓練信号として機能するには遅すぎるが、生成したプランがターゲット世界で有効であるという、安価な決定論的チェックを欠いている。
したがって、一般的な問題は、文字列レベルのマッチングや完全なシミュレーションに頼ることなく、具体的プランナーに対する検証可能な監督と報酬を得る方法である。
ここでは、オープンワールドビデオエビデンスやキュレートされたタスクから自動的に構築された単一のBDDL仕様が、データ構築、計画検証、報酬設計のための共有インターフェースとして機能することを示します。
ビデオからBDDLパーサ、LLM検証器、軽量なシンボリックエンジンがミリ秒レイテンシで高密度フィードバックを提供する。
さらに,帯域内通過率をゼロコスト信号として使用することで,ハードプロンプトの耐久性が向上し,パスレートが向上するに従って自動的に締め付ける,困難を意識した長さスケジュールであるGroupAdaptを導入する。
提案された検証とGroupAdaptスケジュールの指導のもと、8BプランナーはBEHAVIOR-1000でStrict-Passスコア97.3を獲得し、Qwen3-8Bベースラインよりも25.9%向上した。
この結果は最強のモデルベースラインを3.5パーセント上回り、同時に応答長を79%から207トークンに圧縮し、有効性と効率性を実証した。
関連論文リスト
- LePlanner: An Iterative Amortized Controller For World Models [0.0]
本研究では,凍結したワールドモデル予測器を用いて遅延動作シーケンスの構築と洗練を学習する,償却反復制御器LePlannerを提案する。
LePlannerは、最初期の地平線で目標に達するようコントローラに促し、そこに留まるよう、到着と保持の目的で訓練されている。
成功率はPushTが98%、Reacherが100%、TwoRoomsが100%、OGBench Cubeが92%である。
論文 参考訳(メタデータ) (2026-09-12T10:01:21Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration [2.2726869886741383]
本稿では, LLMに基づくタスク推論と, Directed Acyclic Graph表現と制約対応オンラインスケジューリングを統合した新しいフレームワークOSDAGを提案する。
5つのベンチマークシナリオの実験では、OSDAGは対話ベースの手法に比べて5~15倍高速な推論時間を実現し、シーケンシャルベースラインよりも最大38%のペースパンを削減し、競争的な成功率を維持している。
論文 参考訳(メタデータ) (2026-06-13T11:22:34Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning [104.01865949020304]
エージェント・マルチモーダル・大規模言語モデル(MLLM)は,反復的な視覚的ツールの実行によって顕著な推論能力を達成する。
しかし、カスケード認識、推論、ツール呼び出しループは、重要なシーケンシャルなオーバーヘッドをもたらす。
このオーバーヘッドはエージェントディープと呼ばれ、禁止されたレイテンシを発生させ、システムレベルのスループットを著しく制限します。
本稿では,エージェントレベルの投機的アクセラレーションフレームワークであるSpecEyesを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:45:47Z) - Hierarchical LLM-Based Multi-Agent Framework with Prompt Optimization for Multi-Robot Task Planning [0.9453554184019106]
マルチロボットタスクプランニングでは、自然言語命令を実行可能なアクションに分解する必要がある。
PDDLプランナーは厳格な保証を提供するが、曖昧な任務や長期の任務を扱うのに苦労する。
高速な最適化が可能な階層型マルチエージェントLSMベースのプランナを提案する。
論文 参考訳(メタデータ) (2026-02-25T08:08:26Z) - MagicAgent: Towards Generalized Agent Planning [73.21129030631421]
汎用エージェント計画に特化して設計された基盤モデルである textbfMagicAgent について述べる。
多様な計画タスクにまたがる高品質なトラジェクトリを生成する軽量でスケーラブルな合成データフレームワークを提案する。
MagicAgent-32B と MagicAgent-30B-A3B は様々なオープンソースベンチマークにおいて優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-02-22T01:39:16Z) - H-AIM: Orchestrating LLMs, PDDL, and Behavior Trees for Hierarchical Multi-Robot Planning [3.2800662172795114]
H-AIMは、新しいマルチロボットタスク計画フレームワークである。
命令を解析し、計画ドメイン定義言語(PDDL)問題記述を生成するために、大きな言語モデル(LLM)を利用する。
結果のプランを、リアクティブコントロールのための行動ツリーにコンパイルする。
論文 参考訳(メタデータ) (2026-01-16T07:59:50Z) - Open-Vocabulary Spatio-Temporal Scene Graph for Robot Perception and Teleoperation Planning [55.90805559207812]
動的リモートシーンでは、双方向通信における伝送遅延は、リモート認識状態とオペレータ意図の間のギャップを生じさせる。
本稿では,時間的ダイナミクスと軽量遅延アノテーションを用いて,オープン語彙認識を充実させる表現を提案する。
提案手法はReplicaベンチマークで74%のノード精度を実現し,Concept.Graphよりも優れていた。
論文 参考訳(メタデータ) (2025-09-27T04:31:24Z) - EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought [95.37585041654535]
Embodied AIは、ロボットが物理的な環境で長時間のタスクを遂行するためのアクションシーケンスを計画し、実行することができる。
本稿では,EmbodiedGPTを紹介する。EmbodiedGPTは,エンボディドAIのためのエンドツーエンドのマルチモーダル基盤モデルである。
実験は、実施計画、実施制御、視覚的キャプション、視覚的質問応答など、実施されたタスクに対するEmbodiedGPTの有効性を示す。
論文 参考訳(メタデータ) (2023-05-24T11:04:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。