論文の概要: A Brain-inspired Hierarchical Framework for Zero-Shot Robot Task Reasoning and Execution
- arxiv url: http://arxiv.org/abs/2609.05985v1
- Date: Sat, 05 Sep 2026 08:59:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 12:01:00.66446
- Title: A Brain-inspired Hierarchical Framework for Zero-Shot Robot Task Reasoning and Execution
- Title(参考訳): ゼロショットロボットタスク推論と実行のための脳インスピレーション付き階層型フレームワーク
- Abstract要約: メソッドは、人間の脳における役割の分割にインスパイアされたゼロショット階層的なフレームワークである。
コマンドを明示的なオブジェクト状態に基底付け、再利用可能なアトミックアクションをタスク条件付きシーケンスに構成し、実行コストで代替シーケンスをランク付けする。
メソッドは、ReKep、Dream2Flow、および$_0.5$ベンチマークよりも高い成功率を達成する。
- 参考スコア(独自算出の注目度): 9.745144598922584
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Robots that follow open-ended language instructions need to connect semantic intent to visual scene understanding, geometric feasibility, object states, and physical interaction conditions. End-to-end Vision-Language-Action policies have improved cross-task generalization, but they typically map visual and language inputs directly to robot actions, leaving limited explicit structure for long-horizon decomposition, physical verification, and recovery. We present \method, a zero-shot hierarchical framework functionally inspired by the division of roles in the human brain, comprising visual perception and state inference, language grounding and action-sequence generation from a shared atomic action library, cost-based plan selection, and real-robot execution and verification. The framework grounds commands in explicit object states, composes reusable atomic actions into task-conditioned sequences, ranks alternative sequences by execution cost, and verifies intermediate physical outcomes from refreshed observations. In the evaluation, \method{} completes 10/10 clean board trials, 10/10 pick-and-place trials, and 4/5 pyramid stacking trials for both the flat and irregular initial-layout conditions; the corresponding mean task progress is $99.03\%$, $100.00\%$, and $96.67\%$ respectively. Across all evaluated conditions, \method{} achieves higher success rates than ReKep, Dream2Flow, and $π_{0.5}$ benchmarks, demonstrating the effectiveness of combining explicit object-state reasoning, compositional atomic actions, cost-based plan selection, and closed-loop execution verification.
- Abstract(参考訳): オープンな言語指示に従うロボットは、視覚的なシーン理解、幾何学的実現可能性、オブジェクト状態、物理的相互作用条件に意味的意図を結びつける必要がある。
終端から終端までのビジョン・ランゲージ・アクションポリシーは、クロスタスクの一般化を改善したが、それらは通常、視覚と言語入力を直接ロボットの動作にマッピングし、長い水平分解、物理的検証、回復のための限定的な構造を残している。
本稿では,視覚的知覚と状態推定,言語接地と行動系列の生成,コストベースの計画選択,実ロボットの実行と検証など,人間の脳における役割の分割に着想を得たゼロショット階層型フレームワークである‘method’を提案する。
このフレームワークは、コマンドを明示的なオブジェクト状態に置き、再利用可能なアトミックアクションをタスク条件付きシーケンスに構成し、実行コストで代替シーケンスをランク付けし、リフレッシュされた観測から中間的な物理的結果を検証する。
評価では、10/10のクリーンボード試験、10/10のピック・アンド・プレイス・トライアル、4/5のピラミッド積み重ね試験を、平坦および不規則な初期レイアウト条件の両方で完了し、対応する平均タスクの進捗は99.03\%$、100.00\%$、9.67\%$である。
すべての評価条件において、\method{}はReKep、Dream2Flow、および$π_{0.5}$ベンチマークよりも高い成功率を達成する。
関連論文リスト
- Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation [6.975054201075641]
言語誘導ロボットは、正しいように見える計画を作る以上のことをしなければならない。
計画は、運動と衝突の制約の下で物理的に実現不可能でありながら、言語学的に有効なように見える。
推論実行境界を型付き契約として形式化し、このギャップを埋めます。
論文 参考訳(メタデータ) (2026-08-29T17:26:20Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - IMBench: A Benchmark for Intuitive Robotic Manipulation [11.843368723732679]
人間は推論と運動制御を組み合わせて、様々な制約の下で複雑な操作タスクを解く。
既存のベンチマークは、この統合を達成できない。
IMBENCHは直感的な操作を知覚、身体的推論、行動生成、反復実行にまたがる統合機能として評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-07-17T05:34:29Z) - CORE: Common Outcome Regularities from Action-Free Visual Demonstrations for Robot Manipulation [26.48033419994886]
COREは、視覚的なデモンストレーションから共通アウトカム規則を抽出するポリシー学習フレームワークである。
同じタスクで成功した軌道は多種多様であるが、その終端状態はしばしば安定したオブジェクト構成を共有する。
論文 参考訳(メタデータ) (2026-06-28T17:27:23Z) - WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation [49.31386176285509]
WatchActは、観察された人間の行動に基づくロボット操作のベンチマークである。
WatchActは4つの機能ドメインで14タスクにわたる3,000のロングホライゾンインスタンスで構成されている。
シミュレーションとFranka Research 3ロボットの両方で、現在のシステムはWatchActの解決には程遠い。
論文 参考訳(メタデータ) (2026-06-24T23:13:56Z) - How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning [69.68882580009982]
デモセグメントをVLM生成アノテーションでラベル付けする2段階のアプローチであるDeMiAnを紹介する。
学習したインストラクターがタスク記述と初期シーンスナップショットをデプロイ時にタスクに適したアノテーションにマップする。
RoboCasaでは、インストラクターはタスクのみのベースラインで5ポイント成功し、タスクごとのオラクルの3ポイント以内に到達する。
論文 参考訳(メタデータ) (2026-05-16T16:52:08Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - RoboPlayground: Democratizing Robotic Evaluation through Structured Physical Domains [19.460905215536254]
ロボット操作システムの評価は、専門家が作成した固定ベンチマークに大きく依存している。
我々は、現代的な操作ポリシーを評価するには、言語駆動のプロセスとしてのリフレーミング評価が必要であると論じる。
本稿では,自然言語を用いて実行可能な操作タスクを作成可能なフレームワークであるRoboPlaygroundを提案する。
論文 参考訳(メタデータ) (2026-04-06T22:42:05Z) - OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling [62.3458279176813]
ソフトウェア工学のフォーマリズムのレンズを通して推論を具体化する新しいフレームワークであるオブジェクト指向世界モデリング(OOWM)を提案する。
OOWMはクラスダイアグラムを使用して、厳密なオブジェクト階層に視覚的知覚を基盤とし、アクティビティダイアグラムを使用して、計画を実行可能な制御フローに運用する。
論文 参考訳(メタデータ) (2026-02-25T16:01:07Z) - ThinkBot: Embodied Instruction Following with Thought Chain Reasoning [66.09880459084901]
EIF(Embodied Instruction following)は、複雑な環境下でオブジェクトを相互作用させることで、エージェントが人間の指示を完了させる。
我々は,人間の指導における思考連鎖を原因とした思考ボットを提案し,その不足した行動記述を復元する。
私たちのThinkBotは、成功率と実行効率の両面で、最先端のEIFメソッドよりも大きなマージンで優れています。
論文 参考訳(メタデータ) (2023-12-12T08:30:09Z) - Enhancing Interpretability and Interactivity in Robot Manipulation: A
Neurosymbolic Approach [0.0]
本稿では,言語誘導型視覚推論とロボット操作を結合したニューロシンボリックアーキテクチャを提案する。
非熟練の人間ユーザは、制約のない自然言語を用いてロボットに刺激を与え、参照表現(REF)、質問(VQA)、把握動作指示を提供する。
シミュレーション環境では,3次元視覚と言語によるテーブルトップシーンの合成データセットを作成し,我々のアプローチを訓練し,合成シーンと実世界のシーンの両方で広範な評価を行う。
論文 参考訳(メタデータ) (2022-10-03T12:21:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。