論文の概要: Neurosymbolic Embodied Agents
- arxiv url: http://arxiv.org/abs/2608.16794v2
- Date: Tue, 18 Aug 2026 20:46:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 15:48:19.5271
- Title: Neurosymbolic Embodied Agents
- Title(参考訳): ニューロシンボリック・エボダイド・エージェント
- Abstract要約: 言語および視覚言語モデルは、もっともらしい具体化された計画を生成するが、実行可能性を保証するものではない。
本稿では,長期の家庭内課題をタスク指向の視覚探索と制約付きシンボルプランニングに分解するニューロシンボリックエージェントを提案する。
- 参考スコア(独自算出の注目度): 47.49426471809857
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language and vision-language models generate plausible embodied plans but do not guarantee executability, as their outputs can violate environment dynamics or act on incorrectly grounded entities. We present a neurosymbolic agent that factors long-horizon household tasks into task-directed visual exploration and constrained symbolic planning. In the first phase, a vision-language model and exploration harness acquire goal-relevant predicates and instance bindings from egocentric observations and grounded interactions, producing a symbolic initial state. In the second, a PDDL transition model restricts decoding to tokens that extend applicable actions. Monte Carlo tree search then evaluates executable continuations using a domain-independent planning heuristic. The resulting plans are executable by construction under the transition model, with transfer to the environment conditioned on correct visual grounding. On VirtualHome and ALFWorld, open 4B-27B models exceed 90% success in both environments, and our smallest agent substantially outperforms a 27B direct visual policy in each. Constraints and search prove complementary rather than interchangeable: in ALFWorld either alone solves under a third of tasks, whereas their combination solves over 95%. The method also uses several times fewer generated tokens than extended thinking and far fewer model-visible images than direct interaction, and residual failures localize to state acquisition rather than plan generation without any specialized training.
- Abstract(参考訳): 言語および視覚言語モデルは、プラルーシブルなエンボディドプランを生成するが、実行可能性を保証することはない。
本稿では,長期の家庭内課題をタスク指向の視覚探索と制約付きシンボルプランニングに分解するニューロシンボリックエージェントを提案する。
第1フェーズでは、視覚言語モデルと探索手法が、自我中心の観測と接地された相互作用から目標関連述語とインスタンス結合を取得し、象徴的な初期状態を生成する。
第2に、PDDLトランジションモデルは、適用可能なアクションを拡張するトークンへのデコードを制限する。
モンテカルロ木探索はドメインに依存しない計画ヒューリスティックを用いて実行可能継続を評価する。
得られた計画は、遷移モデルの下で構築によって実行可能であり、正確な視覚的接地によって条件付けられた環境に転送される。
VirtualHomeとALFWorldでは、オープンな4B-27Bモデルが両方の環境で90%以上成功し、最小のエージェントがそれぞれ27Bの直接視覚ポリシーを大幅に上回っている。
制約と探索は、交換可能というよりも補完的なものであることが証明されている: ALFWorldでは、どちらか一方がタスクの3分の1で、一方、それらの組み合わせは95%以上である。
この方法はまた、拡張思考よりも数倍少ない生成トークンを使用し、直接的な相互作用よりもはるかに少ないモデル可視画像を使用する。
関連論文リスト
- Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - SYMBOLIZER: Symbolic Model-free Task Planning with VLMs [7.564784873669823]
従来のタスク・アンド・モーション・プランニング(TAMP)システムは、タスク・プランニングの物理モデルとタスク・プランニングの離散的シンボリック・モデルに依存している。
ビジュアル言語モデル(VLM)は、望まれるゼロショットの視覚的理解を示す。
未確認問題に対してよく一般化するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-20T05:32:47Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - Embodied Task Planning via Graph-Informed Action Generation with Large Lanaguage Model [6.302973995986435]
GiGは、Graph-in-Graphアーキテクチャを使ってエージェントのメモリを具体化する新しい計画フレームワークである。
これらのグラフの埋め込みをクラスタ化することにより、このフレームワークは構造を意識した事前の検索を可能にする。
本フレームワークは,Robotouille Synchronous,Robotouille Asynchronous,ALFWorldの3つの具体的計画ベンチマーク上で評価する。
論文 参考訳(メタデータ) (2026-01-29T15:18:58Z) - LTD-Bench: Evaluating Large Language Models by Letting Them Draw [57.237152905238084]
LTD-Benchは、大規模言語モデル(LLM)のブレークスルーベンチマークである。
LLMの評価を抽象的なスコアから直接観察可能な視覚出力に変換する。
LTD-Benchの視覚出力は強力な診断分析を可能にし、モデル類似性を調べるための潜在的アプローチを提供する。
論文 参考訳(メタデータ) (2025-11-04T08:11:23Z) - ATLAS: Actor-Critic Task-Completion with Look-ahead Action Simulation [28.54052846801967]
ATLASは、認知空間におけるこれらの行動の結果をシミュレートすることで、環境のモデルに基づく計画を作成するメモリ拡張エージェントである。
WebArena-Liteベンチマークでは、これまで公表された最先端技術の53.9%の成功率と比較して63%の成功率を達成した。
論文 参考訳(メタデータ) (2025-10-26T16:03:39Z) - Efficient Virtuoso: A Latent Diffusion Transformer Model for Goal-Conditioned Trajectory Planning [0.0]
本稿では,目標条件付き軌道計画のための条件付き潜在拡散モデルであるEfficient Virtuosoを提案する。
提案手法は,Open Motionデータセット上での最先端性能を実現し,平均変位誤差(minADE)が0.25であることを示す。
一つのゴールが戦略的曖昧さを解決できる一方で、人間の運転行動を反映した正確で忠実な戦術実行を実現するためには、よりリッチで多段階のスパース経路が不可欠である。
論文 参考訳(メタデータ) (2025-09-03T19:18:02Z) - PSALM-V: Automating Symbolic Planning in Interactive Visual Environments with Large Language Models [22.688086293676328]
視覚環境における象徴的行動意味論(プレコンディションとポストコンディション)を誘導できる最初の自律型ニューロシンボリック学習システムPSALM-Vを提案する。
PSALM-Vは、専門家のアクション定義なしで信頼できるシンボリックプランニングを行い、LSMを使って計画と候補シンボリックセマンティクスを生成する。
論文 参考訳(メタデータ) (2025-06-25T02:44:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。