論文の概要: PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments
- arxiv url: http://arxiv.org/abs/2605.11534v1
- Date: Tue, 12 May 2026 04:59:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.593601
- Title: PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments
- Title(参考訳): PRISM: : 模擬身体環境におけるインテントの計画と推論
- Abstract要約: 5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
- 参考スコア(独自算出の注目度): 59.07829883257003
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When an LLM-based embodied agent fails at a household task, the culprit could be misidentified objects, forgotten sub-goals, or poor action sequencing -- yet existing benchmarks report only a single success rate, making it impossible to tell which cognitive module is responsible. We present PRISM, a diagnostic benchmark that reframes this problem: rather than asking only \textit{did the agent succeed?}, PRISM asks \textit{which capability is most likely responsible for failure?} Built on five photorealistic multi-room apartments (4--8 rooms each), PRISM structures 300 human-verified tasks into three capability tiers -- \textit{Basic Ability}, \textit{Reasoning Ability}, and \textit{Long-horizon Ability} -- that isolate perception-to-action grounding, implicit intent resolution, and sustained multi-step coordination respectively. PRISM exposes an agent-agnostic executable action API that allows arbitrary agents: LLM agents, VLM agents, symbolic planners, RL policies, and hybrid systems, to be evaluated end-to-end under the same benchmark protocol. To support deeper diagnosis, optional probes for perception, memory, and planning can be adopted, replaced, or bypassed entirely, enabling controlled component-level analysis when desired. Experiments on seven contemporary LLMs establish a clear hierarchy: explicit spatial grounding is not the dominant failure source under oracle perception, implicit intent resolution is a significant bottleneck for all model families, and long-horizon coordination exposes a stark capability cliff -- lightweight models collapse to as low as 20.0\% success while simultaneously consuming more tokens than their frontier counterparts, a signature of compensatory over-reasoning rather than genuine planning capability. Project page: \href{https://sj-li.com/PROJ/PRISM}{link}.
- Abstract(参考訳): LLMベースのエンボディエージェントが家庭のタスクで失敗した場合、犯人は誤って特定されたオブジェクト、忘れられたサブゴール、あるいはアクションシークエンシングが不足している可能性がある。
PRISMは、この問題を再設計する診断ベンチマークである。
PRISM は \textit{ which capabilities is likely responsible to failure?
フォトリアリスティックな5つの集合住宅(それぞれ4~8室)上に構築され、PRISM構造体300個の人間検証されたタスクを3つの能力レベル - \textit{Basic Ability}, \textit{Reasoning Ability}, \textit{Long-Horizon Ability} - に分割し、それぞれ認識から行動への接地、暗黙の意図解決、持続的な多段階調整を行う。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開しており、任意のエージェント(LLMエージェント、VLMエージェント、シンボリックプランナー、RLポリシー、ハイブリッドシステム)を同じベンチマークプロトコルでエンドツーエンドに評価することができる。
より深い診断を支援するために、知覚、記憶、計画のためのオプションプローブを採用、置き換え、あるいは完全にバイパスすることができ、必要に応じて制御されたコンポーネントレベルの分析を可能にする。
7つの現代のLCMの実験は明確な階層を確立している: 明示的な空間的接地は、オラクルの知覚の下では主要な失敗源ではない 暗黙の意図の解決は、すべてのモデルファミリーにとって重要なボトルネックであり、長い水平方向の調整は、スターク能力の崖を露呈する -- 軽量モデルが20.0\%の成功まで崩壊すると同時に、フロンティアよりも多くのトークンを消費すると同時に、真の計画能力よりも補償過剰な推論のサインである。
プロジェクトページ: \href{https://sj-li.com/PROJ/PRISM}{link}。
関連論文リスト
- DCFA: Dual-view Causal-inspired Attribution for Failure Reasoning in LLM-based Multi-agent Systems [61.11435469308521]
大規模言語モデルシステムにおける障害帰属のためのトレーニング不要フレームワークDCFAを提案する。
DCFAは、システムトレースから構造化因果インスパイアされた依存性グラフを構築するグローバルモジュールを統合する。
実験の結果、DCFAは最先端のベースラインよりもステップレベルの精度を最大8.27%向上することが示された。
論文 参考訳(メタデータ) (2026-09-04T05:29:31Z) - Collective Counterfactual Planning: Coordination, Consent, and Verification under Representational Constraints [0.0]
グループは、1人のメンバーが単独で計画、実行、検証できないプロジェクトを定期的に完了します。
本稿では,この現象の形式的モデルであるCCP(Collective Counterfactual Planning)を提案する。
リレー閉包の正確な表現の下で, 4段階の全面的水平境界可解性スキームが健全で完備である。
論文 参考訳(メタデータ) (2026-08-18T15:52:12Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - Width, Memory, and Delay: A Resource Accounting for the Limits of Flat Multi-Agent Systems [27.425096016504174]
最近のプレプリントでは、平らで均質なマルチエージェントシステムは、達成不可能なエラーに対して、人口非依存の因果的フロア'に直面すると論じられている。
この結論は強すぎることを示し、3つのリソース上に構築された定量的リソースモデルに置き換える。
障害スペクトルのオラクル知識をオンライン学習に置き換える価格を定量化する。
論文 参考訳(メタデータ) (2026-07-14T20:35:17Z) - Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment [0.0]
安全な操作を共同で構成する3つの次元:意味的意図とポリシーの遵守、環境の妥当性、動的実現可能性。
コミュニティは、各安全次元が独立して認定されたレイヤによって強制される、コントラクトベースのアーキテクチャで対応する必要があります。
このようなアーキテクチャをスケッチし、確率の連鎖則によって認められる構成系レベルの安全性境界を導出する。
論文 参考訳(メタデータ) (2026-05-18T17:13:41Z) - A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation [59.98516959731531]
抽象推論能力は、抽象ルールを抽出し適用するためのLLMの知性と能力を反映する。
既存のベンチマークは、高価な手作業のアノテーション、そのスケールの制限、あるいは真の推論ではなく暗記のリスク測定に頼っている。
我々はA2RBenchという名の自動パイプラインを導入し、生成、拡張、評価、分析を行う。
論文 参考訳(メタデータ) (2026-05-17T06:14:20Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems [38.44649280816596]
マルチエージェントシステムの障害注入と信頼性評価のための体系的フレームワークMAS-FIREを提案する。
エージェント内認知障害とエージェント間協調障害を対象とする15種類の障害分類を定義した。
MAS-FIREを3つの代表的なMASアーキテクチャに適用することにより、フォールトトレラントな動作の豊富なセットを明らかにする。
論文 参考訳(メタデータ) (2026-02-23T13:47:43Z) - FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight [21.731032636844237]
本稿では,双方向のフォーマル・オブ・サートアーキテクチャを用いたニューロシンボリック・フレームワークを提案する。
行動安全,マルチドメイン制約順守,エージェントによる上向き偽装検出の3つのベンチマークにまたがって検証を行った。
論文 参考訳(メタデータ) (2026-02-11T18:48:11Z) - Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs [26.288357188171265]
MAMA(Multi-Agent Memory Attack)は、ネットワーク構造がどのように漏洩を形作るかを測定するフレームワークである。
我々は,攻撃剤出力から回収した地絡PIIの割合として漏洩を定量化する。
結果は、アーキテクチャ上の選択から測定可能なプライバシリスクへの最初の体系的なマッピングを提供する。
論文 参考訳(メタデータ) (2025-12-04T11:00:49Z) - Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts [75.20929587906228]
LLM(Large Language Model)を利用したマルチエージェントシステム(MAS)は、複雑なタスクにおける協調推論、ツールの使用、役割特化調整を急速に進めている。
しかし、信頼性クリティカルなデプロイメントは、体系的な障害モード、すなわち命令の競合による階層的コンプライアンスによって妨げられている。
論文 参考訳(メタデータ) (2025-09-27T08:43:34Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。