論文の概要: MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents
- arxiv url: http://arxiv.org/abs/2608.07533v1
- Date: Sun, 26 Jul 2026 14:07:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.552148
- Title: MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents
- Title(参考訳): MetaSpace: 身体的エージェントにおける空間認知のためのメタモルフィックテスト
- Abstract要約: MetaSpaceは、エンボディエージェントの空間認知を評価するために設計された新しいフレームワークである。
そこで,MetaSpaceは最先端MLLMエージェントの空間認識誤りを90,422個検出することに成功した。
その結果、全てのSOTAエージェントは平均スコアが0.44から0.52であり、人間ベンチマークの0.96よりもかなり低いことが示唆された。
- 参考スコア(独自算出の注目度): 7.0922719251235655
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An embodied agent is an intelligent entity that interacts with its environment through a physical body. Currently, the evaluation of embodied agents primarily relies on two paradigms: (1) manually annotated Visual Question Answering (VQA) pairs and (2) high-level task completion metrics, such as success in navigation or manipulation. The former is labor-intensive and subject to variability in annotation quality. The latter may obscure critical vulnerabilities, allowing agents to complete tasks through suboptimal means or safety violations, thereby concealing safety risks and inefficiencies. Given that spatial cognition is the cornerstone for executing embodied tasks, there is a pressing need to assess whether embodied agents possess robust spatial cognition during task execution. Inspired by metamorphic testing principles in software engineering, we propose MetaSpace, a novel framework designed to evaluate the spatial cognition of agents. By leveraging spatiotemporal multimodal states derived from real execution trajectories, MetaSpace automatically generates test cases based on predefined metamorphic relations (MRs) grounded in logical rules and physical laws. Crucially, we encode these MRs as executable rules in a logic programming language (Prolog). Violations of these relations indicate failures in spatial cognition. Our empirical evaluation across three embodied scenarios demonstrates that MetaSpace successfully detects 90,422 spatial cognition errors in state-of-the-art (SOTA) MLLM-driven agents. We introduce the Spatial Cognition (SC) score to quantify performance. Results indicate that all SOTA agents achieve average scores between 0.44 and 0.52, significantly lower than the human benchmark of 0.96.
- Abstract(参考訳): エンボディード・エージェント(英: embodied agent)は、身体を介して環境と相互作用する知的な実体である。
現在,具体的エージェントの評価は,(1)手動による視覚質問応答(VQA)ペアと(2)ナビゲーションや操作の成功などのハイレベルなタスク完了指標の2つのパラダイムに大きく依存している。
前者は労働集約的であり、アノテーションの品質の変動を受けやすい。
後者は致命的な脆弱性を曖昧にし、エージェントは準最適手段や安全違反を通じてタスクを完了し、それによって安全性のリスクや非効率性を隠蔽することができる。
具体的タスクの実行には,空間認知が基礎となることを考えると,具体的エージェントがタスク実行中に堅牢な空間認知を持つかどうかを評価する必要がある。
ソフトウェア工学におけるメタモルフィックテストの原則に触発されて,エージェントの空間認知を評価するための新しいフレームワークであるMetaSpaceを提案する。
実実行軌道から引き起こされた時空間多モード状態を利用することで、MetaSpaceは論理規則と物理法則に基づいて予め定義されたメタモルフィック関係(MR)に基づいてテストケースを自動的に生成する。
重要なことに、我々はこれらのMRを論理型プログラミング言語(Prolog)の実行可能なルールとしてエンコードする。
これらの関係の違反は、空間認知の失敗を示す。
3つの具体的シナリオにまたがる実験的な評価により,MetaSpaceは最先端(SOTA)MLLM駆動エージェントにおいて,90,422個の空間認識誤りを検出することができた。
性能を定量化するために,空間認知(SC)スコアを導入する。
その結果、全てのSOTAエージェントは平均スコアが0.44から0.52であり、人間ベンチマークの0.96よりもかなり低いことが示唆された。
関連論文リスト
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - Beyond Binary Success: A Diagnostic Meta-Evaluation Framework for Fine-Grained Manipulation [98.79811866787263]
診断メタ評価フレームワークであるMetaFineを紹介する。
局所的な空間構造を保存できる視覚エンコーダの能力は,きめ細かな精度の鍵となるボトルネックである。
評価をランキングから診断にシフトすることで、MetaFineは、ベンチマークを実際の物理デキスタリティに基づく階層化された能力の修復のための実行可能なコンパスに変換する。
論文 参考訳(メタデータ) (2026-05-19T15:25:13Z) - Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks [16.03812136589077]
アンカー型空間分解鎖(CoT)について紹介する。
CoTはMLLMを「幾何学的から意味論的」な投影を通して誘導し、まずはBの局所座標系を確立し、次にAがBの視覚フラストラムに該当するかどうかに基づいて、動的に視覚的および聴覚的モダリティを重み付けする。
論文 参考訳(メタデータ) (2026-05-18T10:32:56Z) - SAGE: A Service Agent Graph-guided Evaluation Benchmark [27.342044311161654]
本稿では,SAGE(Service Agent Graph-Guided Evaluation)を提案する。
SAGEは構造化されていないSOPを動的ダイアロググラフに形式化し、論理的コンプライアンスの正確な検証を可能にする。
また、モデルが論理的失敗にもかかわらず丁寧な会話ファサードを維持する現象である「共感回復」も観察する。
論文 参考訳(メタデータ) (2026-04-10T12:55:23Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild [30.138230316314534]
本稿では,一方向の指示から双方向の意図のアライメントへ評価をシフトするために,指示明細の分類を取り入れた最初のベンチマークであるAmbiBenchを紹介する。
厳密なレビュープロトコルの下で,25のアプリケーションにまたがる240の生態学的に有効なタスクの厳密なデータセットを構築した。
また,MLLM-as-a-judgeマルチエージェントアーキテクチャを利用した自動フレームワークであるMUSEを開発した。
論文 参考訳(メタデータ) (2026-02-12T09:25:15Z) - OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows [9.617220633655716]
textbfunderlineOmni-textbfunderlineModality textbfunderlineGeneration Agent (textbfOMG-Agent)について述べる。
論文 参考訳(メタデータ) (2026-02-04T02:25:40Z) - What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding [50.35012849818872]
大規模言語モデル(LLM)エージェントは、複雑な意思決定やツール使用タスクにおいて顕著な能力を示した。
本研究では,タスク実行と世界状態理解の分離を目的とした決定論的かつ自動評価パラダイムであるTask-to-Quiz(T2Q)を提案する。
実験の結果,タスク成功は環境理解の指標として不十分な場合が多く,現在の記憶機構はエージェントが環境の基底モデルを取得するのに有効ではないことが明らかとなった。
論文 参考訳(メタデータ) (2026-01-14T14:09:11Z) - Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection [108.5042835056188]
この作業では,2つの基本的な問題に対処するため,Agent4FaceForgeryを導入している。
人間の偽造の多様な意図と反復的なプロセスを捉える方法。
ソーシャルメディアの偽造に付随する複雑な、しばしば敵対的な、テキストと画像のインタラクションをモデル化する方法。
論文 参考訳(メタデータ) (2025-09-16T01:05:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。