論文の概要: WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
- arxiv url: http://arxiv.org/abs/2609.40325v1
- Date: Wed, 30 Sep 2026 17:55:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.324245
- Title: WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
- Title(参考訳): WorldAuditBench:マルチモーダルエージェントによるインタラクティブな3Dワールド監査
- Abstract要約: We introduced WorldAuditBench, a benchmark for 3D world auditing including 213 anomaly tasks across 13 environment built with Unreal Engine 5 and Three.js。
VLAに基づく探索とVLMに基づく異常識別と、視覚的推論が行動選択を直接導くエンドツーエンドのVLMエージェントの2つの監査パラダイムを用いて、固定された調査予算の下で5つのフロンティアモデルを評価する。
- 参考スコア(独自算出の注目度): 30.577405566446235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As interactive 3D worlds are increasingly used to study intelligent behavior, it becomes important to develop efficient pipelines for identifying anomalies in these simulated environments, such as floating objects, traversable walls, or objects inconsistent with the surrounding scene. Multimodal AI systems, including vision-language models (VLMs) and vision-language-action models (VLAs), have shown potential for automating this task. However, 3D world auditing is complex, requiring the close coupling of two distinct capabilities: action, to navigate the 3D world and search for anomalies systematically and efficiently; and visual reasoning, to understand the environment and identify anomalies from multimodal observations. It remains largely unexplored whether multimodal agents can effectively couple these two capabilities, using visual reasoning to identify potential anomalies while taking actions to validate them. In this paper, we introduce WorldAuditBench, a benchmark for 3D world auditing comprising 213 anomaly tasks across 13 environments built with Unreal Engine 5 and Three.js, spanning five anomaly families. We evaluate five frontier models under a fixed exploration budget using two auditing paradigms: VLA-based exploration followed by VLM-based anomaly identification, and an end-to-end VLM agent in which visual reasoning directly guides action selection. Across the evaluated models and two paradigms, success rates range from 6.6% to 42.3%, substantially below human performance (83.4%). Through the task of world auditing, WorldAuditBench provides a testbed for studying how multimodal agents couple action and visual reasoning in interactive 3D environments, while highlighting current limitations in their ability to gather and interpret evidence during exploration.
- Abstract(参考訳): インタラクティブな3D世界が知的行動の研究にますます使われるようになるにつれて、浮遊物や移動可能な壁、周囲のシーンと矛盾しない物体など、これらの模擬環境における異常を識別するための効率的なパイプラインを開発することが重要になる。
視覚言語モデル(VLM)や視覚言語アクションモデル(VLA)を含むマルチモーダルAIシステムは、このタスクを自動化する可能性を示している。
しかし、3Dワールド監査は複雑であり、行動、3Dワールドをナビゲートし、系統的かつ効率的に異常を探索する行動、そして視覚的推論、環境を理解し、マルチモーダルな観察から異常を識別する2つの異なる能力の密結合を必要とする。
マルチモーダルエージェントがこれらの2つの機能を効果的に組み合わせられるかどうか、視覚的推論を用いて潜在的な異常を識別し、それらを検証しているかどうかについては、まだ明らかになっていない。
本稿では,Unreal Engine 5とThree.jsで構築された13環境にわたる213の異常タスクを含む3次元世界監査のベンチマークであるWorldAuditBenchを紹介する。
VLAに基づく探索とVLMに基づく異常識別と、視覚的推論が行動選択を直接導くエンドツーエンドのVLMエージェントの2つの監査パラダイムを用いて、固定された調査予算の下で5つのフロンティアモデルを評価する。
評価されたモデルと2つのパラダイムの中で、成功率は6.6%から42.3%であり、人間のパフォーマンス(83.4%)を大きく下回っている。
WorldAuditBenchは、世界監査のタスクを通じて、インタラクティブな3D環境でマルチモーダルエージェントがどのように行動と視覚的推論を結合するかを研究するためのテストベッドを提供している。
関連論文リスト
- Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence? [35.30497528897595]
Agentic-MMEはマルチモーダルエージェント能力のプロセス検証ベンチマークである。
6つのドメインにまたがる418の現実世界タスクと3つの困難レベルを含んでいる。
2,000以上のステップワイズなチェックポイントがあり、1タスクあたり平均10時間以上の手動アノテーションがある。
論文 参考訳(メタデータ) (2026-04-03T13:02:01Z) - ShortcutBreaker: Low-Rank Noisy Bottleneck with Global Perturbation Attention for Multi-Class Unsupervised Anomaly Detection [59.89803740308262]
ShortcutBreakerはMUADタスクのための新しい統合された機能再構成フレームワークである。
ショートカットの問題に対処する2つの重要なイノベーションが特徴だ。
提案手法は,4つのデータセットに対して,99.8%,98.9%,90.6%,87.8%の顕著な画像レベルのAUROCを実現する。
論文 参考訳(メタデータ) (2025-10-21T06:51:30Z) - VOGUE: Guiding Exploration with Visual Uncertainty Improves Multimodal Reasoning [62.09195763860549]
検証可能な報酬(RLVR)による強化学習は、大きな言語モデル(LLM)の推論を改善するが、探索に苦労する。
出力(テキスト)から入力(視覚)空間へ探索をシフトする新しい手法である$textbfVOGUE(Visual Uncertainty Guided Exploration)を紹介した。
本研究は,視覚入力の本質的不確実性における基盤探索が,マルチモーダル推論を改善するための効果的な戦略であることを示す。
論文 参考訳(メタデータ) (2025-10-01T20:32:08Z) - EmbRACE-3K: Embodied Reasoning and Action in Complex Environments [48.32142591866083]
EmRACE-3KはUnreal EngineとUnrealCV-Zooフレームワークを使って構築された3000以上の言語誘導タスクのデータセットである。
探索,動的空間意味推論,多段階ゴール実行の3つの重要な次元にわたって,VLMの具体的推論能力を評価するためのベンチマークを構築した。
ゼロショット設定では、すべてのモデルが20%未満の成功率を達成した。
論文 参考訳(メタデータ) (2025-07-14T17:59:46Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - LM-MCVT: A Lightweight Multi-modal Multi-view Convolutional-Vision Transformer Approach for 3D Object Recognition [5.317624228510749]
ロボットアプリケーションにおける3次元物体認識を強化するために,軽量マルチモーダル・マルチビュー・コンボリューショナル・ビジョン・トランスフォーマネットワーク(LM-MCVT)を提案する。
提案手法を合成モデルNet40データセット上で評価し,95.6%の認識精度を実現する。
その結果,合成および実世界の3Dデータ間での3Dオブジェクト認識における手法の堅牢性を示す。
論文 参考訳(メタデータ) (2025-04-27T14:30:16Z) - Real-IAD D3: A Real-World 2D/Pseudo-3D/3D Dataset for Industrial Anomaly Detection [53.2590751089607]
Real-IAD D3は高精度なマルチモーダルデータセットであり、フォトメトリックステレオによって生成された擬似3Dモダリティが組み込まれている。
本稿では,RGB,点雲,擬似3次元深度情報を統合し,各モードの相補的強度を活用する効果的な手法を提案する。
本実験は,検出の堅牢性向上とIAD全体の性能向上におけるこれらのモダリティの重要性を強調した。
論文 参考訳(メタデータ) (2025-04-19T08:05:47Z) - Towards Unified 3D Object Detection via Algorithm and Data Unification [70.27631528933482]
我々は、最初の統一型マルチモーダル3Dオブジェクト検出ベンチマークMM-Omni3Dを構築し、上記のモノクロ検出器をマルチモーダルバージョンに拡張する。
設計した単分子・多モード検出器をそれぞれUniMODEとMM-UniMODEと命名した。
論文 参考訳(メタデータ) (2024-02-28T18:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。