論文の概要: SceneActBench: Can Agents Act on the 3D Scenes They See?
- arxiv url: http://arxiv.org/abs/2607.22393v1
- Date: Fri, 24 Jul 2026 15:16:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.164073
- Title: SceneActBench: Can Agents Act on the 3D Scenes They See?
- Title(参考訳): SceneActBench: エージェントは、彼らが見ている3Dシーンに作用できるのか?
- Abstract要約: SceneActBenchは、統一されたエージェント環境ループの下で5つの3Dタスクにまたがる視覚的条件付きアクションのベンチマークである。
タスク固有の幾何測定値を用いて、各最終的な結果が隠れた真実に対して評価される。
- 参考スコア(独自算出の注目度): 40.002502466292015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language model (VLM) agents increasingly use tools to act on 3D scenes rather than only describe them. Existing 3D benchmarks score textual responses or single-object operations, leaving agent action on complete multi-object 3D scenes under evaluated. We present SceneActBench, a benchmark for visually conditioned action across five 3D tasks under a unified agent-environment loop. Given PNG images or sampled video frames and, where applicable, supplied 3D assets, an agent acts on a 3D environment. We evaluate each final output against hidden ground truth with task-specific geometric metrics. SceneActBench comprises five tasks built from 210 source instances, yielding 520 task cases including paired input conditions. Every task runs through one fixed agent loop to keep the comparison fair. Across eleven proprietary VLM configurations, Overall scores span 38.6-50.2, and none performs consistently well across tasks. We further analyse where and how failures manifest.
- Abstract(参考訳): 視覚言語モデル(VLM)エージェントは、それらを記述するだけでなく、ツールを使用して3Dシーンに作用するようになっている。
既存の3Dベンチマークでは、テキスト応答や単一オブジェクト操作をスコアし、完全なマルチオブジェクト3Dシーンに対するエージェントアクションを評価下に置きます。
SceneActBenchは、エージェント環境を統一したループ下で5つの3次元タスクにまたがる視覚的条件付きアクションのベンチマークである。
PNG画像やビデオフレームのサンプルが与えられ、3Dアセットが提供された場合、エージェントは3D環境に作用する。
タスク固有の幾何測定値を用いて、各最終的な結果が隠れた真実に対して評価される。
SceneActBenchは210のソースインスタンスから構築された5つのタスクで構成され、ペア入力条件を含む520のタスクケースを生成する。
すべてのタスクは、比較を公平に保つために、1つの固定されたエージェントループを通過します。
11のプロプライエタリなVLM構成で、総合スコアは38.6-50.2で、タスク間で一貫してパフォーマンスが良くない。
さらに、どこで、どのように失敗が現れるかを分析します。
関連論文リスト
- Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration [22.08745522207589]
現在の3Dエージェントは、曖昧さをノイズとして扱い、単一ターンの仮定で盲目的実行をデフォルトとする。
CLAREは,意図的非対称性を実行エラーではなく,戦略的対話の機会として扱う,明確で進化的な3Dエージェントである。
論文 参考訳(メタデータ) (2026-07-17T07:10:46Z) - AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models [0.0]
3Dビジュアルグラウンド(3DVG)は、AIを具現化する上で不可欠な機能であり、自然言語の記述に基づいて、エージェントがオブジェクトを3Dシーンにローカライズする必要がある。
タスク固有の3Dトレーニングを必要とせずに,色のついた点クラウド上で直接動作する,ゼロショットの3Dビジュアルグラウンドティングフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T14:29:04Z) - Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement [66.13644883379087]
MLLMを用いた3次元オブジェクト配置における3つの課題に対処する。
まず、MLLMの弱い視覚的基盤に対処するために、MPPベースのAPIを導入する。
第2に、MLLMの3Dシーン理解を、特殊な視覚ツール群で強化する。
第3に,反復的かつエラーを起こしやすい更新を管理するために,協調的なマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T19:22:39Z) - Unified Semantic Transformer for 3D Scene Understanding [55.415468022487005]
我々は、単一のモデル内に多様な3Dセマンティックタスクを統一する新しいフィードフォワードニューラルネットワークUNITEを紹介する。
我々のモデルは、完全なエンドツーエンドで見えないシーンで動作し、完全な3Dセマンティックジオメトリを推測するのにほんの数秒しかかからない。
UNITEはいくつかの異なる意味的タスクにおいて最先端のパフォーマンスを達成し、タスク固有のモデルよりも優れていることを実証する。
論文 参考訳(メタデータ) (2025-12-16T12:49:35Z) - 3D Part Segmentation via Geometric Aggregation of 2D Visual Features [57.20161517451834]
監督された3D部分分割モデルは、固定されたオブジェクトと部品のセットに合わせて調整されており、それらの転送可能性は、オープンセットの現実世界のシナリオに制限される。
近年、視覚言語モデル(VLM)を多視点レンダリングとテキストプロンプトを用いてオブジェクト部品の識別に活用する研究が進められている。
これらの制約に対処するために,視覚概念から抽出した意味論と3次元幾何学をブレンドし,対象部品を効果的に同定するCOPSを提案する。
論文 参考訳(メタデータ) (2024-12-05T15:27:58Z) - A Unified Framework for 3D Scene Understanding [50.6762892022386]
UniSeg3Dは統合された3Dシーン理解フレームワークである。
単一のモデル内で、パノプティクス、セマンティック、インスタンス、インタラクティブ、参照、オープンボキャブラリセグメンテーションタスクを達成する。
論文 参考訳(メタデータ) (2024-07-03T16:50:07Z) - Unifying 3D Vision-Language Understanding via Promptable Queries [39.55438547712157]
3次元視覚言語(3D-VL)理解のための統一モデル。
PQ3DはPromptable Queriesを使用して、幅広い3D-VLタスクに取り組むことができる。
10の多様な3D-VLデータセットでテストされたPQ3Dは、これらのタスクにおける印象的なパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-05-19T04:35:05Z) - Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers [65.51132104404051]
オブジェクトレベルのシーンと対話するために、オブジェクト識別子とオブジェクト中心表現を導入する。
我々のモデルは、ScanRefer、Multi3DRefer、Scan2Cap、ScanQA、SQA3Dなど、既存のベンチマーク手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2023-12-13T14:27:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。