論文の概要: 3DHarnessBench: Probing Agentic 3D-to-Code Capabilities of Frontier Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.06535v1
- Date: Sun, 06 Sep 2026 10:59:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 05:22:40.097838
- Title: 3DHarnessBench: Probing Agentic 3D-to-Code Capabilities of Frontier Vision-Language Models
- Title(参考訳): 3DHarnessBench:フロンティアビジョンランゲージモデルのエージェント3Dコード機能の提案
- Abstract要約: 3DHarnessBenchは、Blender Pythonコードとして3D幾何学を復元する視覚補正モデルのエージェント能力を評価するベンチマークである。
我々は,よりリッチな関数呼び出しアクセスによって,フロンティアモデルの3次元形状復元能力が大幅に向上することが観察された。
再現可能な3D評価のためのベンチマーク、コード、アウトプット、エージェントトラジェクトリをリリースする。
- 参考スコア(独自算出の注目度): 35.365323691170616
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce 3DHarnessBench, a benchmark that evaluates the agentic ability of frontier vision-language models (VLMs) to recover 3D geometry as Blender Python code from a variety of inputs. Unlike previous frameworks that prompt the VLMs with a fixed input (e.g., a single rendering or a text description), 3DHarnessBench evaluates four separate harness settings that progressively enable active agentic exploration, facilitated by recent Blender MCP functionality. Our hierarchy from Single-view, Multi-view, Active Visual (arbitrary viewpoint access), and Full 3D Interaction (complete access to the target object through Blender function calls) probes the models' abilities in both visual perception and active inference, tool calling, and self-correction. We observe that the ability of all frontier models to recover 3D geometry improves significantly with richer function call access, although the improvements are strongly model-dependent, revealing highly uneven agentic 3D-to-code capabilities. We will release the benchmark, code, outputs, and agent trajectories for reproducible 3D evaluation.
- Abstract(参考訳): 本稿では,フロンティア視覚言語モデル(VLM)のエージェント能力を評価するベンチマークである3DHarnessBenchを紹介する。
3DHarnessBenchは、固定された入力(例えば、単一のレンダリングやテキスト記述)でVLMをプロンプトする以前のフレームワークとは異なり、最近のBlender MCP機能によって徐々にアクティブなエージェント探索を可能にする4つの別々のハーネス設定を評価している。
単一ビュー、多視点、アクティブビジュアル(任意視点アクセス)、フル3Dインタラクション(ブレンダー関数呼び出しによる対象オブジェクトへの完全なアクセス)からの階層は、視覚的知覚とアクティブ推論、ツール呼び出し、自己補正の両方においてモデルの能力を調査します。
よりリッチな関数呼び出しアクセスでは,全てのフロンティアモデルによる3次元幾何の復元能力が大幅に向上するが,その改善はモデル依存性が高く,エージェント間通信能力は極めて不均一である。
再現可能な3D評価のためのベンチマーク、コード、アウトプット、エージェントトラジェクトリをリリースする。
関連論文リスト
- Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs [62.865932175477035]
計量3Dオブジェクト検出は、エンボディエージェントのコア機能であるが、最も信頼性の高いシステムは深度センサーに頼っている。
提案するMap-Det3Dは,RGBから再構成した3次元空間に直接検出を行うオンラインマルチビュー3Dオブジェクト検出モデルである。
論文 参考訳(メタデータ) (2026-08-12T15:33:42Z) - 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code [25.904997126319547]
3DCodeBenchは、3Dモデリングソフトウェアにおいて、手続き型3D生成のための視覚言語モデル(VLM)エージェントを評価するための体系的なベンチマークである。
3DCodeArenaは、生成された3D出力に対して、ペアワイズな人間の好みに基づくランキングプラットフォームです。
論文 参考訳(メタデータ) (2026-05-31T06:59:49Z) - AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models [0.0]
3Dビジュアルグラウンド(3DVG)は、AIを具現化する上で不可欠な機能であり、自然言語の記述に基づいて、エージェントがオブジェクトを3Dシーンにローカライズする必要がある。
タスク固有の3Dトレーニングを必要とせずに,色のついた点クラウド上で直接動作する,ゼロショットの3Dビジュアルグラウンドティングフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T14:29:04Z) - Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - Particulate: Feed-Forward 3D Object Articulation [89.78788418174946]
Particulateは、毎日のオブジェクトの1つの静的3Dメッシュが与えられたフィードフォワードアプローチであり、基盤となる関節構造のすべての属性を直接推論する。
私たちは、公開データセットから多種多様な3Dアセットの集合に基づいて、ネットワークのエンドツーエンドをトレーニングします。
推論中、Particulateはネットワークのフィードフォワード予測を入力メッシュに持ち上げ、完全に調音された3Dモデルを数秒で生成する。
論文 参考訳(メタデータ) (2025-12-12T18:59:51Z) - Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis [38.10984626023432]
本稿では, 微調整を必要とせず, 濃密な視覚的特徴の質を直接的に調査する, コンテキスト内3Dシーン理解のための新しいベンチマークを提案する。
我々は8つの最先端基盤モデルをベンチマークし、DINOベースのエンコーダが大きな視点シフトで競争力を維持することを示す。
論文 参考訳(メタデータ) (2025-12-12T14:03:16Z) - LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight [105.9472902251177]
次世代の予測問題として3D検出を行うVLMネイティブレシピを提案する。
このモデルでは, 49.89 AP_3Dの精度を+15.51倍に向上した。
論文 参考訳(メタデータ) (2025-11-25T18:59:45Z) - EA3D: Online Open-World 3D Object Extraction from Streaming Videos [55.48835711373918]
オープンワールド3Dオブジェクト抽出のための統合オンラインフレームワークであるExtractAnything3D(EA3D)を提案する。
ストリーミングビデオが与えられると、EA3Dは視覚言語と2D視覚基盤エンコーダを使用して各フレームを動的に解釈し、オブジェクトレベルの知識を抽出する。
リカレントな共同最適化モジュールは、モデルの関心領域への注意を向け、幾何学的再構成と意味的理解の両面を同時に強化する。
論文 参考訳(メタデータ) (2025-10-29T03:56:41Z) - 3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection [62.57179069154312]
最初のエンドツーエンド3Dモノクロオープンセットオブジェクト検出器(3D-MOOD)を紹介する。
私たちはオープンセットの2D検出を設計した3Dバウンディングボックスヘッドを通して3D空間に持ち上げます。
対象クエリを事前に幾何学的に条件付けし,様々な場面で3次元推定の一般化を克服する。
論文 参考訳(メタデータ) (2025-07-31T13:56:41Z) - TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP [52.79100775328595]
3Dビジュアルグラウンドティングは、人間の指示に基づいて現実世界の3D環境における視覚情報を理解するための具体的エージェントである。
既存の3Dビジュアルグラウンド法は、異なるモダリティの異なるエンコーダに依存している。
本稿では,3つのモードすべてを処理するために,統合された2次元事前学習型マルチモーダルネットワークを提案する。
論文 参考訳(メタデータ) (2025-07-20T10:28:06Z) - Regulating Intermediate 3D Features for Vision-Centric Autonomous
Driving [26.03800936700545]
本稿では,ボリュームレンダリングの助けを借りて,中間的な高密度な3次元特徴を規制することを提案する。
Occ3DデータセットとnuScenesデータセットの実験結果から、ヴァンパイアは密度の高い3D特徴の微細で適切な抽出を容易にすることが示された。
論文 参考訳(メタデータ) (2023-12-19T04:09:05Z) - PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm [111.16358607889609]
本稿では,効率的な3D表現の獲得を容易にするために,新しいユニバーサル3D事前学習フレームワークを提案する。
PonderV2は、11の室内および屋外ベンチマークで最先端のパフォーマンスを達成したことで、その効果が示唆された。
論文 参考訳(メタデータ) (2023-10-12T17:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。