論文の概要: AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents
- arxiv url: http://arxiv.org/abs/2609.40353v1
- Date: Wed, 30 Sep 2026 17:59:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.350921
- Title: AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents
- Title(参考訳): AssemblyWorld: 汎用エージェントによる3Dアセンブリ再考
- Abstract要約: エージェントがレンダリングされたビューを検査し、供給された剛性部品を操作できるインタラクティブな3D環境であるAmblyWorldを紹介する。
組立WorldBenchを構築し,100の組立タスクを家具,産業組立,破壊組立にまたがる80のオブジェクトにまたがって構成する。
- 参考スコア(独自算出の注目度): 58.42520609012556
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The task of 3D assembly requires translating an understanding of parts and their relationships into precise spatial arrangements. Can pretrained general-purpose agents assemble objects through visual interaction without additional assembly-specific fine-tuning? To investigate this question, we introduce AssemblyWorld, an interactive 3D environment in which agents inspect rendered views and manipulate supplied rigid parts, guided by images or assembly manuals when available. Agents perceive part geometry through 2D views rather than direct access to mesh vertices or faces, while their resulting assemblies are evaluated geometrically. Building on this environment, we construct AssemblyWorldBench, comprising 100 assembly tasks across 80 objects spanning furniture, industrial assembly, and fracture reassembly. Evaluating eight agent systems reveals substantial differences in their capabilities. The strongest system achieves 80.9% part accuracy but 59.4% complete-assembly success. The evaluated open-source systems lag substantially behind their stronger closed-source peers in both execution reliability and assembly accuracy. Analyses of visual references, interaction trajectories, and failures show how agents revise assemblies while leaving residual positioning errors. AssemblyWorld provides a common setting for both assessing the capabilities of interactive assembly agents and characterizing the gap between approximate structure recovery and precise reconstruction.
- Abstract(参考訳): 3Dアセンブリの課題は、部品とその関係を正確に空間的配置に変換することである。
事前訓練された汎用エージェントは、追加のアセンブリ固有の微調整なしで視覚相互作用を介してオブジェクトを組み立てることができるか?
そこで本研究では,画像や組立マニュアルを参考に,エージェントがレンダリングされたビューを検査し,供給された剛性部品を操作できるインタラクティブな3D環境であるアセンブリWorldを紹介する。
エージェントはメッシュ頂点や顔に直接アクセスするのではなく、2次元ビューを通して幾何学を知覚し、その結果のアセンブリは幾何学的に評価される。
この環境上に構築したアセンブリWorldBenchは,家具,産業組立,破壊組立にまたがる80のオブジェクトにまたがる100のアセンブリタスクから構成される。
8つのエージェントシステムを評価することで、その機能に大きな違いが明らかになる。
最強のシステムは80.9%の精度を達成しているが、59.4%の完全組立に成功した。
評価されたオープンソースシステムは、実行の信頼性とアセンブリの精度の両方において、より強力なクローズドソースピアよりも大幅に遅れている。
視覚的参照、相互作用軌跡、障害の分析は、残留位置の誤差を残しながら、エージェントがアセンブリをどのように修正するかを示している。
AssemblyWorldは、インタラクティブなアセンブリエージェントの能力の評価と、近似構造回復と正確な再構築のギャップを特徴付けるために共通の設定を提供する。
関連論文リスト
- WorldAgent: Verification-Guided Agentic Physical World Construction [60.580920548802084]
本稿では,1つの自然言語プロンプトからの検証誘導物理世界構築のためのエージェントフレームワークWorldAgentを提案する。
世界構築層は、プロンプトを構造化された世界仕様に拡張し、物理的な知識を使用してシーンを構築し、数値シミュレーションを実行する。
WorldAgentは、評価されたエージェントベースのメソッドのうち、7つの指標のうち5つでベストスコアを達成している。
論文 参考訳(メタデータ) (2026-09-27T04:46:03Z) - Procedura: Agentic 3D Modeling with Procedural Control [52.232812096564906]
Proceduraは、オブジェクトを手続き的なアセンブリとして記述する、新しい3Dモデリングエージェントフレームワークである。
テキストプロンプトから、エージェントはアセンブリグラフとしてオブジェクトを計画し、プログラム部分を部分的に書きます。
分離された視覚評論家は、一度に診断された修正を精製する。
論文 参考訳(メタデータ) (2026-08-26T17:54:39Z) - OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies [12.751658252598366]
OmniCADは様々な産業システムにまたがる3次元空間推論のための大規模ベンチマークである。
OmniCADには25kの機械組立体があり、1組平均12個の部品と21種類の交尾関係がある。
我々は,正確な,物理的に有効な,スケーラブルな3Dアセンブリ推論の研究を支援するために,ベンチマーク,評価コード,ツールインターフェースをオープンソース化する。
論文 参考訳(メタデータ) (2026-08-23T22:42:28Z) - AssemblyBench: Physics-Aware Assembly of Complex Industrial Objects [36.01972955466693]
既存のデータセットは、単純なシナリオ、形状の複雑さ、産業集会における組み立て軌跡などに焦点を当てている。
本稿では,2,789個の産業用オブジェクトの合成データセットであるアセンブリベンチについて紹介する。
また,各部品の教示マニュアルと3次元形状を用いて,組立順序と組立軌跡を協調的に予測するトランスフォーマーモデルであるアセンブリーディノを提案する。
論文 参考訳(メタデータ) (2026-05-13T00:44:09Z) - Beyond Spatial Compression: Interface-Centric Generative States for Open-World 3D Structure [55.17771962316751]
現在の3Dトークンは、表現を空間圧縮として扱うが、コンポーネントの所有権とアタッチメントの妥当性は暗黙的に残す。
我々は、トークン化がパッシブ圧縮コードではなく操作状態を構成する、インターフェイス中心の生成状態という別の視点を定式化する。
我々は、この定式化を、C2LT-3D(Component-Conditioned Canonical Local Tokens)でインスタンス化し、表現を標準局所幾何学、パーティション条件付きコンテキスト、およびリレーショナルシーム変数に分解する。
論文 参考訳(メタデータ) (2026-05-11T12:09:28Z) - Assembler: Scalable 3D Part Assembly via Anchor Point Diffusion [39.08891847512135]
本稿では,3次元部品組み立てのためのスケーラブルで汎用的なフレームワークであるAssemblerを紹介する。
様々な部分数、ジオメトリ、構造を持つ、多種多様な内部オブジェクトを処理します。
PartNetで最先端のパフォーマンスを実現し、複雑な現実世界のオブジェクトに対して、初めて高品質なアセンブリをデモした。
論文 参考訳(メタデータ) (2025-06-20T15:25:20Z) - IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments [56.85804719947]
IAAOは知的エージェントのための明示的な3Dモデルを構築するフレームワークで,対話を通して環境内の明瞭な物体の理解を得る。
マスク特徴とビュー一貫性ラベルを多視点画像から抽出し,まず3次元ガウススティング(3DGS)を用いて各オブジェクト状態の階層的特徴とラベルフィールドを構築する。
次に、3Dガウスプリミティブ上でオブジェクトと部分レベルのクエリを実行し、静的および明瞭な要素を識別し、大域的な変換と局所的な調音パラメータをアベイランスとともに推定する。
論文 参考訳(メタデータ) (2025-04-09T12:36:48Z) - 3D Part Assembly Generation with Instance Encoded Transformer [22.330218525999857]
本稿では,部品間の幾何的および関係的な推論を伴い,部品の更新を反復的に行う多層トランスフォーマーベースのフレームワークを提案する。
フレームワークをプロセス内部分アセンブリと呼ばれる新しいタスクに拡張します。
提案手法は、パブリックなPartNetデータセット上の複数のメトリクスにおいて、現在の最先端よりも10%以上改善されている。
論文 参考訳(メタデータ) (2022-07-05T02:40:57Z) - Fine-grained activity recognition for assembly videos [31.468641678626696]
本研究は, 組立動作認識の課題に対処するために, きめ細かいアクティビティ認識設定を拡張した。
本研究では,空間集合の特別な構造を活かした観察特徴とともに,観測シーケンスからアセンブリ動作を認識する汎用的な手法を開発した。
論文 参考訳(メタデータ) (2020-12-02T18:38:17Z) - Joint Hand-object 3D Reconstruction from a Single Image with
Cross-branch Feature Fusion [78.98074380040838]
特徴空間において手とオブジェクトを共同で検討し、2つの枝の相互性について検討する。
入力されたRGB画像に推定深度マップを付加するために補助深度推定モジュールを用いる。
提案手法は,オブジェクトの復元精度において既存手法よりも優れていた。
論文 参考訳(メタデータ) (2020-06-28T09:50:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。