論文の概要: PartLLM: A Unified Multimodal Foundation for 3D Part Segmentation
- arxiv url: http://arxiv.org/abs/2609.25832v1
- Date: Tue, 22 Sep 2026 07:58:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.278052
- Title: PartLLM: A Unified Multimodal Foundation for 3D Part Segmentation
- Title(参考訳): PartLLM: 3Dパーツセグメンテーションのための統一されたマルチモーダル財団
- Abstract要約: 部分分割はコンピュータグラフィックスと3Dビジョンの基本的な問題である。
本稿では,3次元部分分割を自己回帰的意味分解として定式化する統一モデルPartLLMを紹介する。
- 参考スコア(独自算出の注目度): 60.659851579884666
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Part segmentation is a fundamental problem in computer graphics and 3D vision. Recent works have expanded 3D part segmentation beyond fixed taxonomies, but existing approaches typically only address a specific setting, such as text-guided part segmentation or point-based interaction. In this work, we argue that these settings can be unified as an intent-conditioned generative problem, where different prompts specify the desired part decomposition. To this end, we introduce PartLLM, a unified multimodal model that formulates 3D part segmentation as autoregressive semantic decomposition. Conditioned on an input shape and a user prompt, PartLLM autoregressively generates semantic part hypotheses as queries for mask prediction and feeds them to a decomposition-aware decoder that jointly predicts coherent part masks. This unified design supports text-guided part segmentation, interactive segmentation, and full-shape semantic decomposition with controllable granularity within a single model. Extensive experiments across these task settings show that PartLLM consistently outperforms task-specific baselines, demonstrating the effectiveness of unifying 3D part segmentation under an intent-conditioned generative formulation.
- Abstract(参考訳): 部分分割はコンピュータグラフィックスと3Dビジョンの基本的な問題である。
最近の研究は、固定された分類学を超えて3D部分のセグメンテーションを拡張しているが、既存のアプローチは通常、テキスト誘導部分のセグメンテーションやポイントベースインタラクションのような特定の設定にのみ対応している。
本研究では,各プロンプトが所望の部分分解を規定する意図条件付き生成問題として,これらの設定を統一することができることを論じる。
この目的のために,3次元部分分割を自己回帰的意味分解として定式化する統合マルチモーダルモデルPartLLMを導入する。
入力形状とユーザプロンプトに基づいて、PartLLMは、マスク予測のクエリとしてセマンティック部分仮説を自動回帰的に生成し、コヒーレント部分マスクを共同で予測する分解対応デコーダに供給する。
この統一設計は、テキスト誘導部分のセグメンテーション、インタラクティブセグメンテーション、および単一のモデル内で制御可能な粒度を持つフルシェイプ意味分解をサポートする。
これらのタスク設定に対する広範囲な実験により、PartLLMはタスク固有のベースラインを一貫して上回り、意図条件付き生成定式化の下での3D部分分割の統一の有効性を示す。
関連論文リスト
- Name That Part: 3D Part Segmentation and Naming [13.782629682520422]
直列アライメントタスクとして部品命名を定式化するALIGN-Partsを提案する。
本手法では, 形状を3次元の暗黙的な部分表現であるパーレットに分解し, バイパーティイト代入による部分記述とマッチングする。
我々のモデルは、任意の記述に対するゼロショットマッチングと、既知のカテゴリに対する信頼度校正予測をサポートします。
論文 参考訳(メタデータ) (2025-12-19T19:02:36Z) - LESS: Label-Efficient and Single-Stage Referring 3D Segmentation [55.06002976797879]
参照3Dは、クエリの文で記述された3Dポイントクラウドから、指定されたオブジェクトのすべてのポイントをセグメントする視覚言語タスクである。
本稿では,LESSと呼ばれるレファレンス3次元パイプラインを提案する。
ScanReferデータセット上での最先端のパフォーマンスは、バイナリラベルのみを使用して、以前の3.7% mIoUの手法を上回ります。
論文 参考訳(メタデータ) (2024-10-17T07:47:41Z) - 3D-GRES: Generalized 3D Referring Expression Segmentation [77.10044505645064]
3D参照式(3D-RES)は、自然言語の記述に基づいて、特定のインスタンスを3D空間内にセグメント化することを目的としている。
一般化された3D参照式(3D-GRES)は、自然言語命令に基づいて任意の数のインスタンスをセグメントする機能を拡張する。
論文 参考訳(メタデータ) (2024-07-30T08:59:05Z) - SegPoint: Segment Any Point Cloud via Large Language Model [62.69797122055389]
我々は,多種多様なタスクにまたがるポイントワイドセグメンテーションマスクを生成するSegPointと呼ばれるモデルを提案する。
SegPointは、単一のフレームワーク内でさまざまなセグメンテーションタスクに対処する最初のモデルである。
論文 参考訳(メタデータ) (2024-07-18T17:58:03Z) - 3D Compositional Zero-shot Learning with DeCompositional Consensus [102.7571947144639]
我々は、部分的知識は観察されたオブジェクトクラスを超えて構成可能であるべきだと論じる。
本稿では、視覚から見えないオブジェクトクラスへの部分一般化の問題として、3D合成ゼロショット学習を提案する。
論文 参考訳(メタデータ) (2021-11-29T16:34:53Z) - Robust 3D Scene Segmentation through Hierarchical and Learnable
Part-Fusion [9.275156524109438]
3Dセマンティックセグメンテーションは、自律運転、ロボット工学、AR/VRといったいくつかのシーン理解アプリケーションのための基本的なビルディングブロックである。
従来の手法では、階層的で反復的な手法を用いて意味や事例情報を融合するが、文脈融合における学習性は欠如している。
本稿では,セグメンテーション・フュージョン(Seegment-Fusion)について述べる。
論文 参考訳(メタデータ) (2021-11-16T13:14:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。