論文の概要: Annotation-Free Furniture Codes: What They Encode, and How Far They Transfer
- arxiv url: http://arxiv.org/abs/2607.10461v1
- Date: Sat, 11 Jul 2026 19:54:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.434055
- Title: Annotation-Free Furniture Codes: What They Encode, and How Far They Transfer
- Title(参考訳): アノテーションのない家具コード:エンコードするものとどのくらいの移動か
- Abstract要約: 3Dシーンシンセサイザーは、カテゴリークラスラベルと標準目的コンベンションの2つの注釈付きチャンネルを使用して、各オブジェクトを配置する。
対象形状から導出される1つの自己監督トークンが両方を置き換えることができるかどうかを問うとともに,そのようなトークンを直接表現として研究する。
有限スカラー量子化(FSQ)ポイントクラウドオートエンコーダは、ラベルやアノテーションのない配置された3Dフューチャー家具でシャムファーで訓練されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Layout-based 3D scene synthesizers place each object using two human-annotated channels: a categorical class label and a canonical-pose convention. We ask whether a single self-supervised token derived from object geometry can replace both, and study such tokens directly as a representation, decoupled from any synthesizer. A Finite Scalar Quantization (FSQ) point-cloud autoencoder is chamfer-trained on placed 3D-FUTURE furniture with no labels or pose annotations. Diagnostic probes recover fine-category (62.6 +/- 0.5%), super-category (85.6 +/- 1.3%), and yaw (52.7 +/- 0.5 deg) from the codes alone. Swapping the chamfer target from the rotated to the un-rotated point cloud collapses the yaw signal while raising class recovery, showing the codes' rotation content can be set by the training objective. Scaling across asset libraries needs codes that transfer; on an unseen dataset (ShapeNet), alignment is category-dependent: box-like furniture transfers, organically-shaped furniture does not, and a target-blind augmentation partly closes the gap.
- Abstract(参考訳): レイアウトベースの3Dシーンシンセサイザーは、各オブジェクトを2つの人間アノテーション付きチャンネル(カテゴリクラスラベルと標準目的コンベンション)で配置する。
オブジェクト幾何学から派生した1つの自己監督トークンが両方を置き換えることができるかどうかを問うとともに、これらのトークンを直接表現として研究し、任意の合成器から分離する。
有限スカラー量子化(FSQ)ポイントクラウドオートエンコーダは、ラベルやアノテーションのない配置された3Dフューチャー家具でシャムファーで訓練されている。
診断プローブは、微細カテゴリ(62.6 +/- 0.5%)、超カテゴリ(85.6 +/- 1.3%)、ヨー(52.7 +/-0.5 deg)をコードだけで回収する。
チャンファーターゲットを回転した地点から未回転の地点クラウドにスワイプすると、クラス回復を図りながらヨー信号が崩壊し、トレーニング目的により符号の回転内容が設定できる。
参照できないデータセット(ShapeNet)では、アライメントはカテゴリに依存します – ボックスのような家具転送、オーガニックな形状の家具は使用せず、ターゲットブラインド拡張は部分的にギャップを埋めます。
関連論文リスト
- Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation [52.00134393320209]
Sparse2Actは、スパースポイントクラウドエンコーダの事前学習のための観測・動作アライメントフレームワークである。
マスク付きスパース3Dトークンは、観察と組み合わせたワークスペース運動の周囲のシーン特徴を整理するために訓練される。
LIBERO-10ベンチマークでは,500ステップの微調整を行い,平均86.9%の成功を達成した。
論文 参考訳(メタデータ) (2026-06-10T23:56:01Z) - Do Vision--Language Models Understand 3D Scenes or Just Catalogue Objects? [0.0]
6フロンティアとオープンウェイトVLMは, LLM-as-judgeを伴わない18,204応答でアノテーターによって測定され, 急激な解離を示した。
目に見えるレイアウトを53~97%精度で再配置し、衝突の制約にほとんど違反しないモデルは、閉塞時に6~45%、反射時に7%以下に低下する。
Qwen3-VL-8B-Thinkingのホワイトボックス解析は、視覚的統合の失敗をローカライズする。
論文 参考訳(メタデータ) (2026-05-19T20:01:19Z) - On the Feasibility and Opportunity of Autoregressive 3D Object Detection [60.86546723351944]
AutoReg3Dは、検出をシーケンス生成としてキャストする自動回帰型3D検出器である。
さまざまなポイントクラウドやバックボーンに互換性があり、アンカーやNMSなしで、競合するnuScenesのパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-03-09T05:46:53Z) - CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose [42.26395682704635]
Canoverseは、1,156のカテゴリで320Kオブジェクトの巨大な標準3Dデータセットである。
Canoverseは3D生成の安定性を改善し、正確なクロスモーダルな3D形状の検索を可能にし、ゼロショットポイントクラウドの向き推定をアンロックする。
論文 参考訳(メタデータ) (2026-03-07T10:27:34Z) - Class-Partitioned VQ-VAE and Latent Flow Matching for Point Cloud Scene Generation [8.263985049535869]
分級ベクトル量子化変分オートエンコーダ(CPVQ-VAE)
本稿では,物体の潜伏する特徴を効果的に復号するために訓練されたCPVQ-VAE(Class-Partitioned Vector Quantized Variational Autoencoder)を提案する。
提案手法は,ChamferとPoint2Meshのエラーを最大70.4%,72.3%削減して,可塑性点雲のシーンを確実に復元する。
論文 参考訳(メタデータ) (2026-01-18T13:05:35Z) - MixSup: Mixed-grained Supervision for Label-efficient LiDAR-based 3D
Object Detection [59.1417156002086]
MixSupは、大量の安価な粗いラベルと、Mixed-fine Supervisionの限られた数の正確なラベルを同時に活用する、より実用的なパラダイムである。
MixSupは、安価なクラスタアノテーションと10%のボックスアノテーションを使用して、完全な教師付きパフォーマンスの97.31%を達成している。
論文 参考訳(メタデータ) (2024-01-29T17:05:19Z) - ROAM: Robust and Object-Aware Motion Generation Using Neural Pose
Descriptors [73.26004792375556]
本稿では,3次元オブジェクト認識キャラクタ合成における新しいシーンオブジェクトへのロバストさと一般化が,参照オブジェクトを1つも持たないモーションモデルをトレーニングすることで実現可能であることを示す。
我々は、オブジェクト専用のデータセットに基づいて訓練された暗黙的な特徴表現を活用し、オブジェクトの周りのSE(3)-同変記述体フィールドをエンコードする。
本研究では,3次元仮想キャラクタの動作と相互作用の質,および未知のオブジェクトを持つシナリオに対するロバスト性を大幅に向上することを示す。
論文 参考訳(メタデータ) (2023-08-24T17:59:51Z) - Object Discovery from Motion-Guided Tokens [50.988525184497334]
自動エンコーダ表現学習フレームワークを、モーションガイダンスと中間レベルの特徴トークン化により強化する。
我々のアプローチは、解釈可能なオブジェクト固有の中間レベルの特徴の出現を可能にする。
論文 参考訳(メタデータ) (2023-03-27T19:14:00Z) - Data Augmentation-free Unsupervised Learning for 3D Point Cloud
Understanding [61.30276576646909]
ソフトクラスタリング(SoftClu)と呼ばれる,移動可能な点レベルの特徴を学習するための,ポイントクラウドに対する拡張不要な教師なしアプローチを提案する。
我々は,クラスタに対するポイントのアフィリエイトをプロキシとして利用し,擬似ラベル予測タスクを通じて自己学習を可能にする。
論文 参考訳(メタデータ) (2022-10-06T10:18:16Z) - Canonical Capsules: Unsupervised Capsules in Canonical Pose [31.529908150084626]
3dポイントクラウドのための教師なしカプセルアーキテクチャを提案する。
物体のカプセル分解を順列同値な注意を通して計算し,ランダムに回転する物体のペアを訓練することで自己監視を行う。
オブジェクト中心の表現を教師なしの方法で学習することにより、最新の3Dポイントクラウド再構築、登録、および監督なしの分類を上回ります。
論文 参考訳(メタデータ) (2020-12-08T20:13:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。