論文の概要: Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation
- arxiv url: http://arxiv.org/abs/2608.22757v1
- Date: Mon, 24 Aug 2026 03:27:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.879186
- Title: Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation
- Title(参考訳): Object-Uni: オブジェクト中心空間理解と制御可能な生成のための統一モデル
- Authors: Mining Tan, Yinuo Wang, Ziqi Zhou, Weize Quan, Sifei Li, Jingdong Chen, DanDan Zheng, Libin Wang, Weiming Dong,
- Abstract要約: オブジェクト中心の空間的理解と制御可能な生成のための統一モデルを開発する。
オブジェクトのポーズを、理解と生成によって共有される明示的な幾何学的変数として扱う。
実験により,本モデルはオブジェクトレベルのポーズ理解とポーズ制御可能な生成を改善した。
- 参考スコア(独自算出の注目度): 42.78978499935365
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified models for visual understanding and generation have made rapid progress, yet they still lack the ability to understand and manipulate the spatial states of object instances. Existing models can describe objects in natural language, but they struggle to precisely represent continuous object poses and generate geometrically consistent images under target viewpoints. To mitigate this, we propose \emph{Object-Uni}, a unified model for object-centric spatial understanding and controllable generation. Specifically, we formulate object-centric spatial intelligence as a unified problem connecting pose perception, spatial reasoning, pose-conditioned generation, and object-centric novel view synthesis. We treat object pose as an explicit geometric variable shared by understanding and generation, rather than merely a prediction label or control signal. To make pose usable by multimodal large language models, we propose a viewpoint-based orientation abstraction that maps orientation into structured viewpoint descriptions while preserving continuous geometric supervision. We further construct an object-centric spatial benchmark (UniSpatial-80K) and train a unified model with an object-token-grounded pose anchor to associate each instance with its pose state. Experiments show that our model improves object-level pose understanding and pose-controllable generation, moving unified models from describing objects toward manipulating spatial states.
- Abstract(参考訳): 視覚的理解と生成のための統一されたモデルは急速に進歩してきたが、それでもオブジェクトインスタンスの空間状態を理解し操作する能力は欠如している。
既存のモデルは自然言語でオブジェクトを記述することができるが、連続したオブジェクトのポーズを正確に表現し、ターゲット視点の下で幾何学的に一貫した画像を生成するのに苦労する。
これを軽減するために,オブジェクト中心の空間理解と制御可能な生成のための統一モデルである \emph{Object-Uni} を提案する。
具体的には、ポーズ認識、空間推論、ポーズ条件付き生成、オブジェクト中心の新規ビュー合成を結合した統合問題として、オブジェクト中心の空間知能を定式化する。
オブジェクトのポーズは、単に予測ラベルや制御信号ではなく、理解と生成によって共有される明示的な幾何学的変数として扱う。
マルチモーダルな大言語モデルで使用可能なポーズを実現するために,連続的な幾何学的監督を保ちつつ,向きを構造化された視点記述にマッピングする視点ベース指向抽象化を提案する。
さらに、オブジェクト中心空間ベンチマーク(UniSpatial-80K)を構築し、オブジェクト中心のポーズアンカーで統一モデルを訓練し、各インスタンスをそのポーズ状態に関連付ける。
実験により,本モデルではオブジェクトレベルのポーズ理解とポーズ制御可能な生成を改善し,オブジェクトの記述から空間状態の操作へと統一モデルを移動させることが示されている。
関連論文リスト
- G$^2$TAM: Geometry Grounded Track Anything Model [49.05553245076823]
本稿では,RGB画像やビデオのみを用いて,3次元のインスタンス追跡を高速化するための統一的なフレームワークを提案する。
G$2$TAMは空間的に整列した幾何学的表現を暗黙記憶として使用し、安定したインスタンス識別とフレームとビュー間のローカライゼーションを保証する。
中心となるのは、視覚的およびテキスト的プロンプトを共有幾何学空間に統合し、エンドツーエンドの空間再構成とインスタンス一貫性マスク予測を可能にするクロスモーダル空間エンコーダである。
論文 参考訳(メタデータ) (2026-07-04T09:32:13Z) - Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation [52.605647992080485]
空間的推論は視覚的知覚から意味的理解へと視覚言語モデルを前進させる。
物体中心の青写真という認知概念を空間的推論に統合する。
我々の手法は既存の視覚言語モデルより一貫して優れている。
論文 参考訳(メタデータ) (2026-01-05T10:38:26Z) - Learning Object-Centric Representations Based on Slots in Real World Scenarios [5.922488908114023]
この論文では、オブジェクト中心合成のための強力な事前学習拡散モデルを適用するフレームワークを紹介している。
我々は、大域的なシーンコヒーレンスと不整合オブジェクト制御のバランスをとるという、重要な課題を識別する。
本手法は,軽量なスロットベースの条件付けを事前訓練されたモデルに統合し,オブジェクト固有の操作を提供しながら,それらの視覚的先行を保留する。
論文 参考訳(メタデータ) (2025-09-29T12:01:49Z) - SINGAPO: Single Image Controlled Generation of Articulated Parts in Objects [20.978091381109294]
本稿では,単一画像から音声オブジェクトを生成する手法を提案する。
提案手法は,入力画像と視覚的に一致した音声オブジェクトを生成する。
実験の結果,本手法は音声によるオブジェクト生成における最先端の手法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2024-10-21T20:41:32Z) - Discovering Objects that Can Move [55.743225595012966]
手動ラベルなしでオブジェクトを背景から分離する、オブジェクト発見の問題について検討する。
既存のアプローチでは、色、テクスチャ、位置などの外観の手がかりを使用して、ピクセルをオブジェクトのような領域に分類する。
私たちは、動的オブジェクト -- 世界で独立して動くエンティティ -- にフォーカスすることを選びます。
論文 参考訳(メタデータ) (2022-03-18T21:13:56Z) - Look-into-Object: Self-supervised Structure Modeling for Object
Recognition [71.68524003173219]
我々は,自己スーパービジョンを取り入れた「対象」(具体的かつ内在的に対象構造をモデル化する)を提案する。
認識バックボーンは、より堅牢な表現学習のために大幅に拡張可能であることを示す。
提案手法は汎用オブジェクト認識(ImageNet)や細粒度オブジェクト認識タスク(CUB, Cars, Aircraft)など,多数のベンチマークにおいて大きなパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2020-03-31T12:22:51Z) - Object-Centric Image Generation from Layouts [93.10217725729468]
複数のオブジェクトを持つ複雑なシーンを生成するレイアウト・ツー・イメージ生成法を開発した。
本手法は,シーン内のオブジェクト間の空間的関係の表現を学習し,レイアウトの忠実度の向上につながる。
本稿では,Fr'echet Inception Distanceのオブジェクト中心適応であるSceneFIDを紹介する。
論文 参考訳(メタデータ) (2020-03-16T21:40:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。