論文の概要: MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation
- arxiv url: http://arxiv.org/abs/2606.05031v1
- Date: Wed, 03 Jun 2026 15:58:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-04 20:44:18.873188
- Title: MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation
- Title(参考訳): MetaPoint: エージェント視覚生成における精密空間制御のアンロック
- Authors: Dewei Zhou, Xinyu Huang, Xun Wang, Ji Xie, Yabo Zhang, Liang Li, Kunchang Li, Zongxin Yang, Yi Yang,
- Abstract要約: 連続した2次元座標を1つの特別なトークンとして表現することでギャップを埋める方法であるMetaPointを紹介する。
空間制御のためのシンプルで正確でスケーラブルなビルディングブロックを提供することで、MetaPointはより強力な合成生成エージェントを解放する。
- 参考スコア(独自算出の注目度): 50.014544532951085
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative visual models fundamentally struggle with precise spatial control. This arises from a core disconnect: models can process textual descriptions of space but cannot directly map numerical coordinates onto the 2D image canvas. We introduce MetaPoint, a method that bridges this gap by representing a continuous 2D coordinate as a single, special token. Crucially, MetaPoint requires no new architectural components; it directly leverages the model's inherent positional encoding schemes to interpret these coordinates, treating our token as a virtual point on the canvas. This lightweight approach enables pixel-level control of an object's position with one token or its bounding box with two, all without requiring architectural changes or bespoke attention masking. The MetaPoint tokens are designed to be compositional, serving as spatial primitives. This allows a planner agent to decompose a high-level user request into a structured sequence of primitives for the generator. By providing a simple, precise, and scalable building block for spatial control, MetaPoint unlocks more powerful compositional generative agents and enables intuitive, interactive editing systems.
- Abstract(参考訳): 生成的視覚モデルは、基本的に正確な空間制御に苦しむ。
モデルは空間のテキスト記述を処理できるが、数値座標を直接2次元画像キャンバスにマッピングすることはできない。
連続した2次元座標を1つの特別なトークンとして表現することで、このギャップを埋める方法であるMetaPointを紹介します。
重要なことに、MetaPointは新しいアーキテクチャコンポーネントを必要としない。これらの座標を解釈するためにモデル固有の位置エンコーディングスキームを直接利用し、トークンをキャンバス上の仮想ポイントとして扱う。
この軽量なアプローチは、1つのトークンまたは2つのバウンディングボックスを持つオブジェクトの位置のピクセルレベル制御を可能にする。
MetaPointトークンは合成可能で、空間的プリミティブとして機能するように設計されている。
これにより、プランナーエージェントは、高レベルのユーザリクエストをジェネレータ用のプリミティブの構造化シーケンスに分解できる。
空間制御のためのシンプルで正確でスケーラブルなビルディングブロックを提供することで、MetaPointはより強力な合成生成エージェントを解放し、直感的でインタラクティブな編集システムを実現する。
関連論文リスト
- Talking Points: Describing and Localizing Pixels [17.428135548304308]
画素レベルのグラウンド化のための新しいフレームワークを提案する。
このフレームワークは2つの補完的なコンポーネントで構成されている: 個々のキーポイントのリッチで文脈的な記述を生成するポイント記述子と、これらの記述から正確なピクセル座標を回帰するポイントローカライザである。
論文 参考訳(メタデータ) (2025-10-16T11:42:03Z) - Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception [17.654858416126093]
協調的知覚により、エージェントは中間的特徴を交換することで知覚能力を高めることができる。
既存の手法は通常、これらの中間機能を2D Bird's-eye-view (BEV)表現として整理する。
ポイントレベル最適化トークンを利用した新しい協調認識フレームワークであるCoPLOTを提案する。
論文 参考訳(メタデータ) (2025-08-27T07:27:42Z) - Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding [87.68271178167373]
凍結したCLIPバックボーンを用いたスケール不変表現学習のためのユニバーサル3Dトークン化器を提案する。
S4Tokenは、シーンスケールに関係なくセマンティックインフォームドトークンを生成するトークン化パイプラインである。
論文 参考訳(メタデータ) (2025-05-24T18:26:30Z) - PointCG: Self-supervised Point Cloud Learning via Joint Completion and Generation [32.04698431036215]
本稿では,マスク付きポイントモデリング(MPM)と3D-to-2D生成という2つの一般的な手法を,事前学習フレームワーク内にプリテキストタスクとして統合する。
我々はこれらの2つの手法によって提供される空間的認識と精密な監督を活用して、それぞれの限界に対処する。
論文 参考訳(メタデータ) (2024-11-09T02:38:29Z) - Hierarchical Graph Interaction Transformer with Dynamic Token Clustering for Camouflaged Object Detection [57.883265488038134]
本稿では,HGINetと呼ばれる階層的なグラフ相互作用ネットワークを提案する。
このネットワークは、階層的トークン化機能間の効果的なグラフ相互作用を通じて、知覚不能なオブジェクトを発見することができる。
本実験は,既存の最先端手法と比較して,HGINetの優れた性能を示すものである。
論文 参考訳(メタデータ) (2024-08-27T12:53:25Z) - Symbol as Points: Panoptic Symbol Spotting via Point-based
Representation [18.61469313164712]
本研究は,コンピュータ支援設計(CAD)図面におけるパノプティカルシンボルスポッティングの問題について考察する。
我々は、グラフィックプリミティブを局所的に連結された2D点の集合として扱う別のアプローチをとる。
具体的には、点変換器を用いて原始的な特徴を抽出し、マスク2フォルマーのようなスポッティングヘッドを付加して最終的な出力を予測する。
論文 参考訳(メタデータ) (2024-01-19T08:44:52Z) - Flattening-Net: Deep Regular 2D Representation for 3D Point Cloud
Analysis [66.49788145564004]
我々は、任意の幾何学と位相の不規則な3次元点雲を表現するために、Flattning-Netと呼ばれる教師なしのディープニューラルネットワークを提案する。
我々の手法は、現在の最先端の競合相手に対して好意的に機能する。
論文 参考訳(メタデータ) (2022-12-17T15:05:25Z) - Learning Local Displacements for Point Cloud Completion [93.54286830844134]
本稿では,3次元点雲として表現された部分的スキャンからオブジェクトとセマンティックシーンを補完する手法を提案する。
アーキテクチャはエンコーダ-デコーダ構造内で連続的に使用される3つの新しいレイヤに依存している。
オブジェクトと屋内の両方のシーン完了タスクにおけるアーキテクチャの評価を行い、最先端の性能を実現する。
論文 参考訳(メタデータ) (2022-03-30T18:31:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。