論文の概要: Remote-Sensing City Layout Extraction with MLLM
- arxiv url: http://arxiv.org/abs/2608.16484v1
- Date: Mon, 17 Aug 2026 12:23:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.679716
- Title: Remote-Sensing City Layout Extraction with MLLM
- Title(参考訳): MLLMを用いたリモートセンシング都市レイアウト抽出
- Abstract要約: Code-as-Cityは大規模マルチモーダル言語モデル(MLLM)による制約付きコード生成として1つのトップダウン画像からの都市抽出をキャストする
プログラムの実行は、レンダリング可能な3D都市レイアウトと、共有幾何学上の直交意味投影を生成する。
完全なフレームワークは41.1%の平均共通点と48.3%のグローバル共通点を得る。
- 参考スコア(独自算出の注目度): 6.085818625714531
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote-sensing systems usually describe urban content with detection boxes, semantic masks, or vector boundaries. Such outputs locate classes and support image-plane scoring, yet they do not by themselves constitute an executable layout that retains object identities, typed relations, topology, and regeneration rules. Code-as-City instead casts urban-layout extraction from a single top-down image as constrained code generation with a multimodal large language model (MLLM). An image model first produces an aligned five-class semantic layout prior. Three ordered MLLM passes use the image and this prior to recover roads, land-cover regions and relations, and buildings. Deterministic normalization converts the accumulated records into a city graph and a restricted layout program. Executing the program creates a renderable 3D city layout and an orthographic semantic projection over shared geometry. The projection admits pixel-level comparison with remote-sensing masks, while named objects, relations, and editing operations remain available for synchronized regeneration of both views. Evaluated on the 100 scenes of CityLayout-100, the complete framework obtains 41.1% mean intersection-over-union and 48.3% global intersection-over-union. This result provides quantitative evidence that visual observations can be translated into inspectable, editable city code with coupled planar and 3D outputs.
- Abstract(参考訳): リモートセンシングシステムは、通常、検出ボックス、セマンティックマスク、ベクトル境界で都市コンテンツを記述する。
このような出力はクラスを特定してイメージプレーンスコアリングをサポートするが、それ自体はオブジェクトのアイデンティティ、型付き関係、トポロジー、再生ルールを保持する実行可能なレイアウトを構成していない。
Code-as-Cityは、マルチモーダル大言語モデル(MLLM)による制約付きコード生成として、1つのトップダウンイメージから都市レイアウト抽出をキャストする。
画像モデルが最初に、5つのクラスのセマンティックレイアウトを前もって生成する。
3本のMLLMパスが画像とこれを使って道路、土地被覆地域、関係、建物を復元する。
決定論的正規化は蓄積したレコードを都市グラフと制限されたレイアウトプログラムに変換する。
プログラムの実行は、レンダリング可能な3D都市レイアウトと、共有幾何学上の直交意味投影を生成する。
プロジェクションは、リモートセンシングマスクとピクセルレベルの比較を認め、名前付きオブジェクト、リレーション、編集操作は両方のビューの同期再生に利用可能である。
CityLayout-100の100のシーンで評価され、完全なフレームワークは41.1%の平均交点対合同と48.3%のグローバル交点対合同を得る。
この結果は、視覚的な観察が、プラナーと3D出力を組み合わせた検査可能で編集可能な都市コードに変換できることを定量的に証明する。
関連論文リスト
- Semantic-Guided Progressive Object Removal with Gaussian Splatting [8.821363895807243]
本稿では,高品質な3次元オブジェクト除去のためのセマンティック誘導ブロックマッチング(SBM)と領域ワイズプログレッシブリファインメント(RPR)を統合した新しいフレームワークを提案する。
提案手法は,3次元物体除去における知覚的品質とコヒーレンスの観点から,既存のガウス法よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-07-05T07:11:48Z) - Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps [77.63233146945718]
マルチビュー画像から明示的な3Dメモリを連続的に構築するフレームワークであるCog3DMapを紹介する。
本フレームワークは空間的に構造化された3次元マップ上での直接推論を可能にし,様々な空間推論ベンチマーク上で最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-03-24T10:05:32Z) - Large Spatial Model: End-to-end Unposed Images to Semantic 3D [79.94479633598102]
大空間モデル(LSM)は、RGB画像を直接意味的放射場に処理する。
LSMは、単一のフィードフォワード操作における幾何学、外観、意味を同時に推定する。
新しい視点で言語と対話することで、多目的ラベルマップを生成することができる。
論文 参考訳(メタデータ) (2024-10-24T17:54:42Z) - Multiview Scene Graph [7.460438046915524]
適切なシーン表現は、空間知性の追求の中心である。
未提示画像からマルチビューシーングラフ(MSG)を構築することを提案する。
MSGは、場所とオブジェクトノードを相互接続したシーンをトポロジ的に表現する。
論文 参考訳(メタデータ) (2024-10-15T02:04:05Z) - TeMO: Towards Text-Driven 3D Stylization for Multi-Object Meshes [67.5351491691866]
我々は,多目的3Dシーンを解析し,そのスタイルを編集する,TeMOと呼ばれる新しいフレームワークを提案する。
提案手法は,高品質なスタイリングコンテンツを合成し,多目的3Dメッシュで既存手法より優れた性能を発揮する。
論文 参考訳(メタデータ) (2023-12-07T12:10:05Z) - Single-view 3D Mesh Reconstruction for Seen and Unseen Categories [69.29406107513621]
シングルビュー3Dメッシュ再構成は、シングルビューRGB画像から3D形状を復元することを目的とした、基本的なコンピュータビジョンタスクである。
本稿では,一視点3Dメッシュ再構成に取り組み,未知のカテゴリのモデル一般化について検討する。
我々は、再構築におけるカテゴリ境界を断ち切るために、エンドツーエンドの2段階ネットワークであるGenMeshを提案する。
論文 参考訳(メタデータ) (2022-08-04T14:13:35Z) - OmniCity: Omnipotent City Understanding with Multi-level and Multi-view
Images [72.4144257192959]
本稿では,マルチレベル・マルチビュー画像から全能都市理解のための新しいデータセットであるOmniCityを提案する。
データセットには100万画素以上の注釈付き画像が含まれており、ニューヨーク市の25万画素のジオロケーションから順に収集されている。
新たなOmniCityデータセットでは,フットプリント抽出や高さ推定,平面/インスタンス/きめ細かなセグメンテーションなど,さまざまなタスクのベンチマークが提供されている。
論文 参考訳(メタデータ) (2022-08-01T15:19:25Z) - Neural 3D Scene Reconstruction with the Manhattan-world Assumption [58.90559966227361]
本稿では,多視点画像から3次元屋内シーンを再構築する課題について述べる。
平面的制約は、最近の暗黙の神経表現に基づく再構成手法に便利に組み込むことができる。
提案手法は, 従来の手法よりも3次元再構成品質に優れていた。
論文 参考訳(メタデータ) (2022-05-05T17:59:55Z) - 3D Instance Segmentation of MVS Buildings [5.2517244720510305]
本稿では,多視点ステレオ(MVS)都市シーンから3次元建物をセグメント化するための新しい枠組みを提案する。
この研究の重点は、大型で不正確な3D表面モデルに取り付けられたとしても、3Dビルディングインスタンスを検出し、セグメンテーションすることにある。
論文 参考訳(メタデータ) (2021-12-18T11:12:38Z) - Generative View Synthesis: From Single-view Semantics to Novel-view
Images [38.7873192939574]
ジェネレーティブビュー合成(GVS)は、単一のセマンティックマップが与えられたシーンの複数のフォトリアリスティックビューを合成することができる。
まず、入力された2Dセマンティックマップを、特徴空間内のシーンの3D層表現に持ち上げる。
次に、レイヤー化された特徴を対象のビューに投影し、最終的なノベルビュー画像を生成する。
論文 参考訳(メタデータ) (2020-08-20T17:48:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。