論文の概要: CityLLM: A framework for natural-language querying of semantic 3D city models
- arxiv url: http://arxiv.org/abs/2607.14542v1
- Date: Thu, 16 Jul 2026 03:55:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.979287
- Title: CityLLM: A framework for natural-language querying of semantic 3D city models
- Title(参考訳): CityLLM:セマンティック3次元都市モデルの自然言語クエリのためのフレームワーク
- Authors: Rabindra Lamsal, Sisi Zlatanova, Johnson Xuesong Shen,
- Abstract要約: CityLLMは、補完的な都市データセットと共にセマンティック3D都市モデルの自然言語クエリのためのフレームワークである。
GPT-OSS, Gemini 3.1, GPT-5.4 を用いて, ロッテルダム (853 LoD2 ビル) のCityJSON データセット上でCityLLM を評価した。
その結果、回答の正しさは85.2%から100%に、視覚化の正しさは92.9%から100%に、クエリの成功率は100%に、リトライは54のクエリすべてで3つ未満であった。
- 参考スコア(独自算出の注目度): 0.34410212782758043
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Semantic 3D city models provide rich geometric and semantic information, but remain challenging for non-experts and interdisciplinary researchers to access and query due to their complex structures and specialized data formats. To address this issue, we present CityLLM, a framework for natural-language querying of semantic 3D city models alongside complementary urban datasets. The framework combines spatial and graph databases within an LLM-based workflow that supports iterative query refinement and cross-database chaining. We evaluate CityLLM on a CityJSON dataset of Rotterdam (853 LoD2 buildings) using GPT-OSS, Gemini 3.1, and GPT-5.4, along with selected variants, across multiple metrics: answer correctness, visualization correctness, query success, and retry attempts. A total of 54 natural-language queries are curated across four scenarios: spatial, graph, cross-database, and conversational. Results show strong overall performance, with answer correctness ranging from 85.2% to 100%, visualization correctness from 92.9% to 100%, a 100% query success rate, and fewer than three retries across all 54 queries. Overall, the findings suggest that CityLLM provides a lightweight and extensible approach for conversational access to semantic 3D city data.
- Abstract(参考訳): セマンティックな3D都市モデルは、リッチな幾何学的および意味的な情報を提供するが、専門家や学際的研究者が複雑な構造と特殊なデータ形式のためにアクセスとクエリを困難にしている。
この問題に対処するために,CityLLMを提案する。CityLLMは,補完的な都市データセットと並行して,セマンティック3D都市モデルの自然言語クエリを行うフレームワークである。
このフレームワークはLLMベースのワークフロー内で空間データベースとグラフデータベースを結合し、反復的なクエリリファインメントとデータベース間の連鎖をサポートする。
GPT-OSS, Gemini 3.1, GPT-5.4を用いて, ロッテルダム (853 LoD2) のCityJSONデータセット上でCityLLMを評価する。
合計54の自然言語クエリは、空間、グラフ、クロスデータベース、会話の4つのシナリオでキュレートされる。
その結果、回答の正しさは85.2%から100%に、視覚化の正しさは92.9%から100%に、クエリの成功率は100%に、リトライは54のクエリすべてで3つ未満であった。
全体として、CityLLMは、セマンティック3D都市データへの会話アクセスのための軽量で拡張可能なアプローチを提供することを示している。
関連論文リスト
- 3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding [23.008584023129703]
3DCity-LLMは3次元都市規模の視覚言語認識と理解のために設計された統合フレームワークである。
このデータセットは、7つの代表的なタスクカテゴリにわたる約120万の高品質なサンプルで構成されている。
2つのベンチマーク実験により、3DCity-LLM が既存の最先端手法を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2026-03-24T17:18:44Z) - Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales [61.03549470159347]
視覚言語モデル (VLM) は急速に進歩しているが, オープンワールド環境における画像位置決め能力は, 網羅的に評価されていない。
我々は、視覚認識、ステップバイステップ推論、エビデンス利用を評価するVLM画像位置情報の総合ベンチマークであるEarthWhereを提示する。
論文 参考訳(メタデータ) (2025-10-13T01:12:21Z) - 3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering [66.88437915655827]
3D-MoReは、基礎モデルの強みを活用して、大規模な3D言語データセットを生成するように設計されている。
このフレームワークは、マルチモーダル埋め込み、クロスモーダルインタラクション、言語モデルデコーダなど、主要なコンポーネントを統合している。
ScanNetの3DシーンデータセットとScanQAとScanReferのテキストアノテーションを使用して、3D-MoReは62,000の質問応答ペアと73,000のオブジェクト記述を生成する。
論文 参考訳(メタデータ) (2025-07-16T08:38:26Z) - ControlCity: A Multimodal Diffusion Model Based Approach for Accurate Geospatial Data Generation and Urban Morphology Analysis [6.600555803960957]
本稿では,アクセス可能なVGIデータと完全なVGIデータを利用して,都市建物のフットプリントデータの生成を支援するマルチソース地理データ変換ソリューションを提案する。
次に,多モード拡散モデルに基づく地理データ変換手法であるControlCityを提案する。
世界の22都市での実験では、ControlCityが実際の都市建築パターンをシミュレートすることに成功している。
論文 参考訳(メタデータ) (2024-09-25T16:03:33Z) - Space3D-Bench: Spatial 3D Question Answering Benchmark [49.259397521459114]
Space3D-Benchは、Replicaデータセットのシーンに関連する1000の一般的な空間的質問と回答の集合である。
本研究では,事前定義された接地真実解に基づいて,自然言語応答を評価評価するシステムを提案する。
最後に,基礎モデルの世界理解をリッチな文脈検索と統合したRAG3D-Chatというベースラインを導入する。
論文 参考訳(メタデータ) (2024-08-29T16:05:22Z) - 3D Question Answering for City Scene Understanding [12.433903847890322]
3Dマルチモーダル質問応答(MQA)は,知的エージェントが周囲を3D環境下で理解できるようにすることによって,シーン理解において重要な役割を担っている。
都市レベルのシーン理解のための3D MQAデータセットCity-3DQAを提案する。
新しいベンチマークを報告し,提案したSg-CityUはCity-3DQAの異なる設定で63.94 %と63.76 %の精度を達成する。
論文 参考訳(メタデータ) (2024-07-24T16:22:27Z) - Integrating 3D City Data through Knowledge Graphs [8.240949685537784]
CityGMLは、Open Geospatial Consortium (OGC)によって広く採用されている3D都市モデルの表現と交換のための標準である。
CityGMLデータをクエリする可能性は、十分に活用されていない。
本稿では3DCityDBへの宣言的マッピングを用いて,CityGMLの概念を投入するためのCityGML KGフレームワークについて述べる。
論文 参考訳(メタデータ) (2023-10-17T20:00:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。