論文の概要: LoDEOT: Low-Dimensional and Efficient Offset Tokens for Building Footprint Extraction from Off-Nadir Imagery
- arxiv url: http://arxiv.org/abs/2610.05899v2
- Date: Tue, 06 Oct 2026 06:38:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.397889
- Title: LoDEOT: Low-Dimensional and Efficient Offset Tokens for Building Footprint Extraction from Off-Nadir Imagery
- Title(参考訳): LoDEOT:オフナディア画像からのフットプリント抽出のための低次元かつ効率的なオフセットトークン
- Abstract要約: 屋上からフットプリントまでのオフセット(RFO)予測は、オフナディア画像から建物のフットプリントを抽出する中心となる。
本稿では,5次元オフセットトークンに,インスタンストークン,集中屋根,ボックスマスクエビデンスをマッピングするLoDEOTを提案する。
実世界のビルディングデータセットの実験では、5次元オフセットトークンが正確なRFO予測をサポートすることが示されている。
- 参考スコア(独自算出の注目度): 29.013048348238076
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Instance-level roof-to-footprint offset (RFO) prediction is central to extracting building footprints from off-nadir imagery. Query-based pipelines commonly use high-dimensional instance tokens to predict signed two-dimensional RFOs. We investigate whether RFO prediction can instead use a compact offset token. Under local pinhole projection and vertical-extrusion assumptions, the idealized RFO map admits a five-parameter sufficient descriptor comprising intrinsic shape, composite amplitude, and relative geometry. This factorization provides a structural prior for a five-dimensional offset token, whose channels learn task-relevant latent representations through end-to-end training. Based on this design, we propose LoDEOT, which retains high-dimensional instance tokens for detection and segmentation but maps instance-token, concentration-gated roof, and box-mask evidence to a five-dimensional offset token followed by an independent two-dimensional readout. Known denoising-query target indices further align each supervised decoder-layer estimate with the same clean instance RFO, organizing successive predictions as target-aligned recovery under perturbed query conditions. Experiments on five real-world building datasets demonstrate the effectiveness of LoDEOT for building footprint extraction. Experiments on real-world building datasets demonstrate that a five-dimensional offset token can support accurate RFO prediction. On BONAI, LoDEOT achieves the best roof-detection bAP and bAP50 and leads all five offset-corrected footprint metrics among the evaluated end-to-end methods, with FAP50 of 54.58 and mEPE of 5.23 pixels. Its FAP50 exceeds those of the evaluated end-to-end baselines by 7.56-16.85 percentage points.
- Abstract(参考訳): 屋上からフットプリントまでのオフセット(RFO)予測は、オフナディア画像から建物のフットプリントを抽出する中心となる。
クエリベースのパイプラインは通常、署名された2次元 RFO を予測するために高次元のインスタンストークンを使用する。
RFO予測は代わりにコンパクトオフセットトークンを使用することができるかを検討する。
局所的なピンホール投影と垂直押出仮定の下で、理想化されたRFO写像は、固有形状、複合振幅、相対幾何学を含む5パラメータの十分な記述子を許容する。
この因子化は、5次元オフセットトークンの構造的事前を提供し、チャネルはエンドツーエンドのトレーニングを通じてタスク関連潜在表現を学習する。
本設計では,高次元のインスタンストークンを検出・セグメンテーションに保持するLoDEOTを提案するが,インスタンストークン,集中屋根,ボックスマスクエビデンスを5次元オフセットトークンにマップし,その後に独立な2次元読み出しを行う。
Denoising-queryターゲットインデックスは、各教師付きデコーダ層の推定値と同一のクリーンインスタンス RFO とをさらに整合させ、摂動クエリ条件下でのターゲット整列回復として連続的な予測を整理する。
5つの実世界のビルディングデータセットの実験は、建築フットプリント抽出におけるLoDEOTの有効性を実証している。
実世界のビルディングデータセットの実験では、5次元オフセットトークンが正確なRFO予測をサポートすることが示されている。
BONAIでは、LoDEOTは最高の屋根検出のbAPとbAP50を達成し、評価されたエンドツーエンドの手法の中で5つのオフセット補正されたフットプリントのメトリクスを導いており、FAP50は54.58、mEPEは5.23ピクセルである。
FAP50は評価されたエンドツーエンドのベースラインを7.56-16.85ポイント上回る。
関連論文リスト
- Cut-ViT: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency [71.81785123423516]
そこで本稿では,視覚基盤モデルのプルーニングのためのタスク固有のプルーニングパイプラインであるCut-ViTを提案する。
基底非依存および残留制約は、ネイティブモデルとプルーニングされたDINOv3モデルのグラム部分空間を整列するために採用される。
実験によると、Cut-ViTは1つのA100 GPU上で1分程度必要であり、様々な範囲で作業を行うことができる。
論文 参考訳(メタデータ) (2026-08-28T11:25:36Z) - ObliCity: A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction [23.351835462733074]
Roof-to-footprint offset vector(RFOV)抽出は、意味的セグメンテーションから幾何学的アライメントを分離する学習タスクである。
方法論的には、DragOSMを人間行動にインスパイアされたODEベースのフレームワークであるDragRoofに再構成する。
ObliCityの実験は、DragRoofが最先端のRFOV抽出性能を達成することを示した。
論文 参考訳(メタデータ) (2026-07-28T02:31:47Z) - SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference [0.0]
パラメータフリーで入力適応型トークンサーであるSpralFoveaを提案する。
コンテンツ駆動型ホットスポットアンカーの周辺では、マルチスケールのスパイラルリングが78個のパッチを生成し、入力段階で標準の196パッチのViTグリッドを置き換える。
標準的な4つのベンチマークで、SpiralFoveaは1.7-2.1ppの精度で入力トークンの60%の削減、トランスフォーマー層毎の自己アテンションFLOPの84%の削減、マッチした静的トークン化ベースラインの18-29%のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-07-01T11:09:07Z) - Compute Optimal Tokenization [79.3815358070537]
圧縮速度によって制御されるトークンの情報粒度がスケーリングの傾向にどのように影響するかを検討する。
所望の圧縮速度の設定を可能にする50Mから7Bパラメータまで,988の潜在トークン化モデル(BLT)を訓練する。
実験の結果, モデルパラメータは, 一般に認識されるトークンではなく, バイト単位のデータサイズに比例してスケールすることがわかった。
論文 参考訳(メタデータ) (2026-05-02T01:53:22Z) - Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization [0.0]
本研究では,40,cmの屋内動脈ターゲット面に矢状穴の自動検出,局所化,採点を行うシステムを提案する。
私たちのパイプラインは、カラーベースの正準整流ステージ、凍結した自己監督型視覚変換器、そして特徴アップサンプリングという3つのコンポーネントを組み合わせています。
3つの交叉倍数で、平均F1スコアは0.893 pm 0.011$で、平均ローカライゼーション誤差は1.41 pm 0.06$,mmである。
論文 参考訳(メタデータ) (2026-04-18T00:17:48Z) - DoPE: Denoising Rotary Position Embedding [60.779039511252584]
トランスフォーマーモデルにおける回転位置埋め込み(RoPE)は、長さを弱める固有の限界を持つ。
ノイズのある特徴写像として位置符号化を用いたアテンションマップを再解釈し、位置補間ページ(DoPE)を提案する。
DoPEは、トランカテッド行列エントロピーに基づくトレーニング不要な手法であり、特徴写像における外乱周波数帯域を検出する。
論文 参考訳(メタデータ) (2025-11-12T09:32:35Z) - From Editor to Dense Geometry Estimator [77.21804448599009]
密度幾何予測のための拡散変換器(DiT)アーキテクチャに基づく高度な編集モデルを適用するフレームワークである textbfFE2E を紹介する。
FE2EはETH3Dデータセットで35%以上のパフォーマンス向上を実現し、100$times$データでトレーニングされたDepthAnythingシリーズを上回っている。
論文 参考訳(メタデータ) (2025-09-04T15:58:50Z) - V-DETR: DETR with Vertex Relative Position Encoding for 3D Object
Detection [73.37781484123536]
DETRフレームワークを用いた点雲のための高性能な3次元物体検出器を提案する。
限界に対処するため,新しい3次元相対位置(3DV-RPE)法を提案する。
挑戦的なScanNetV2ベンチマークで例外的な結果を示す。
論文 参考訳(メタデータ) (2023-08-08T17:14:14Z) - From Semi-supervised to Omni-supervised Room Layout Estimation Using
Point Clouds [21.877157385576904]
ポイントクラウド(PC)を用いた部屋レイアウト推定は、アノテーションの難しさにより、データ不足に悩まされている。
クワッドとPC間のハイブリッド距離尺度の分布を2成分に分解するオンライン擬似ラベル抽出アルゴリズムを提案する。
驚くべきことに、このフレームワークは、完全に教師された設定でも機能し、ScanNetベンチマークで新しいSOTAを達成する。
論文 参考訳(メタデータ) (2023-01-31T18:58:41Z) - Towards Reading Beyond Faces for Sparsity-Aware 4D Affect Recognition [55.15661254072032]
自動4次元表情認識(FER)のための空間認識深層ネットワークを提案する。
まず,深層学習のためのデータ制限問題に対処する新しい拡張手法を提案する。
次に、多視点での畳み込み特徴のスパース表現を計算するために、疎度対応のディープネットワークを提案する。
論文 参考訳(メタデータ) (2020-02-08T13:09:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。