論文の概要: Morphology-Guided Cross-Task Coupling for Joint Building Height and Footprint Estimation
- arxiv url: http://arxiv.org/abs/2605.04731v1
- Date: Wed, 06 May 2026 10:31:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.771673
- Title: Morphology-Guided Cross-Task Coupling for Joint Building Height and Footprint Estimation
- Title(参考訳): 複合建築高さと足跡推定のための形態誘導型クロスタスク結合
- Abstract要約: 建築高さ(BH)と建築フットプリント(BF)は、建設環境の垂直および水平範囲を共同で記述する。
このクロスタスク結合を明示的に符号化することは、個々のエンコーダをさらに洗練するよりも影響が大きい、と我々は主張する。
2つの相補的なメカニズムを中心に構築された共同BH/BF推定フレームワークであるMorphoFormerを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Building height (BH) and building footprint (BF) jointly describe the vertical and horizontal extent of the built environment and are required inputs for urban climate, disaster-risk, and population-mapping models. The two parameters are coupled through floor-area-ratio (FAR) constraints, yet remote-sensing approaches typically treat them as independent regression targets. We argue that explicitly encoding this cross-task coupling is more impactful than further refining individual encoders, and propose MorphoFormer, a joint BH/BF estimation framework built around two complementary mechanisms: (i) a BF-Guided Task Decoder (BGTD) that gates the height branch via cross-attention on a footprint-derived morphology context, and (ii) a Morphology Consistency Loss (MCL) that supervises a height-from-footprint surrogate against the ground-truth BH, indirectly forcing the BF feature to encode height-correlated structure. The encoder is a single-stage Swin backbone fed by Sentinel-1 SAR, Sentinel-2 multispectral, and DEM inputs, trained and evaluated on a geo-blocked split of 54 cities. Against a Swin-MTL baseline at identical receptive field, MorphoFormer reduces BH test RMSE from 3.39 to 3.15 m (R^2 improves 0.62 -> 0.67) with BF R^2 stable at 0.80. Controlled ablations at identical capacity attribute most of this 0.24 m improvement to the two proposed mechanisms: removing BGTD raises BH RMSE by 0.11 m and removing MCL raises it by 0.11 m, with the residual approximately 0.02 m falling within the noise floor of encoder-side variations. Because both mechanisms act on cross-task representations rather than pixels, the design carries no intrinsic dependence on input resolution.
- Abstract(参考訳): ビルの高さ (BH) と建築フットプリント (BF) は、建設環境の垂直および水平範囲を共同で記述し、都市気候、災害リスク、人口マッピングモデルに必要な入力である。
2つのパラメータはフロアエリア比(FAR)の制約によって結合されるが、リモートセンシングアプローチは通常、それらを独立回帰ターゲットとして扱う。
我々は、このクロスタスク結合を明示的に符号化することは、個別エンコーダのさらなる精細化よりも影響が大きいと論じ、2つの相補的なメカニズムを中心に構築された共同BH/BF推定フレームワークであるMorphoFormerを提案する。
一 足跡由来の形態的文脈上の交差注意により高さ分岐をゲートするBF誘導タスクデコーダ(BGTD)
(II) 高さ関連構造をコードするBF特徴を間接的に強制するBHに対して、高さからフィートプリントまでのサロゲートを監督するMCL(Morphology Consistency Loss)。
エンコーダは、Sentinel-1 SAR、Sentinel-2 multispectral、DEM入力によって供給されるシングルステージのSwinバックボーンで、54の都市でジオブロックされた分割で訓練され評価されている。
同じ受容場におけるSwin-MTLベースラインに対して、MorphoFormerはBH試験RMSEを3.39mから3.15m(R^2は0.62-> 0.67)に還元し、BF R^2は0.80で安定である。
BGTDの除去はBH RMSEを0.11m上げ、MCLの除去は0.11m上げ、残差0.02mはエンコーダ側のノイズフロアに落下する。
どちらの機構も画素ではなくクロスタスク表現に作用するため、この設計は入力解像度に固有の依存は持たない。
関連論文リスト
- SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation [51.46828526392219]
推論セグメンテーションは暗黙の言語学的結論を正確なマスクに変換する。
既存のMLLMセグメンタインタフェースでは、特別なトリガーを使用するか、両方の信号を1つのコンテキストに圧縮する。
明示的なWhat-whereインターフェースであるSeGDePを提示する。
論文 参考訳(メタデータ) (2026-09-08T15:11:32Z) - Causal State-Space Model for Causal Inference: Estimating Longitudinal Individual Treatment Effects [2.4405762029252465]
既存の方法は、治療代入に不変な表現をレンダリングする敵の訓練に依存している。
我々は, 逆実予測誤差に縛られたジェンセン・シャノンの発散により, この緊張関係を定式化する。
我々は、CSSD(Direct Decoder付きCausal State-Spaceモデル)とCSSPD(Predictive regularization付きCausal State-Spaceモデル)の2つの補完モデルを開発している。
論文 参考訳(メタデータ) (2026-08-08T18:41:36Z) - MambaADv2: Evolving Duality-enhanced State Space Model for Unsupervised Anomaly Detection [108.36437360254605]
本稿では,マルチクラス非教師付き異常検出に適したフレームワークであるMambaADv2を提案する。
MambaADv2は、事前訓練されたエンコーダと、複数のスケールにわたるDuality-enhanced State Space (DSS)モジュールを備えたMambaインスパイアされたデコーダで構成される。
HSS(Hybrid State Space)ブロックの構造は、SSDベースのMambaラインに従って調整され、Mamba3スタイルの位置認識状態空間モデリングが組み込まれている。
論文 参考訳(メタデータ) (2026-06-22T10:14:06Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - DART: A Vision-Language Foundation Model for Comprehensive Rope Condition Monitoring [2.8993790400286876]
DART(Damage Assessment via Rope Transformer)は,マルチタスクアーキテクチャによる全ロープ検査に対処する視覚制御基盤モデルである。
HD-MASK(英: HD-MASK)は、ダメージ・ディエンス・パッチの自己言語再構築に焦点を当てたサリエンシ誘導型マスキング戦略である。
DARTは、分類を超えた汎用CMバックボーンとして機能し、単一の共有表現から実行可能なインスペクションインテリジェンスを提供する。
論文 参考訳(メタデータ) (2026-05-06T14:12:02Z) - Operator spreading and recoverability of local quantum Fisher information in a $U(1)$-broken spin chain [0.0]
XXスピンチェーンの単一部位に符号化されたパラメータに対して,演算子拡散とメロジカル回復率の区別について検討した。
そこで本研究では,素サイト量子フィッシャー情報(QFI),有限空間ブロックに作用する変分スイープデコーダによって復元されたQFI,および正確なブロックQFIの3つのレベルについて,局所的メロジカルアクセシビリティを評価する。
論文 参考訳(メタデータ) (2026-05-04T16:18:36Z) - MAny: Merge Anything for Multimodal Continual Instruction Tuning [52.50936513604062]
textbfMAny(textbfMAny)は、textbfCross-modal textbfProjection textbfMergingを通じてタスク固有の知識を統合するフレームワークである。
textbfLow-rank textbfParameter textbfMerging (textbfLPM)
論文 参考訳(メタデータ) (2026-04-15T15:57:23Z) - Latent-Condensed Transformer for Efficient Long Context Modeling [60.72493959155964]
大規模言語モデルに対するLCA(Latent-Condensed Attention)を提案する。
LCAはMLAの潜伏空間内のコンテキストを凝縮し、表現はセマンティック潜伏ベクトルと位置キーに切り離される。
LCAは、最大2.5$times$プリフィルスピードアップと128Kコンテキストでの90%のKVキャッシュ削減を実現している。
論文 参考訳(メタデータ) (2026-04-14T08:40:31Z) - Architecture-Agnostic Modality-Isolated Gated Fusion for Robust Multi-Modal Prostate MRI Segmentation [0.0]
多重化前立腺MRIは、T2パラメトリック(T2W)、見かけ拡散係数(ADC)、高b値拡散強調(HBV)配列を組み合わせる。
実際には、拡散配列は、T2Wよりも、取得のばらつき、動き、アーティファクトの影響を受けることが多い。
我々は、学習ゲーティングステージの前に、個別のモダリティ固有の符号化ストリームを維持するために、Modality-Isolated Gated Fusion (MIGF)を提案する。
論文 参考訳(メタデータ) (2026-04-12T15:54:21Z) - Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction [9.96771578356719]
既存のアプローチは、深度マップを回帰するために、ますます複雑なネットワークアーキテクチャに依存している。
本論文では,Swin Transformerのバックボーン上に構築したマルチレベル条件付きランダムフィールド(CRF)モデルを提案する。
本稿では,Abs Relを0.088ドル(約7.4%)に,RMSEを0.316ドル(約5.4%)に削減し,ほぼ完全なしきい値精度を実現した。
論文 参考訳(メタデータ) (2026-04-03T07:59:26Z) - Less is More in Semantic Space: Intrinsic Decoupling via Clifford-M for Fundus Image Classification [13.23226865033351]
フィードフォワード展開と周波数分割モジュールを疎幾何学的相互作用で置き換える軽量バックボーンであるClifford-Mを提案する。
プリトレーニングなしでは、Clifford-M は平均 AUC-ROC が 0.8142 で、平均マクロF1 が 0.5481 で、ODIR-5K は 0.85M のパラメータしか持たない。
論文 参考訳(メタデータ) (2026-03-21T13:00:05Z) - Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer [55.9892973179428]
MoTokは、セマンティックな抽象化をきめ細かな再構築から切り離す離散モーショントークンである。
また,HumanML3Dでは,トークンの6分の1しか使用せず,MaskControl上での制御性と忠実度を大幅に向上する。
論文 参考訳(メタデータ) (2026-03-19T17:59:51Z) - Discrete-Guided Diffusion for Scalable and Safe Multi-Robot Motion Planning [56.240199425429445]
マルチロボット運動計画(MPMP)は、共有された連続作業空間で動作する複数のロボットのための軌道を生成する。
離散マルチエージェント探索(MAPF)法は,その拡張性から広く採用されているが,粗い離散化の軌道品質は高い。
本稿では、制約付き生成拡散モデルを用いた離散MAPF解法を導入することにより、2つのアプローチの限界に対処する。
論文 参考訳(メタデータ) (2025-08-27T17:59:36Z) - DFedADMM: Dual Constraints Controlled Model Inconsistency for
Decentralized Federated Learning [52.83811558753284]
分散学習(DFL)は、中央サーバーを捨て、分散通信ネットワークを確立する。
既存のDFL手法は依然として、局所的な矛盾と局所的な過度なオーバーフィッティングという2つの大きな課題に悩まされている。
論文 参考訳(メタデータ) (2023-08-16T11:22:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。