論文の概要: Latent Commonality Expectation-Maximisation for Box-supervised Tree Crown Instance Segmentation
- arxiv url: http://arxiv.org/abs/2609.26549v1
- Date: Tue, 22 Sep 2026 15:05:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.717654
- Title: Latent Commonality Expectation-Maximisation for Box-supervised Tree Crown Instance Segmentation
- Title(参考訳): 箱型クラウンクラウンセグメンテーションにおける潜在共通性期待-最大化
- Abstract要約: LACEは、0.1m/px空中RGBツリークラウン画像に基づいて評価されたボックス管理インスタンスセグメンテーションモデルである。
予測最大化を用いて、境界ボックス内の繰り返し外観である「ツリーネス」を周囲から分離する。
凍結した自己管理機能を利用することで、LACEはボックスのみから完全に監督された専門家のベースラインにマッチするか、超える。
- 参考スコア(独自算出の注目度): 6.765016710101182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Individual tree crown segmentation from aerial imagery underpins tree-level carbon accounting, biodiversity, and restoration monitoring at landscape scale. However, existing models are predominantly trained on dense canopy forest imagery and degrade in savannah and drylands, where tree crowns are sparse, of variable appearance, and underrepresented in annotated benchmarks. These models also typically depend on costly polygon annotations. We introduce LACE (LAtent Commonality Expectation-maximisation), a box-supervised instance segmentation model, evaluated on 0.1 m/px aerial RGB tree crown imagery. LACE uses a frozen DINOv3-web ViT-L/16 encoder, applied at four spatial offsets and interlaced into a denser feature grid, with a lightweight CenterNet-style detection head trained solely on bounding boxes. We use expectation-maximisation to separate recurring appearance, the "treeness", within bounding boxes from surroundings. On the OAM-TCD benchmark test set, LACE reaches a mask AP$_{50}$ of $0.663 \pm 0.001$ (3 seeds) trained on 900 box-annotated images and without mask annotations, above the 0.626 scored by Restor's released mask-supervised Mask R-CNN, which was trained on the full ~4.2k image set. On a sparse-canopy holdout set, mask AP$_{50}$ rises to $0.691$ versus $0.612$ for Detectree2, a mask-supervised baseline. On NeonTreeEvaluation, using the official evaluation code, LACE reaches $0.728 \pm 0.003$ F1@0.4 (5 seeds) from 23,424 hand-annotated RGB boxes alone, matching the authors' DeepForest model's published 0.719, using under 0.1% of its training annotations and none of its LiDAR-derived 30M-crown pretraining set. By leveraging frozen self-supervised features, LACE matches or surpasses fully-supervised specialist baselines from boxes alone, removing the need for polygon annotation in tree crown instance segmentation for sparse-canopy environments where labelled data is scarce.
- Abstract(参考訳): 航空画像からの個々の樹冠区分は、樹木レベルの炭素収支、生物多様性、景観スケールでの復元監視を支えている。
しかし、既存のモデルは、主に高密度の天蓋林のイメージに基づいて訓練され、サバンナや乾燥地で分解され、樹冠は小さく、外観は変化し、注釈付きベンチマークでは表現が不足している。
これらのモデルは一般的にコストのかかるポリゴンアノテーションにも依存する。
LACE (Latent Commonality expectation-maximisation) は, 大気中のRGB樹冠画像の0.1m/pxで評価したボックス管理インスタンスセグメンテーションモデルである。
LACEは凍結したDINOv3-web ViT-L/16エンコーダを使用し、4つの空間オフセットで適用され、より密集した特徴グリッドに挿入される。
予測最大化を用いて、境界ボックス内の繰り返し外観である「ツリーネス」を周囲から分離する。
OAM-TCDベンチマークテストセットでは、LACEは900のボックスアノテーション付きイメージとマスクアノテーションなしでトレーニングされた$0.663 \pm 0.001$ (3 seed)のマスクAP$_{50}$に到達した。
スパースキャノピーのホールドアウトセットでは、マスクAP$_{50}$は0.691$に上昇するが、Tectree2では0.612$に上昇する。
NeonTreeEvaluationでは、公式評価コードを用いて、LACEは23,424個の手書きのRGBボックスから0.728 \pm 0.003$ F1@0.4 (5シード) に達し、著者のDeepForestモデルが発行した0.719と一致する。
凍結した自己管理機能を活用することで、LACEはボックス単独で完全に監督されたスペシャリストのベースラインをマッチまたはオーバーし、ラベル付きデータが不足しているスパースキャノピー環境のツリークラウンインスタンスセグメンテーションにおけるポリゴンアノテーションの必要性を取り除く。
関連論文リスト
- GeoDistill-Refine: Silhouette-First Geometry Distillation for Annotation-Free Spacecraft Segmentation [4.418549669978083]
本稿では,オフラインSAM3擬似マスクをコンパクトセグメンテーションネットワークに転送するフレームワークを提案する。
6つの固定的なプロンプトは、教師の出力を安定させるために50%の得票で融合される。
サンプルレベルのゲートは、即時一致、有効確率比、擬似マスク面積の可視性から計算され、信頼できない擬似幾何学の影響を減少させる。
論文 参考訳(メタデータ) (2026-08-07T16:53:05Z) - Multi-Modal Spatio-Temporal Graph Neural Network with Mixture of Experts for Soil Organic Carbon Prediction [0.0]
既存のアプローチでは、手作りのコモーダルを古典的なMLとペアリングするか、豊富なスペクトルと時間情報を見逃す単一モードのディープモデルである。
本稿では,SpTGNNとグリッドベースアーキテクチャの両方に対処するマルチテンポラルグラフニューラルネットワークであるSpTG-NNを紹介する。
微調整されたTerraMindエンコーダは、Sentinel-2、Sentinel-1、DEM信号からノード特徴を抽出する。
論文 参考訳(メタデータ) (2026-06-15T11:25:38Z) - SegmentAnyTreeV2: Scaling Transformer-Based Tree Instance Segmentation Across Sensors, Platforms, and Forests [0.0]
SegmentAnyTreeV2は、センサとプラットフォームに依存しない、フォレストポイントクラウドのセグメンテーションとインスタンスセグメンテーションのためのフレームワークである。
FOR-instanceV2テスト分割では、SegmentAnyTreeV2は90.5%の精度、80.2%のリコール、85.0%のF1、90.7%のカバレッジ、87.6%のセマンティックmIoUを達成した。
論文 参考訳(メタデータ) (2026-06-06T14:48:25Z) - A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation [78.66324246922831]
本研究では,Sentinel-2イメージとEuroCropsパーセルレベルのアノテーションからセマンティックセグメンテーション対応農業データセットを生成するパイプラインを提案する。
このデータセットには、ヨーロッパ5カ国から67,337のパッチが含まれており、10種類の作物と背景の分類を減らしている。
The four-level U-Net with Group Normalization were training using 10 Sentinel-2 spectrum bands and a Composite loss with class-weighted cross-entropy and Dice loss。
論文 参考訳(メタデータ) (2026-05-30T11:20:29Z) - Learning Accurate Segmentation Purely from Self-Supervision [87.78965637247107]
Selfmentは完全に自己管理型のフレームワークで、人間のラベルなしでオブジェクトを生画像から直接分割する。
Selfmentは、複数のベンチマークで新しい最先端(SoTA)結果を設定する。
論文 参考訳(メタデータ) (2026-02-27T07:36:32Z) - Towards Gold-Standard Depth Estimation for Tree Branches in UAV Forestry: Benchmarking Deep Stereo Matching Methods [5.266753902938501]
本報告では, 反復洗練, 基礎モデル, 拡散モデル, 3次元CNNパラダイムにまたがる8つのステレオ手法について, ゼロショットによる最初の体系的評価を行う。
すべての方法は、公式にリリースされた事前訓練された重量(フローで訓練された)を使用し、4つの標準ベンチマーク(ETH3D、KITTI 2012/2015、ミドルベリー)と新しい5,313対のカンタベリー樹枝データセット(1920×1080$)で評価される。
論文 参考訳(メタデータ) (2026-01-27T10:45:29Z) - High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation [109.19165503929992]
ここでは,CLIPのマスク分類能力を高めるために,生成されたマスクの代わりに接地トラスマスクを使用するMaskCLIP++を提案する。
低コストの微調整を経て、MaskCLIP++はマルチドメインデータセットのマスク分類性能を大幅に改善した。
我々は,A-847,PC-459,A-150,PC-59,PAS-20データセット上で+1.7,+2.3,+2.1,+3.1,+0.3 mIoUの性能改善を実現する。
論文 参考訳(メタデータ) (2024-12-16T05:44:45Z) - A Fair Ranking and New Model for Panoptic Scene Graph Generation [51.78798765130832]
Decoupled SceneFormer(DSFormer)は、既存のすべてのシーングラフモデルよりも優れた2段階モデルである。
基本設計原則として、DSFormerは被写体とオブジェクトマスクを直接特徴空間にエンコードする。
論文 参考訳(メタデータ) (2024-07-12T12:28:08Z) - Mask Hierarchical Features For Self-Supervised Learning [23.140060988999352]
本稿では,Masking the Deep Hierarchical featuresは,MaskDeepとして表される効率的な自己教師手法であることを示す。
我々は、表現空間内のパッチの一部を隠蔽し、疎可視パッチを使用して、高い意味的イメージ表現を再構築する。
200エポックでResNet50でトレーニングされたMaskDeepは、ImageNet上で71.2%の精度で線形分類を行う。
論文 参考訳(メタデータ) (2023-04-01T04:14:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。