論文の概要: Open-World Semantic Segmentation with Sensitivity Modeling
- arxiv url: http://arxiv.org/abs/2608.08308v1
- Date: Sat, 08 Aug 2026 19:37:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.764605
- Title: Open-World Semantic Segmentation with Sensitivity Modeling
- Title(参考訳): 感性モデリングによるオープンワールドセマンティックセマンティックセグメンテーション
- Abstract要約: オープンワールドビジョンシステムは既知のカテゴリを認識し、目に見えないコンテンツや異常なコンテンツを検出する必要がある。
統一されたエンコーダ・デコーダ設計において、3番目の補完的なデコーダでデュアルデコーダベースラインを拡張する。
本手法は, 競合するクローズドセットの精度を維持しつつ, 異常セグメンテーションと新規クラス発見を改善する。
- 参考スコア(独自算出の注目度): 6.086784305572313
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern vision systems must operate in "open-world" settings, where models must recognize known categories and detect unseen or anomalous content. Conventional semantic segmentation models operate under a "closed-world" assumption, often producing overconfident misclassifications on novel content. We address open-world semantic segmentation, the joint task of segmenting known classes while detecting and grouping novel or anomalous content without additional supervision, by extending a dual-decoder baseline with a third, complementary decoder within a unified encoder-decoder design. The first decoder performs closed-set segmentation using Gaussian prototypes for known categories. The second uses contrastive feature learning to isolate unknown regions in embedding space. The third, our key contribution, is a sensitivity decoder that captures fine-grained texture irregularities and activation instabilities indicative of semantic uncertainty, which neither semantic prototypes nor contrastive norms can reliably detect. The three decoders provide genuinely complementary signals: class-level OOD distance in logit space, global feature energy in embedding space, and local activation instability across encoder scales. Experiments on Cityscapes and BDD-Anomaly show that our method improves anomaly segmentation and novel-class discovery while maintaining competitive closed-set accuracy, with gains of +2.4% AUROC and a 2.5 pp. reduction in FPR@95TPR on BDD-Anomaly over the baseline.
- Abstract(参考訳): 現代の視覚システムは、モデルが既知のカテゴリを認識し、目に見えないコンテンツや異常なコンテンツを検出する「オープンワールド」設定で運用されなければならない。
従来のセマンティックセグメンテーションモデルは「クローズドワールド」の仮定の下で機能し、しばしば新規コンテンツに関する過度に信頼された誤分類を生み出す。
統一エンコーダ・デコーダ設計において,2次元デコーダベースラインを3次元補完デコーダで拡張することにより,未知のコンテンツや異常なコンテンツを検出してグループ化しながら,既知のクラスをセグメンテーションする共同作業であるオープンワールドセマンティックセグメンテーションに対処する。
最初のデコーダは、既知のカテゴリに対するガウスプロトタイプを用いてクローズドセットセグメンテーションを実行する。
2つ目は、コントラスト的な特徴学習を使用して、埋め込み空間における未知の領域を分離する。
3つ目は、セマンティックなプロトタイプもコントラスト的な規範も確実に検出できないセマンティックな不確実性を示す、きめ細かいテクスチャの不規則性とアクティベーションの不安定性をキャプチャする感度デコーダです。
3つのデコーダは、ロジット空間におけるクラスレベルのOOD距離、埋め込み空間におけるグローバルな特徴エネルギー、エンコーダスケール間の局所的なアクティベーション不安定という、真に補完的な信号を提供する。
都市景観実験とBDD-Anomaly実験により,AUROC+2.4%,2.5pp。
ベースライン上のBDD-AnomalyにおけるFPR@95TPRの削減。
関連論文リスト
- REAL-OW: Rehearsal-free Open World Object Detection with Low-Rank Adaptation and Dual-Stage Objectness Modeling [56.888597798431704]
Open-World Object Detection (OWOD) では、未確認のオブジェクトを未知のものとして識別し、それを既知のカテゴリのセットにインクリメンタルに組み込む必要がある。
既存のフレームワークは、破滅的な忘れを緩和するために、模範的なリプレイに大きく依存しているが、実際のアプリケーションでは、データアクセス制限との生データ競合を保存し、データ露出のリスクをもたらす。
協調的なアダプタアーキテクチャを通じて段階的な知識を分離する新しいリハーサルフリーフレームワークであるREAL-OWを提案する。
論文 参考訳(メタデータ) (2026-07-03T06:38:54Z) - ShortcutBreaker: Low-Rank Noisy Bottleneck with Global Perturbation Attention for Multi-Class Unsupervised Anomaly Detection [59.89803740308262]
ShortcutBreakerはMUADタスクのための新しい統合された機能再構成フレームワークである。
ショートカットの問題に対処する2つの重要なイノベーションが特徴だ。
提案手法は,4つのデータセットに対して,99.8%,98.9%,90.6%,87.8%の顕著な画像レベルのAUROCを実現する。
論文 参考訳(メタデータ) (2025-10-21T06:51:30Z) - AD-DINOv3: Enhancing DINOv3 for Zero-Shot Anomaly Detection with Anomaly-Aware Calibration [12.642531824086639]
Zero-Shot Anomaly Detection (ZSAD)は、任意の新しいカテゴリから異常を識別する。
最近のDINOv3のようなビジョン基礎モデルは、強力な転送可能な表現能力を示している。
本稿では,ZSAD用に設計された新しい視覚言語マルチモーダルフレームワークであるAD-DINOv3を紹介する。
論文 参考訳(メタデータ) (2025-09-17T15:29:25Z) - NeurNCD: Novel Class Discovery via Implicit Neural Representation [4.498082064000176]
NeurNCDは、新しいクラス発見のための汎用的でデータ効率のよいフレームワークである。
本フレームワークはオープン・クローズド・ワールド・セッティングの両方において優れたセグメンテーション性能を実現する。
提案手法は,NYUv2 と Replica のデータセットにおける最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2025-06-06T16:43:34Z) - Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection [50.343419243749054]
異常検出は、医学診断や工業的欠陥検出などの分野において重要である。
CLIPの粗粒化画像テキストアライメントは、微粒化異常に対する局所化と検出性能を制限する。
クレーンは最先端のZSADを2%から28%に改善し、画像レベルとピクセルレベルの両方で、推論速度では競争力を維持している。
論文 参考訳(メタデータ) (2025-04-15T10:42:25Z) - SNE-RoadSegV2: Advancing Heterogeneous Feature Fusion and Fallibility Awareness for Freespace Detection [29.348921424716057]
本稿では、全体的注意モジュール、異種特徴コントラスト記述子、親和性重み付き特徴校正器からなる新規な異種特徴融合ブロックを提案する。
スケール内およびスケール内の両方のスキップ接続をデコーダアーキテクチャに組み込むと同時に、冗長な接続を排除し、精度と計算効率を向上させる。
セマンティック・トランジションと深度不整合領域に別々に焦点をあてる2つの誤認認識損失関数を導入し、モデルトレーニングにおけるより深い監督に寄与する。
論文 参考訳(メタデータ) (2024-02-29T07:20:02Z) - Triple-View Knowledge Distillation for Semi-Supervised Semantic
Segmentation [54.23510028456082]
半教師付きセマンティックセグメンテーションのためのトリプルビュー知識蒸留フレームワークTriKDを提案する。
このフレームワークは、トリプルビューエンコーダとデュアル周波数デコーダを含む。
論文 参考訳(メタデータ) (2023-09-22T01:02:21Z) - GLENet: Boosting 3D Object Detectors with Generative Label Uncertainty Estimation [70.75100533512021]
本稿では,対象物の潜在的可算有界箱の多様性として,ラベルの不確実性問題を定式化する。
本稿では,条件付き変分オートエンコーダを応用した生成フレームワークであるGLENetを提案する。
GLENetが生成するラベルの不確実性はプラグアンドプレイモジュールであり、既存のディープ3D検出器に便利に統合することができる。
論文 参考訳(メタデータ) (2022-07-06T06:26:17Z) - The KFIoU Loss for Rotated Object Detection [115.334070064346]
本稿では,SkewIoU損失とトレンドレベルアライメントを両立できる近似的損失を考案する上で,有効な方法の1つとして論じる。
具体的には、対象をガウス分布としてモデル化し、SkewIoUのメカニズムを本質的に模倣するためにカルマンフィルタを採用する。
KFIoUと呼ばれる新たな損失は実装が容易で、正確なSkewIoUよりもうまく動作する。
論文 参考訳(メタデータ) (2022-01-29T10:54:57Z) - Omni-supervised Point Cloud Segmentation via Gradual Receptive Field
Component Reasoning [41.83979510282989]
提案した RFCR (Receptive Field Component Reasoning) を通したクラウドセグメンテーションに,最初のオムニスケール監視手法を導入する。
提案手法は,S3DIS と Semantic3D に対して新たな最先端性能を実現し,ScanNet ベンチマークの1位にランクインする。
論文 参考訳(メタデータ) (2021-05-21T08:32:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。