論文の概要: NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation
- arxiv url: http://arxiv.org/abs/2607.05955v1
- Date: Tue, 07 Jul 2026 07:54:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.435963
- Title: NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation
- Title(参考訳): NegROI:ロバストな対話型3Dセグメンテーションのためのシーンコンディション型負のプロンプトを用いたクリック中心不確かさ誘導型リファインメント
- Abstract要約: インタラクティブな3Dセグメンテーションは、最小限のクリックでポイントクラウド内のオブジェクトマスクを抽出することを目的としている。
既存のアプローチは、(i)限られたクリックの下で細かな境界をぼかす粗いボクセル分解と、(ii)背景構造を混乱させることによって引き起こされる硬い偽陽性に依然として苦戦している。
我々は,クリック中心のマルチレゾリューション改善とシーン条件の負のプロンプトを結合した,新しいトランスフォーマーベースの対話型フレームワークNegROIを提案する。
一般的なベンチマークデータセットに対する実験では、クリック効率の向上と偽陽性の低減が示され、最先端のベースラインよりも強いデータセット間のロバスト性が示された。
- 参考スコア(独自算出の注目度): 28.716564476160958
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interactive 3D segmentation aims to extract object masks in point clouds with minimal user clicks. Despite recent progress, most existing approaches still struggle with (i) coarse voxel resolution that blurs fine boundaries under limited clicks and (ii) hard false positives caused by confusing background structures. These issues are exacerbated by density and scale shifts across datasets (e.g., dense RGB-D reconstructions vs. sparse LiDAR scans), where fixed refinement heuristics and purely click-driven decoding generalize poorly. To address them, we propose NegROI -- a novel transformer-based interactive framework that couples click-centric multi-resolution refinement with scene-conditioned negative prompts. Given a coarse voxel prediction, it refines only a local Region Of Interest (ROI) around the current click on a finer grid and fuses refined logits back to the coarse mask. To improve robustness and efficiency, we introduce uncertainty-driven selective refinement that prioritizes ambiguous regions. Meanwhile, we model hard background patterns via a set of scene-conditioned negative prompts obtained by cross-attention over scene tokens. We further stabilize these prompts with a diversity regularizer. Finally, we propose boundary-aware hard negative mining to supervise negative-prompt attention toward boundary-proximal, high-confidence false positives. Our experiments on common benchmark datasets (i.e., ScanNet, S3DIS, and KITTI) demonstrate improved click efficiency and reduced false positives, with stronger cross-dataset robustness than the state-of-the-art baselines.
- Abstract(参考訳): インタラクティブな3Dセグメンテーションは、最小限のクリックでポイントクラウド内のオブジェクトマスクを抽出することを目的としている。
最近の進歩にもかかわらず、既存のアプローチは依然として苦戦している。
一 限られたクリックで細かな境界をぼかす粗いボクセル分解能
(ii)背景構造が混乱することによる硬い偽陽性。
これらの問題は、データセット間の密度とスケールシフト(例えば、密度の高いRGB-D再構成とスパースLiDARスキャン)によって悪化する。
そこで我々は,クリック中心のマルチレゾリューション改善とシーン条件の負のプロンプトを結合した,新しいトランスフォーマーベースの対話型フレームワークNegROIを提案する。
粗いボクセル予測を前提として、より細いグリッド上の現在のクリックを囲むローカルな関心領域(ROI)のみを洗練し、粗いマスクに精巧なロジットを融合させる。
頑健性と効率性を向上させるため,不明瞭領域を優先する不確実性駆動型選択的改良を導入する。
一方,シーントークンをクロスアテンションすることで得られるシーン条件付き負のプロンプトの集合を用いて,ハードな背景パターンをモデル化する。
さらに多様性正則化器を用いてこれらのプロンプトを安定化する。
最後に, 境界近近高信頼偽陽性に対する負の急激な注意を監督するために, 境界対応型ハード負のマイニングを提案する。
一般的なベンチマークデータセット(ScanNet、S3DIS、KITTI)に関する実験では、クリック効率の向上と偽陽性の低減が示され、最先端のベースラインよりも強力なクロスデータセットロバスト性が示された。
関連論文リスト
- U-CFR: Uncertainty-Guided Cascade Forward Refinement for Interactive Segmentation [2.3488056916440856]
不確かさ誘導型カスケードフォワードリファインメント(U-CFR)
本稿では,各ユーザインタラクション後にモデルが自律的に自己修正できる新しい推論時フレームワークを提案する。
これにより、バークレーのような挑戦的なデータセットで必要なクリックを10%以上削減できる。
論文 参考訳(メタデータ) (2026-07-22T20:23:00Z) - Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction [77.75911117889915]
現在のエンドツーエンドのマルチビュー3D再構成手法は、目覚ましい結果を得るが、制限的な静的仮定に依存している。
この理想的な入力への依存は、最も高度なメソッドでさえ、現実世界の設定で失敗する原因となる。
非一貫性の視点から頑健な再構築を行うためのエンドツーエンドフレームワークであるWildにおけるビジュアルジオメトリトランスフォーマーを提案する。
論文 参考訳(メタデータ) (2026-06-22T02:52:22Z) - Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment [12.336161969869567]
分布正規化を伴う共同埋め込み予測に基づくNOn-contrastive Vision-Language AlignmentフレームワークであるNOVAを紹介する。
テキストエンコーダとしてCeriorBERTとMIMIC-CXRでスクラッチからトレーニングしたビジョントランスフォーマーを用いて,ゼロショット胸部X線分類におけるNOVAの評価を行った。
本研究は,非コントラスト的視覚言語事前学習が,コントラスト的手法よりもシンプルで,より安定的で,より効果的な代替手段を提供することを示す。
論文 参考訳(メタデータ) (2026-01-31T10:57:46Z) - Extremal Contours: Gradient-driven contours for compact visual attribution [5.6220652636435915]
恒星を監督するフレームワークが高密度マスクによってより複雑なものを実現する方法を示す。
ImageNetsでは、高密度マスクの極端の輪郭とマッチングし、ランニング・トゥ・ラン・ビジョンを改善したコンパクトな領域を生成する。
論文 参考訳(メタデータ) (2025-11-03T10:02:21Z) - PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models [57.02789948234898]
拡散モデルに基づく点-ボクセル相互作用フレームワークであるPVNetを提案する。
具体的には、スパース点雲を誘導条件とし、近くのフレームから得られた合成点雲を入力とする。
さらに,各アップサンプリング点の環境認識能力を効率よく向上する点とボクセルの両方の機能を統合する点とボクセルの相互作用モジュールを提案する。
論文 参考訳(メタデータ) (2025-08-23T14:55:03Z) - Capturing Fine-Grained Alignments Improves 3D Affordance Detection [0.46040036610482665]
本稿では,3次元点雲における空き地検出のための新しい手法であるLM-ADを提案する。
また、Affordance Query Module (AQM)を導入し、ポイントクラウドとテキスト間の微粒なアライメントを効率的にキャプチャする。
提案手法は,3次元AffordanceNetデータセット上でのUnion上での精度と平均断面積で既存手法よりも優れていた。
論文 参考訳(メタデータ) (2025-06-24T04:58:55Z) - Hard-Label Black-Box Attacks on 3D Point Clouds [66.52447238776482]
そこで本研究では,新しいスペクトル認識決定境界アルゴリズムに基づく新しい3D攻撃手法を提案する。
実験により,攻撃性能と対向品質の点で,既存の白黒ボックス攻撃者よりも競合性が高いことが示された。
論文 参考訳(メタデータ) (2024-11-30T09:05:02Z) - SIRST-5K: Exploring Massive Negatives Synthesis with Self-supervised
Learning for Robust Infrared Small Target Detection [53.19618419772467]
単一フレーム赤外線小ターゲット検出(SIRST)は、乱雑な背景から小さなターゲットを認識することを目的としている。
Transformerの開発に伴い、SIRSTモデルのスケールは常に増大している。
赤外線小ターゲットデータの多彩な多様性により,本アルゴリズムはモデル性能と収束速度を大幅に改善する。
論文 参考訳(メタデータ) (2024-03-08T16:14:54Z) - Implicit and Efficient Point Cloud Completion for 3D Single Object
Tracking [9.372859423951349]
適応リファイン予測(ARP)とターゲット知識伝達(TKT)の2つの新しいモジュールを紹介する。
本モデルでは,より少ない計算量を維持しながら,最先端の性能を実現する。
論文 参考訳(メタデータ) (2022-09-01T15:11:06Z) - Progressive Coordinate Transforms for Monocular 3D Object Detection [52.00071336733109]
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
論文 参考訳(メタデータ) (2021-08-12T15:22:33Z) - Learning to Estimate Hidden Motions with Global Motion Aggregation [71.12650817490318]
閉塞は、局所的な証拠に依存する光学フローアルゴリズムに重大な課題をもたらす。
最初の画像でピクセル間の長距離依存性を見つけるために,グローバルモーションアグリゲーションモジュールを導入する。
遮蔽領域における光流量推定が非遮蔽領域における性能を損なうことなく大幅に改善できることを実証した。
論文 参考訳(メタデータ) (2021-04-06T10:32:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。