論文の概要: Training-Free Semantic-Edge Response Decoding of SAM3 for Cross-Domain Infrastructure Crack Segmentation
- arxiv url: http://arxiv.org/abs/2607.12292v2
- Date: Tue, 21 Jul 2026 08:44:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.063509
- Title: Training-Free Semantic-Edge Response Decoding of SAM3 for Cross-Domain Infrastructure Crack Segmentation
- Title(参考訳): クロスドメイン・インフラストラクチャ・クラック・セグメンテーションのためのSAM3のトレーニングフリーセマンティック・エッジ応答デコード
- Abstract要約: textbfSERDはトレーニング不要のメソッドで、プロポーザルインターフェースを内部の言語条件の応答に置き換える。
textbfSERDは5つの目に見えないデータセットで平均58.00%のCrack IoUを達成する。
- 参考スコア(独自算出の注目度): 5.9781029353176685
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-project crack segmentation is hindered by variations in materials, imaging conditions, crack morphology, and background interference. Text-promptable foundation models reduce task-specific training, but SAM3's final region proposals may suppress, truncate, or distort weak and fragmented cracks. We propose \textbf{S}emantic-\textbf{E}dge \textbf{R}esponse \textbf{D}ecoding (\textbf{SERD}), a training-free method that replaces the proposal interface with the internal language-conditioned response. SERD normalizes this dense response, calibrates it using a fixed Sobel structural prior, and applies a single threshold to generate the crack mask. SAM3 remains frozen, with no target-domain annotation, auxiliary prompting network, or test-time optimization. When CamCrack789 is used only for threshold selection, SERD achieves 58.00\% average Crack IoU on five unseen datasets, compared with 54.33\% for native SAM3. Across six rotated source-domain settings, SERD obtains 60.23\% mean target-domain IoU and 67.18\% Boundary F1, exceeding SAM3 by 3.27 and 2.70 percentage points. Regional, structural, foreground-area, robustness, and latency analyses show that direct response decoding recovers substantial crack evidence lost during proposal formation, while structural calibration improves precision and boundary localization. The results demonstrate that internal-response decoding provides a simple and transferable interface for cross-domain infrastructure crack segmentation. \textit{Code is available at: \href{https://github.com/xauat-liushipeng/SERD}{GitHub}}.
- Abstract(参考訳): クロスプロジェクトクラックセグメンテーションは、材料、撮像条件、クラック形態、背景干渉のバリエーションによって妨げられる。
テキストプロンプト可能な基礎モデルはタスク固有のトレーニングを減少させるが、SAM3の最終領域の提案は、弱い亀裂や断片化された亀裂を抑制、縮小、あるいは歪める可能性がある。
本稿では,提案するインタフェースを内部言語条件の応答に置き換えるトレーニングフリーな方法である,XMLbf{S}emantic-\textbf{E}dge \textbf{R}esponse \textbf{D}ecoding (\textbf{SERD})を提案する。
SERDは、この密度の高い応答を正規化し、固定されたソベル構造を用いて校正し、クラックマスクを生成するために単一のしきい値を適用する。
SAM3は、ターゲットドメインアノテーション、補助的なプロンプトネットワーク、テストタイム最適化なしで凍結されている。
CamCrack789がしきい値選択にのみ使用される場合、SERDは5つの見えないデータセットで平均58.00\%のCrack IoUを達成し、ネイティブSAM3では54.33\%である。
6つの回転ソースドメイン設定で、SERDは平均目標ドメインIoUが60.23%、境界F1が67.18%、SAM3が3.27倍、2.70ポイントを超える。
局所的, 構造的, 前景的, 強靭性, および遅延解析により, 直接応答復号法は, 提案生成中に失われた実質的な亀裂の証拠を回収する一方, 構造的校正は精度と境界位置を向上することを示した。
その結果、内部応答復号化は、クロスドメイン・インフラストラクチャ・クラック・セグメンテーションのためのシンプルで転送可能なインタフェースを提供することを示した。
https://github.com/xauat-liushipeng/SERD}{GitHub}}
関連論文リスト
- SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation [51.46828526392219]
推論セグメンテーションは暗黙の言語学的結論を正確なマスクに変換する。
既存のMLLMセグメンタインタフェースでは、特別なトリガーを使用するか、両方の信号を1つのコンテキストに圧縮する。
明示的なWhat-whereインターフェースであるSeGDePを提示する。
論文 参考訳(メタデータ) (2026-09-08T15:11:32Z) - CoRe-SAM3: Conditional Semantic--Visual Reconciliation for SAM3 Crack Segmentation [6.275757527790397]
内部のプロンプト条件のセマンティック表現とSAM3のネイティブ視覚表現の5つのクラックデータセットにおける機能的差異を最初に診断した。
セマンティック・コンディショナル・ビジュアル・リコンシリゼーション(CoRe)を提案する。
5つの領域で、CoRe-SAM3は平均クラックIoUを62.34%から70.47%に改善し、clDiceを81.98%から89.24%に改善した。
論文 参考訳(メタデータ) (2026-09-05T02:25:44Z) - Feature-Spectral Fragility in Segmentation: Dataset Dependence, Architecture-Specific Localization, and Spectral Correlates [0.0]
学習した特徴表現の周波数依存性を学習後低域介入を用いて調査する。
CNN、SSM、Transformerはそれぞれ100%、73.2%、30.9%減少し、ISICでは9.4%、10.3%、0.6%となっている。
ネイティブな特徴領域スペクトル測定は、CVCにおける高周波エネルギーと不安定性の逆相関を示す。
論文 参考訳(メタデータ) (2026-08-29T09:33:45Z) - GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting [40.66340261994875]
Camouflaged Object Detection (Ref-COD)を参照するには、参照キューによってガイドされた隠されたターゲットをセグメント化する必要がある。
GFR-SAMは、堅牢な3段階トレーニングフリーフレームワークである。
まず,In-Context Exemplar-guided exemplarsを導入し,SAM3にクロスイメージ推論を施し,候補マスクを生成する。
次に、Regional-Global Contrastive Filteringモジュールは、DINOv3ベースのプロトタイプアライメントを通じて候補をランク付けする。
第3に、Geometric-Semantic Refinementモジュールはバウンディングボックスとテキストを同期させ、きめ細かい境界を回復し、インスタンスリコールを強化する。
論文 参考訳(メタデータ) (2026-07-13T15:55:45Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap [0.6445605125467572]
高い検出性能は表現力を示すものではないことを示す。
その結果,深度とキャパシティの異なる複数のBERTファミリーエンコーダにまたがって,検出器がほぼ完璧な分類性能を達成できることが示唆された。
難解な埋め込みは、さらに高いクラス内分散(3.33 +/- 6.23)を示し、高い性能にもかかわらず重い潜伏空間不安定を示す。
論文 参考訳(メタデータ) (2026-05-18T22:25:47Z) - OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance [53.45125687428705]
Open-Vocabularyは、セマンティック記述を活用することで、定義済みのカテゴリセットを超えてイメージ領域を分割することを目的としている。
近年の取り組みは、これらの制限を軽減するために、DINOのようなVision Foundation Models (VFM) を取り入れている。
我々は,構造アライメントを通じてDINOの潜在エッジ感度を活性化する新しいフレームワークであるOVS-DINOを提案する。
論文 参考訳(メタデータ) (2026-04-09T16:57:11Z) - StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models [57.674757786328236]
StructSAMは、Segment Anything Model(SAM)に適した解像度保存型マージアンマージフレームワークである
また,StructSAMはエンコーダFLOPsを25~30%削減し,mIoU/Diceに少量の低下を認めた。
また、スペクトルグラフ粗大化ビューでは、スコア誘導マージにより、ランダムまたはウィンドウ制限ベースラインと比較して、ラプラシアスペクトル歪みが有界となることを示す。
論文 参考訳(メタデータ) (2026-03-07T18:30:58Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - D3R-Net: Dual-Domain Denoising Reconstruction Network for Robust Industrial Anomaly Detection [0.0]
非教師付き異常検出(UAD)は、現代の製造において、自動視覚検査の鍵となる要素である。
本稿では、D3R-Netについて紹介する。D3R-Netは、自己教師型「癒し」タスクと周波数認識正規化を結合したデュアルドメイン・デノベーション・コンストラクションフレームワークである。
空間平均二乗誤差に加えて、周波数領域の整合性を促進するFast Fourier Transform (FFT) 等級損失を用いる。
論文 参考訳(メタデータ) (2026-01-27T23:21:59Z) - CrackSegFlow: Controllable Flow Matching Synthesis for Generalizable Crack Segmentation with a 50K Image-Mask Benchmark [0.27998963147546135]
CrackSegFlowは、マスクからの亀裂の合成画像をピクセルレベルのアライメントで描画する制御可能な合成法である。
以上の結果から,合成ペアの追加により,+5.37 mIoUと+5.13 F1のドメイン性能が向上し,ターゲットマスク統計によって誘導されるターゲット誘導クロスドメイン合成では+13.12 mIoUと+14.82 F1のドメイン性能が向上した。
論文 参考訳(メタデータ) (2026-01-07T06:28:16Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - When 3D Partial Points Meets SAM: Tooth Point Cloud Segmentation with Sparse Labels [39.54551717450374]
歯点クラウドセグメンテーションは多くの矯正用アプリケーションにおいて基本的なタスクである。
近年, 3次元セグメンテーションに弱いラベルを用い, 有望な結果を得る方法が提案されている。
本稿では,SAMTooth という名前のフレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-03T08:14:56Z) - CrackSCF: Lightweight Cascaded Fusion Network for Robust and Efficient Structural Crack Segmentation [36.93774494071781]
CrackSCFは、堅牢なクラックセグメンテーションを実現するために設計された軽量なカスケード核融合クラックネットワークである。
このアプローチは、最小の計算フットプリントで動作しながら、ローカルパターンを効率的にキャプチャする。
実験結果から,CrackSCF法は既存の手法よりも一貫して優れていることがわかった。
論文 参考訳(メタデータ) (2024-08-23T03:21:51Z) - From Generalization to Precision: Exploring SAM for Tool Segmentation in
Surgical Environments [7.01085327371458]
セグメンテーションモデルでは, 汚損レベルの高い画像が大幅に過大評価され, 性能が低下する。
我々は,最高の単一マスクを予測として選択した場合のSAMの結果を分析するために,接地型ツールマスクを用いている。
本研究では,様々な強みの合成汚損データを用いて,Endovis18とEndovis17の計器セグメンテーションデータセットを解析した。
論文 参考訳(メタデータ) (2024-02-28T01:33:49Z) - Reference Twice: A Simple and Unified Baseline for Few-Shot Instance Segmentation [103.90033029330527]
FSIS(Few-Shot Instance)は、サポート例が限定された新しいクラスの検出とセグメンテーションを必要とする。
我々は、FSISのサポートとクエリ機能の関係を利用するための統合フレームワーク、Reference Twice(RefT)を導入する。
論文 参考訳(メタデータ) (2023-01-03T15:33:48Z) - Feature Completion for Occluded Person Re-Identification [138.5671859358049]
RFCブロックは、機能空間の隠された領域のセマンティクスを復元することができる。
SRFCは、隠蔽領域の特徴を予測するために、非隠蔽領域からの長距離空間コンテキストを利用する。
TRFCモジュールは、長期の時間的コンテキストをキャプチャして、SRFCの予測を洗練します。
論文 参考訳(メタデータ) (2021-06-24T02:40:40Z) - ISTR: End-to-End Instance Segmentation with Transformers [147.14073165997846]
ISTRと呼ばれるインスタンスセグメンテーショントランスフォーマーを提案します。これは、その種類の最初のエンドツーエンドフレームワークです。
ISTRは低次元マスクの埋め込みを予測し、それらのマスクの埋め込みと一致する。
ISTRは、提案されたエンドツーエンドのメカニズムにより、近似ベースのサブオプティマティック埋め込みでも最先端のパフォーマンスを発揮します。
論文 参考訳(メタデータ) (2021-05-03T06:00:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。