論文の概要: Robust Onion: Peeling Open Vocab Object Detectors Under Noise
- arxiv url: http://arxiv.org/abs/2606.26734v2
- Date: Fri, 26 Jun 2026 22:08:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 13:45:02.119592
- Title: Robust Onion: Peeling Open Vocab Object Detectors Under Noise
- Title(参考訳): ロバストなオニオン:オープンなVocabオブジェクト検出器を音で鳴らす
- Abstract要約: ロバスト・オニオン(Robust Onion)は、制御された視覚的劣化を利用してOV-ODs層を層ごとに剥離する実験的な研究である。
以上の結果から、類似の視覚バックボーンを持つモデルは、類似の層における同様の機能崩壊によって、同等の堅牢性を示すことが明らかとなった。
現実世界のBDD100K、WiderFace、VisDRONEの堅牢性を改善することで、私たちの洞察を検証します。
- 参考スコア(独自算出の注目度): 22.615177340954872
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The impact of real-world noise on Open Vocabulary Object Detectors (OV-ODs) remains poorly understood due to their architectural complexity. We present our comprehensive analysis Robust Onion, an empirical study that uses controlled synthetic visual degradations to peel OV-ODs layer-by-layer, revealing how, why, and where robustness degrades, systematically analyzing feature collapse. Our findings reveal that models with similar vision backbones exhibit comparable robustness, driven by similar feature collapse at similar layers, while factors such as pretraining strategy, architectural nuances, and caption supervision contribute little. Robustness is primarily governed by the image domain rather than annotations, explaining the similar robustness impact on COCO and LVIS, and why datasets like ODinW-13 can give an impression of inflated robustness due to large, isolated objects. Finally, we validate our insights by improving robustness on real-world BDD100K, WiderFace, and VisDRONE via our lightweight plug-and-play NN & TK0 approach, using 96x fewer trainable parameters than end-to-end training. We also explain the prior works' robustness observations.
- Abstract(参考訳): Open Vocabulary Object Detectors (OV-ODs) に対する実世界のノイズの影響は、そのアーキテクチャ上の複雑さから理解されていない。
我々は,OV-ODs層を層間剥離するために,制御された視覚的劣化を利用したロバスト・オニオン(Robost Onion)の総合的な解析を行った。
以上の結果から, 類似の視覚バックボーンを持つモデルでは, 類似した特徴崩壊が引き起こされるが, 事前学習戦略, アーキテクチャのニュアンス, キャプションの監督といった要因はほとんど寄与しないことが明らかとなった。
ロバストネスは主にアノテーションではなくイメージドメインによって管理され、COCOやLVISに類似したロバスト性の影響とODinW-13のようなデータセットが大きな孤立したオブジェクトによって膨らんだロバストネスの印象を与える理由を説明する。
最後に、実世界のBDD100K、WiderFace、VisDRONEの堅牢性を改善することで、私たちの洞察を検証します。
また,先行研究のロバスト性観測についても解説する。
関連論文リスト
- BenthicDINO: Physics-Informed Self-Distillation for View-Invariant Side-Scan Sonar Representations [0.0]
本稿では,データ効率を最大化するために,ConvNeXt-v2-Tinyバックボーンを用いてDINOv3アーキテクチャ上に構築した物理インフォームド自己蒸留フレームワークを提案する。
本研究では,4つのネットワークステージにまたがる,密集した階層的特徴融合戦略を提案する。
論文 参考訳(メタデータ) (2026-08-24T13:11:22Z) - Spectral Insights into Data-Oblivious Critical Layers in Large Language Models [7.486925126518052]
我々は,事前調整言語モデルにおいて,本質的な臨界層を特定するためのデータ公開アプローチを提案する。
表現空間が著しく変化する層も微調整時に最も影響を受ける層であることを示す。
論文 参考訳(メタデータ) (2025-05-31T04:21:39Z) - Towards Robust Out-of-Distribution Generalization: Data Augmentation and Neural Architecture Search Approaches [4.577842191730992]
我々は、ディープラーニングのための堅牢なOoD一般化への道を探る。
まず,認識に必須でない特徴間の素早い相関を解消するための,新しい効果的なアプローチを提案する。
次に,OoDシナリオにおけるニューラルアーキテクチャ探索の強化問題について検討する。
論文 参考訳(メタデータ) (2024-10-25T20:50:32Z) - TopoFR: A Closer Look at Topology Alignment on Face Recognition [58.45515807380505]
PTSAと呼ばれるトポロジカル構造アライメント戦略とSDEという硬質試料マイニング戦略を利用する新しいFRモデルであるTopoFRを提案する。
PTSAは永続ホモロジーを用いて入力空間と潜在空間の位相構造を整列し、構造情報を効果的に保存し、FRモデルの一般化性能を向上させる。
一般的な顔のベンチマーク実験の結果は、最先端の手法よりもTopoFRの方が優れていることを示している。
論文 参考訳(メタデータ) (2024-10-14T14:58:30Z) - Towards Evaluating the Robustness of Visual State Space Models [63.14954591606638]
視覚状態空間モデル(VSSM)は視覚知覚タスクにおいて顕著な性能を示した。
しかし、自然と敵対的な摂動の下での頑丈さは依然として重要な懸念事項である。
様々な摂動シナリオ下でのVSSMの頑健さを総合的に評価する。
論文 参考訳(メタデータ) (2024-06-13T17:59:44Z) - Open-Vocabulary Object Detectors: Robustness Challenges under Distribution Shifts [6.486569431242123]
VLM(Vision-Language Models)は近年,画期的な成果を上げている。
VLMオブジェクト検出におけるOODロバスト性の調査は、これらのモデルの信頼性を高めるために不可欠である。
本研究では,最近のOV基盤オブジェクト検出モデルのゼロショット機能について,包括的ロバスト性評価を行った。
論文 参考訳(メタデータ) (2024-04-01T14:18:15Z) - Understanding Robust Overfitting from the Feature Generalization Perspective [61.770805867606796]
逆行訓練(AT)は、逆行摂動を自然データに組み込むことで、堅牢なニューラルネットワークを構築する。
これはロバストオーバーフィッティング(RO)の問題に悩まされ、モデルのロバスト性を著しく損なう。
本稿では,新しい特徴一般化の観点からROを考察する。
論文 参考訳(メタデータ) (2023-10-01T07:57:03Z) - PAIF: Perception-Aware Infrared-Visible Image Fusion for Attack-Tolerant
Semantic Segmentation [50.556961575275345]
対向シーンにおけるセグメンテーションの堅牢性を促進するための認識認識型融合フレームワークを提案する。
我々は,先進の競争相手に比べて15.3% mIOUの利得で,ロバスト性を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2023-08-08T01:55:44Z) - OOD-CV-v2: An extended Benchmark for Robustness to Out-of-Distribution
Shifts of Individual Nuisances in Natural Images [59.51657161097337]
OOD-CV-v2は、ポーズ、形状、テクスチャ、コンテキスト、気象条件の10のオブジェクトカテゴリのアウト・オブ・ディストリビューションの例を含むベンチマークデータセットである。
この新たなデータセットに加えて、一般的なベースライン手法を用いた広範な実験にも貢献する。
論文 参考訳(メタデータ) (2023-04-17T20:39:25Z) - Clustering Effect of (Linearized) Adversarial Robust Models [60.25668525218051]
本稿では, 敵の強靭性に対する新たな理解を提案し, ドメイン適応や頑健性向上といったタスクに適用する。
提案したクラスタリング戦略の合理性と優越性を実験的に評価した。
論文 参考訳(メタデータ) (2021-11-25T05:51:03Z) - Progressive Self-Guided Loss for Salient Object Detection [102.35488902433896]
画像中の深層学習に基づくサラエント物体検出を容易にするプログレッシブ自己誘導損失関数を提案する。
我々のフレームワークは適応的に集約されたマルチスケール機能を利用して、健全な物体の探索と検出を効果的に行う。
論文 参考訳(メタデータ) (2021-01-07T07:33:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。