論文の概要: Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics
- arxiv url: http://arxiv.org/abs/2607.10993v1
- Date: Mon, 13 Jul 2026 01:33:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.295872
- Title: Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics
- Title(参考訳): 開語彙検出における信頼スコアはスケールとセマンティックのバイアス混合である
- Authors: Yi Tang Soon, Jun-Wei Hsieh,
- Abstract要約: CLIPのような基盤モデルは、視覚言語的類似性を通じて新しいカテゴリに一般化するオープン語彙オブジェクト検出器を可能にした。
スケールバイアスの発見は2つの効果の偏りのある混合であることを示す。
これらの結果から,画像レベルの基礎モデルを領域レベルの検出タスクに適用する上での基本的限界が明らかとなった。
- 参考スコア(独自算出の注目度): 8.465978346858842
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Foundation models such as CLIP have enabled open-vocabulary object detectors that generalise to novel categories via vision-language similarity. However, the confidence scores these detectors produce are not reliable localization probability estimates: they conflate visual scale and semantic query specificity with the true detection signal. Through controlled experiments on COCO across three foundation-model-based detectors (GroundingDINO, OWL-ViT, YOLO-World), with the scale-bias finding further replicated on LVIS (1,203 categories) using GroundingDINO, we show that s=cos(v,t) is a biased mixture of two effects. Scale bias (alpha = +0.064, r = 0.579, p = 1.29 x 10^-58) systematically inflates scores for large objects. Semantic bias (beta = -0.705, p = 5.23 x 10^-41) suppresses scores for generic queries. Both biases are structurally inevitable from CLIP's image-level pretraining. Threshold adjustment cannot remove them: oracle per-scale thresholding yields Delta F1 = +0.001 for small objects versus +0.102 for large. A parameter-free temperature scaling correction improves small-object Recall@10 by 19.6% (p < 0.01) without retraining. This comes at a modest, measurable cost to pooled-ranking precision, so the bias is partially, not freely, reversible at inference time. These findings reveal a fundamental limitation of adapting image-level foundation models to region-level detection tasks.
- Abstract(参考訳): CLIPのような基盤モデルは、視覚言語的類似性を通じて新しいカテゴリに一般化するオープン語彙オブジェクト検出器を可能にした。
しかし、これらの検出器が生成する信頼性スコアは、真の検出信号と視覚的スケールとセマンティッククエリ特異性を区別する、信頼性の高いローカライズ確率推定値ではない。
基礎モデルに基づく3つの検出器(GroundingDINO, OWL-ViT, YOLO-World)におけるCOCOの制御実験により, スケールバイアスは, GroundingDINOを用いてLVIS(1,203カテゴリ)でさらに再現され, s=cos(v,t) は2つの効果の偏りが認められた。
スケールバイアス(alpha = +0.064, r = 0.579, p = 1.29 x 10^-58)は、大きな物体のスコアを体系的に膨らませる。
意味バイアス(beta = -0.705, p = 5.23 x 10^-41)は、一般的なクエリのスコアを抑制する。
どちらのバイアスも、CLIPのイメージレベルの事前トレーニングから構造的に避けられない。
スケールごとのしきい値調整ではデルタF1 = +0.001 となるが、大きい場合は+0.102 となる。
パラメータフリーの温度スケーリング補正は、リトレーニングなしで小さなオブジェクトRecall@10を19.6%改善する(p < 0.01)。
これは、プールされたランクの精度に対してわずかに測定可能なコストがかかるため、バイアスは部分的には、推論時に部分的には可逆的ではない。
これらの結果から,画像レベルの基礎モデルを領域レベルの検出タスクに適用する上での基本的限界が明らかとなった。
関連論文リスト
- Anticipating the Optimism Gap: Predicting Distribution-Shift Degradation of RF-Impairment Detectors from In-Distribution Statistics [0.0]
電波障害の検知器は、通常、調整された分布で測定された単一のAUCで報告される。
アウト・オブ・ディストリビューション・データを見る前に、この楽観主義が予測できるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-20T14:10:59Z) - Conformal calibration and look-elsewhere effect in anomaly detection for new-physics searches [0.0]
機械学習による異常検出は、新しい物理学の探索を再構築している。
本稿では,共形予測に基づく校正層を提案する。
論文 参考訳(メタデータ) (2026-06-11T18:00:02Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Latent Sculpting for Zero-Shot Generalization: A Manifold Learning Approach to Out-of-Distribution Anomaly Detection [2.8547732086436306]
教師付きディープラーニングの基本的限界は「一般化崩壊」である
階層型2段階表現学習フレームワークであるLatent Sculptingを提案する。
我々は「浸潤」のシナリオについて88.89%の検知率を報告した。
論文 参考訳(メタデータ) (2025-12-19T11:37:02Z) - Relative Scaling Laws for LLMs [91.73497548097775]
スケーリング法則は、追加のデータ、パラメータ、計算によって言語モデルがどのように改善されるかを記述する。
相対的なスケーリング法則を導入し、テスト分布間のパフォーマンスギャップをスケールで追跡する。
これらの結果は、スケーリングは全体的なパフォーマンスを改善するが、普遍的等化器ではないことを示している。
論文 参考訳(メタデータ) (2025-10-28T16:55:22Z) - Adapt in the Wild: Test-Time Entropy Minimization with Sharpness and Feature Regularization [85.50560211492898]
テスト時適応(TTA)は、テストデータが分散シフトが混在している場合、モデルの性能を改善または損なう可能性がある。
これはしばしば、既存のTTAメソッドが現実世界にデプロイされるのを防ぐ重要な障害である。
両面からTTAを安定化させるため,SARと呼ばれる鋭く信頼性の高いエントロピー最小化手法を提案する。
論文 参考訳(メタデータ) (2025-09-05T10:03:00Z) - A Two-Stage Strategy for Mitosis Detection Using Improved YOLO11x Proposals and ConvNeXt Classification [5.1547008655164195]
MIDOG 2025 Track 1は、非腫瘍性、炎症性、壊死性再腫瘍を含む全スライディングイメージ(WSI)におけるミトーシス検出を必要とする。
複雑で異質な文脈のため、しばしば偽陽性と偽陰性が存在するため、検出F1スコアは劣化する。
本稿では、有糸分裂候補を生成し、偽陽性を除去する2段階フレームワークを提案する。
MIDOG 2025 Track 1の予備テストセットでは、thealgorithmのスコアは0.7587である。
論文 参考訳(メタデータ) (2025-09-01T15:46:28Z) - DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability
Curvature [143.5381108333212]
大規模な言語モデルからサンプリングされたテキストは、モデルのログ確率関数の負の曲率領域を占有する傾向にあることを示す。
次に、与えられたLLMから通路が生成されるかどうかを判断するための新しい曲率ベースの基準を定義する。
我々は、モデルサンプル検出のための既存のゼロショット法よりもディテクターGPTの方が識別性が高いことを発見した。
論文 参考訳(メタデータ) (2023-01-26T18:44:06Z) - Scale-Equivalent Distillation for Semi-Supervised Object Detection [57.59525453301374]
近年のSemi-Supervised Object Detection (SS-OD) 法は主に自己学習に基づいており、教師モデルにより、ラベルなしデータを監視信号としてハードな擬似ラベルを生成する。
実験結果から,これらの手法が直面する課題を分析した。
本稿では,大規模オブジェクトサイズの分散とクラス不均衡に頑健な簡易かつ効果的なエンド・ツー・エンド知識蒸留フレームワークであるSED(Scale-Equivalent Distillation)を提案する。
論文 参考訳(メタデータ) (2022-03-23T07:33:37Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。