論文の概要: Zero-Shot Quantization for Object Detectors using Off-the-Shelf Generative Models
- arxiv url: http://arxiv.org/abs/2606.31456v1
- Date: Tue, 30 Jun 2026 10:29:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.175302
- Title: Zero-Shot Quantization for Object Detectors using Off-the-Shelf Generative Models
- Title(参考訳): オフザシェルフ生成モデルを用いた物体検出器のゼロショット量子化
- Abstract要約: GoodQは、既製の生成モデルを使用してトレーニングセットを構築するパイプラインである。
低ビットZSQ(W4A4)における最先端性能を実現し、量子化を極ビット幅に拡張する(W3A3)
- 参考スコア(独自算出の注目度): 32.6734400537211
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With an increasing number of Object Detection (OD) models being deployed on edge devices, Zero-Shot Quantization for OD (ZSQ-OD) aims to quantize these models when access to the original training data is prohibited. Existing research on Zero-Shot Quantization-Aware Training (QAT) for OD synthesizes training sets through noise optimization. However, this approach struggles to maintain performance in low-bit regions. In this paper, we introduce GoodQ (Generative off-the-shelf models for object detector Quantization), a QAT pipeline that utilizes off-the-shelf generative models to construct a training set. We first identify three challenges that arise when introducing a generative model to the ZSQ-OD task: 1) each image contains dense information with multiple instances, 2) the class-wise distribution in the original dataset is imbalanced, and 3) the pseudo-labels assigned to the generated images can potentially act as noisy signals during QAT. GoodQ addresses these challenges by 1) introducing an Information-Dense Prompting strategy to generate multi-instance images, 2) applying Intrinsic Distribution-Aware Selection to match the pretrained class distribution, and 3) employing Teacher-guided Adaptive Noise Reduction to mitigate noise arising from the QAT process. Our framework achieves state-of-the-art performance in low-bit ZSQ (W4A4) and extends quantization to extreme bit-widths (W3A3). Furthermore, we conduct an extensive analysis to uncover the underlying factors contributing to the efficacy of GoodQ.
- Abstract(参考訳): エッジデバイスにデプロイされるオブジェクト検出(OD)モデルの増加に伴い、Zero-Shot Quantization for OD(ZSQ-OD)は、元のトレーニングデータへのアクセスが禁止されたときにこれらのモデルを定量化することを目的としている。
ODのためのZero-Shot Quantization-Aware Training (QAT)の既存の研究は、ノイズ最適化を通じてトレーニングセットを合成する。
しかし、このアプローチは低ビット領域のパフォーマンスを維持するのに苦労している。
本稿では,物体検出器量子化のための生成オフザシェルフモデルであるGoodQ(Generative off-the-shelf model for object detector Quantization)を紹介する。
まず、ZSQ-ODタスクに生成モデルを導入する際に生じる3つの課題を特定します。
1) 各画像は、複数のインスタンスを持つ密集した情報を含む。
2)元のデータセットにおけるクラスワイドの分布は不均衡であり、
3)生成された画像に割り当てられた擬似ラベルは、QAT中にノイズ信号として機能する可能性がある。
GoodQはこれらの課題に対処する
1)マルチインスタンス画像を生成するためのインフォメーション・ディエンス・プロンプティング戦略の導入
2)事前学習したクラス分布に適合するために本質的分布対応選択を適用すること、
3) 教師誘導型適応雑音低減によるQATプロセスからの騒音低減
我々のフレームワークは、低ビットZSQ(W4A4)における最先端性能を実現し、量子化を極端ビット幅(W3A3)にまで拡張する。
さらに,GoodQの有効性に寄与する要因を明らかにするために,広範な分析を行う。
関連論文リスト
- SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning [20.646275941976224]
量子化アルゴリズムは、リソース制約のあるエッジデバイスにニューラルネットワークをデプロイするために広く使用されている。
Zero-shot Quantization (ZSQ)は、プライバシやセキュリティ上の理由から、トレーニングデータがアクセスできない、重要かつ実践的なシナリオに対処する。
我々は既存の手法の限界を克服するため、SynQ (Synthesis-aware Fine-tuning for Zero-shot Quantization)を提案する。
論文 参考訳(メタデータ) (2026-03-19T02:32:34Z) - High-Quality Proposal Encoding and Cascade Denoising for Imaginary Supervised Object Detection [20.075203668387136]
既存の物体検出手法は、単純なプロンプト、画質の低下、監督の弱さに悩まされている。
これらの制約に対処するためにカスケードHQP-DETRを提案する。
まず,LLaMA-3, Flux, Grounding DINO を用いた高品質なデータパイプラインを導入し,FluxVOC と FluxCOCO のデータセットを生成する。
第二に、私たちのHigh-Quality Proposalは、SAM生成された提案から、画像固有のプリミティブを持つオブジェクトクエリを符号化するクエリをガイドします。
第三に、我々のカスケード復調アルゴリズムは、デコーダ層をまたいだIoU閾値を徐々に増加させ、トレーニングウェイトを動的に調整する。
論文 参考訳(メタデータ) (2025-11-11T09:19:56Z) - TRIQA: Image Quality Assessment by Contrastive Pretraining on Ordered Distortion Triplets [31.2422359004089]
No-Reference (NR) IQA は参照画像がないため、特に困難である。
本稿では,限られた数の参照コンテンツ画像を用いて,カスタムデータセットを構築する新しい手法を提案する。
対照的な三重項学習を用いて品質認識モデルを訓練し、より少ないサンプルで効率的なトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-07-16T23:43:12Z) - Reliable Few-shot Learning under Dual Noises [166.53173694689693]
そこで我々はDETA++(Denoized Task Adaptation)を提案する。
DETA++はメモリバンクを使用して、各インナータスククラスのクリーンなリージョンを格納し、精製する。
大規模な実験は、DETA++の有効性と柔軟性を示している。
論文 参考訳(メタデータ) (2025-06-19T14:05:57Z) - Multi-task Feature Enhancement Network for No-Reference Image Quality Assessment [4.4150617622399055]
マルチタスク戦略に基づくNo-Reference Image Quality Assessment (NR-IQA)手法はいくつかの課題に直面する。
本フレームワークは,高周波抽出ネットワーク,品質推定ネットワーク,歪み認識ネットワークの3つの主要コンポーネントから構成される。
5つの標準IQAデータベースによる実験結果から,本手法が高い性能を達成し,堅牢な一般化能力を示すことが確認された。
論文 参考訳(メタデータ) (2024-11-12T05:10:32Z) - DP-IQA: Utilizing Diffusion Prior for Blind Image Quality Assessment in the Wild [73.6767681305851]
野生のブラインド画像品質評価(IQA)は重大な課題を呈している。
大規模なトレーニングデータの収集が困難であることを考えると、厳密な一般化モデルを開発するために限られたデータを活用することは、未解決の問題である。
事前訓練されたテキスト・ツー・イメージ(T2I)拡散モデルの堅牢な画像認識能力により,新しいIQA法,拡散先行に基づくIQAを提案する。
論文 参考訳(メタデータ) (2024-05-30T12:32:35Z) - Blind Image Quality Assessment via Vision-Language Correspondence: A
Multitask Learning Perspective [93.56647950778357]
ブラインド画像品質評価(BIQA)は、参照情報なしで画像品質の人間の知覚を予測する。
我々は,他のタスクからの補助的知識を活用するために,BIQAのための汎用的かつ自動化されたマルチタスク学習手法を開発した。
論文 参考訳(メタデータ) (2023-03-27T07:58:09Z) - DETA: Denoised Task Adaptation for Few-Shot Learning [135.96805271128645]
数ショット学習におけるテスト時間タスク適応は、訓練済みのタスク非依存モデルに適応してタスク固有の知識を取得することを目的としている。
少数のサンプルしか得られないため、支持試料からのイメージノイズ(Xノイズ)またはラベルノイズ(Yノイズ)の悪影響を著しく増幅することができる。
Denoized Task Adaptation (DETA) は、既存のタスク適応アプローチに対して、最初に統合された画像とラベルをデノベートするフレームワークである。
論文 参考訳(メタデータ) (2023-03-11T05:23:20Z) - Boosting Low-Data Instance Segmentation by Unsupervised Pre-training
with Saliency Prompt [103.58323875748427]
この研究は、低データ体制のための新しい教師なし事前学習ソリューションを提供する。
近年のPrompting技術の成功に触発されて,QEISモデルを強化した新しい事前学習手法を導入する。
実験結果から,本手法は3つのデータセット上でのいくつかのQEISモデルを大幅に向上させることが示された。
論文 参考訳(メタデータ) (2023-02-02T15:49:03Z) - Activation to Saliency: Forming High-Quality Labels for Unsupervised
Salient Object Detection [54.92703325989853]
本稿では,高品質なサリエンシキューを効果的に生成する2段階アクティベーション・ツー・サリエンシ(A2S)フレームワークを提案する。
トレーニングプロセス全体において、私たちのフレームワークにヒューマンアノテーションは関与していません。
本フレームワークは,既存のUSOD法と比較して高い性能を示した。
論文 参考訳(メタデータ) (2021-12-07T11:54:06Z) - One-Shot Object Detection without Fine-Tuning [62.39210447209698]
本稿では,第1ステージのMatching-FCOSネットワークと第2ステージのStructure-Aware Relation Moduleからなる2段階モデルを提案する。
また,検出性能を効果的に向上する新たなトレーニング戦略を提案する。
提案手法は,複数のデータセット上で一貫した最先端のワンショット性能を上回る。
論文 参考訳(メタデータ) (2020-05-08T01:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。