論文の概要: OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection
- arxiv url: http://arxiv.org/abs/2608.30247v1
- Date: Mon, 31 Aug 2026 04:57:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.236631
- Title: OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection
- Title(参考訳): OPUS: オープン語彙検出のためのシンプルで効果的な統一フレームワーク
- Authors: Xiaoyan Wei, Zhimin Yao, Ruilin Yang, Wei Zhang, Yong Dai, Yi Zhang, Wei Ge,
- Abstract要約: 本稿では,テキスト,インタラクティブ視覚,ジェネリックビジュアル,混合プロンプトをサポートする統一型検出器OPUSについて述べる。
OPUSは最先端のVisual-I性能を実現し、68.1/69.2/54.7 APに到達し、バランスの取れたテキストとVisual-Gの精度を維持した。
- 参考スコア(独自算出の注目度): 9.87006529425909
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent unified open-vocabulary detection (OVD) supports heterogeneous prompts, including text queries, visual exemplars, and their combinations, but often rely on increasingly complex designs such as heavy cross-modal fusion, staged training, and iterative annotation pipelines. We revisit whether such complexity is necessary in the era of stronger foundation models. Our finding is that unified OVD can be made substantially simpler with semantic-rich visual representations and scalable grounding supervision. We present OPUS (\textbf{O}pen-vocabulary, \textbf{P}rompt-\textbf{U}nified, \textbf{S}imple), a unified detector supporting text, interactive visual, generic visual, and mixed prompting within one framework. OPUS adopts a simple three-part design. Its model architecture combines a semantic-rich visual encoder, built on a DINOv3-ConvNeXt-B backbone with efficient hybrid encoding, with a prompt-aware decoder that avoids prompt-specific branches for unified prompt reasoning. OPUS is trained with a one-stage text-visual training strategy with Instance-level Contrastive Alignment (ICA), and is supported by a SAM3-based single-pass data engine for heterogeneous grounding supervision. Experiments on COCO, LVIS-minival, and ODinW35 show that OPUS achieves state-of-the-art Visual-I performance, reaching 68.1/69.2/54.7 AP, while maintaining balanced Text and Visual-G accuracy. OPUS also turns mixed prompting from interference into complementarity, improving over text or visual prompt alone. These results show that simplicity and strong unified prompting capability can be achieved together.
- Abstract(参考訳): 最近の統一オープン語彙検出(OVD)は、テキストクエリ、視覚的例、およびそれらの組み合わせを含む不均一なプロンプトをサポートするが、しばしば重いクロスモーダル融合、ステージドトレーニング、反復アノテーションパイプラインのような、ますます複雑な設計に依存している。
このような複雑さが、より強力な基礎モデルの時代に必要かどうかを再考する。
我々の発見によれば、OVDの統一化は、意味豊かな視覚表現とスケーラブルな接地管理により、大幅に単純化できる。
OPUS(\textbf{O}pen-vocabulary, \textbf{P}rompt-\textbf{U}nified, \textbf{S}imple)は、テキスト、インタラクティブビジュアル、ジェネリックビジュアル、混合プロンプトをサポートする統一検出器である。
OPUSは単純な3部構成を採用している。
モデルアーキテクチャは、DINOv3-ConvNeXt-Bのバックボーン上に構築されたセマンティックリッチなビジュアルエンコーダと、プロンプト対応のデコーダを組み合わせて、統一されたプロンプト推論のためにプロンプト固有のブランチを避ける。
OPUSは、インスタンスレベルのContrastive Alignment(ICA)を使用して、一段階のテキスト視覚トレーニング戦略でトレーニングされており、ヘテロジニアスグラウンド管理のためのSAM3ベースのシングルパスデータエンジンによってサポートされている。
COCO、LVIS-minival、ODinW35の実験により、OPUSは最先端のVisual-Iのパフォーマンスを達成し、68.1/69.2/54.7 APに達し、バランスの取れたテキストとVisual-Gの精度を維持した。
OPUSはまた、干渉から混ざったプロンプトを相補性に変え、テキストや視覚的プロンプトよりも改善する。
これらの結果は、シンプルで強力な統一的なプロンプト機能を実現することができることを示している。
関連論文リスト
- VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection [12.835071167163607]
VirProは適応型マルチモーダル事前トレーニングパラダイムであり、様々な弱い教師付き単分子3D検出フレームワークにシームレスに統合することができる。
我々は、さまざまな学習可能なインスタンス条件のプロンプトを生成し、それらをAPB(Adaptive Prompt Bank)に格納する。
論文 参考訳(メタデータ) (2026-03-18T08:23:55Z) - Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models [57.357091028792325]
ウェブスケールのデータに基づいて事前訓練された視覚言語モデル(VLM)は、ゼロショットの一般化を約束するが、しばしば意味的ミスアライメントに悩まされる。
視覚・テクストアライメントを改善するために,制約付きプロンプトエンハンスメント(CPE)法を提案する。
提案手法はTGSSG(Topology-Guided Synonymous Semantic Generation)とCADRS(Calegory-Agnostic Discriminative Region Selection)の2つの重要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-08-24T15:45:22Z) - Text-guided Visual Prompt DINO for Generic Segmentation [31.33676182634522]
テキスト誘導型ビジュアルプロンプトDINOフレームワークであるPrompt-DINOを提案する。
まず、テキスト/視覚的プロンプトとバックボーン機能を統一する早期融合機構を導入する。
第二に、DreTRアーキテクチャの順序整合クエリ選択を設計する。
第3に,PR(Prompting, Prompting, Prompting, RAP)モデルによる認識情報を利用した生成データエンジンを開発する。
論文 参考訳(メタデータ) (2025-08-08T09:09:30Z) - ConText: Driving In-context Learning for Text Removal and Segmentation [59.6299939669307]
本稿では,視覚的インコンテキスト学習パラダイムを光学的文字認識タスクに適用する最初の研究について述べる。
画像除去・分離方式のタスクチェイン・コンポジトリを提案する。
また、連鎖したプロンプトパターンを潜在クエリ表現に統合するコンテキスト認識アグリゲーションも導入する。
論文 参考訳(メタデータ) (2025-06-04T10:06:32Z) - Sequential Visual and Semantic Consistency for Semi-supervised Text
Recognition [56.968108142307976]
Scene Text Recognition (STR) は、大規模なアノテートデータを必要とする課題である。
既存のSTR法の多くは、STRモデルの性能を低下させ、ドメイン差を生じさせる合成データに頼っている。
本稿では,視覚的・意味的両面から単語レベルの整合性正則化を取り入れたSTRの半教師付き学習手法を提案する。
論文 参考訳(メタデータ) (2024-02-24T13:00:54Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model [55.321010757641524]
CLIP4STRは,CLIPのイメージエンコーダとテキストエンコーダ上に構築された,シンプルで効果的なSTRメソッドである。
モデルサイズ、事前トレーニングデータ、トレーニングデータの観点からCLIP4STRをスケールし、13のSTRベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-05-23T12:51:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。