論文の概要: GL-MCM: Global and Local Maximum Concept Matching for Zero-Shot Out-of-Distribution Detection
- arxiv url: http://arxiv.org/abs/2304.04521v4
- Date: Tue, 21 Jan 2025 17:01:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-01-23 13:29:53.765422
- Title: GL-MCM: Global and Local Maximum Concept Matching for Zero-Shot Out-of-Distribution Detection
- Title(参考訳): GL-MCM:Zero-Shot Out-of-Distribution Detectionのための大域的および局所的最大概念マッチング
- Authors: Atsuyuki Miyai, Qing Yu, Go Irie, Kiyoharu Aizawa,
- Abstract要約: GL-MCM(Global-Local Maximum Concept Matching)を提案する。
GL-MCMは、局所的な画像スコアを補助スコアとして組み込んで、グローバルな視覚的特徴と局所的な視覚的特徴の分離性を高める。
ImageNetとマルチオブジェクトベンチマークの実験は、GL-MCMがベースラインゼロショット法より優れていることを示した。
- 参考スコア(独自算出の注目度): 34.208197494036085
- License:
- Abstract: Zero-shot out-of-distribution (OOD) detection is a task that detects OOD images during inference with only in-distribution (ID) class names. Existing methods assume ID images contain a single, centered object, and do not consider the more realistic multi-object scenarios, where both ID and OOD objects are present. To meet the needs of many users, the detection method must have the flexibility to adapt the type of ID images. To this end, we present Global-Local Maximum Concept Matching (GL-MCM), which incorporates local image scores as an auxiliary score to enhance the separability of global and local visual features. Due to the simple ensemble score function design, GL-MCM can control the type of ID images with a single weight parameter. Experiments on ImageNet and multi-object benchmarks demonstrate that GL-MCM outperforms baseline zero-shot methods and is comparable to fully supervised methods. Furthermore, GL-MCM offers strong flexibility in adjusting the target type of ID images. The code is available via https://github.com/AtsuMiyai/GL-MCM.
- Abstract(参考訳): Zero-shot out-of-distribution (OOD) 検出は、in-distribution (ID)クラス名のみによる推論中にOODイメージを検出するタスクである。
既存の手法では、IDイメージには単一の中心オブジェクトが含まれており、IDオブジェクトとOODオブジェクトの両方が存在するような、より現実的なマルチオブジェクトシナリオを考慮していないと仮定している。
多くのユーザのニーズを満たすため、検出方法はID画像の種類に適応する柔軟性を持つ必要がある。
この目的のために,局所画像スコアをアセプションスコアとして組み込んだGL-MCM(Global-Local Maximum Concept Matching)を提案する。
単純なアンサンブルスコア関数の設計のため、GL-MCMは単一の重みパラメータでID画像の種類を制御できる。
ImageNetとマルチオブジェクトベンチマークの実験では、GL-MCMはベースラインゼロショット法よりも優れており、完全に教師された手法に匹敵する。
さらに、GL-MCMはターゲットのID画像の調整に強い柔軟性を提供する。
コードはhttps://github.com/AtsuMiyai/GL-MCMから入手できる。
関連論文リスト
- MMO-IG: Multi-Class and Multi-Scale Object Image Generation for Remote Sensing [12.491684385808902]
MMO-IGは、グローバルな面とローカルな面から、教師付きオブジェクトラベルでRS画像を生成するように設計されている。
MMO間の複雑な相互依存性を考慮すると、空間的相互依存知識グラフを構築する。
MMO-IGは、高密度なMMO教師付きラベルを持つRS画像に対して優れた生成能力を示す。
論文 参考訳(メタデータ) (2024-12-18T10:19:12Z) - EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM [38.8308841469793]
本稿では,複数の参照画像とテキストプロンプトに拡散モデルを条件付けできる新しいプラグイン・アンド・プレイ適応手法であるEasyRefを紹介する。
我々は,マルチモーダル大言語モデル(MLLM)のマルチモーダル理解と命令追従機能を活用し,複数の画像内の一貫した視覚的要素を利用する。
実験の結果、EasyRefはIP-Adapterのようなチューニング不要の手法とLoRAのようなチューニングベース手法の両方を超越し、様々な領域で優れた美的品質と堅牢なゼロショットの一般化を実現している。
論文 参考訳(メタデータ) (2024-12-12T18:59:48Z) - OSMLoc: Single Image-Based Visual Localization in OpenStreetMap with Geometric and Semantic Guidances [11.085165252259042]
OSMLocは、脳にインスパイアされた単一画像の視覚的位置決め手法であり、精度、堅牢性、一般化能力を改善するための意味的および幾何学的ガイダンスを備えている。
提案したOSMLOCを検証するため,世界規模のクロスエリアとクロスコンディション(CC)のベンチマークを収集し,広範な評価を行う。
論文 参考訳(メタデータ) (2024-11-13T14:59:00Z) - Large Language Models for Multimodal Deformable Image Registration [50.91473745610945]
そこで本研究では,様々な医用画像からの深い特徴の整合を図るために,新しい粗いMDIRフレームワークLLM-Morphを提案する。
具体的には、まずCNNエンコーダを用いて、クロスモーダル画像ペアから深い視覚的特徴を抽出し、次に、最初のアダプタを使ってこれらのトークンを調整する。
第3に、トークンのアライメントのために、他の4つのアダプタを使用して、LLM符号化トークンをマルチスケールの視覚特徴に変換し、マルチスケールの変形場を生成し、粗いMDIRタスクを容易にする。
論文 参考訳(メタデータ) (2024-08-20T09:58:30Z) - INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model [71.50973774576431]
本稿では,高解像度画像認識のための新しいMLLM INF-LLaVAを提案する。
我々はDCM(Dual-perspective Cropping Module)を導入し、各サブイメージが局所的な視点から連続的な詳細を含むことを保証する。
第2に,グローバルな特徴と局所的な特徴の相互強化を可能にするDEM(Dual-perspective Enhancement Module)を導入する。
論文 参考訳(メタデータ) (2024-07-23T06:02:30Z) - From Global to Local: Multi-scale Out-of-distribution Detection [129.37607313927458]
アウト・オブ・ディストリビューション(OOD)検出は、イン・ディストリビューション(ID)トレーニングプロセス中にラベルが見られない未知のデータを検出することを目的としている。
近年の表現学習の進歩により,距離に基づくOOD検出がもたらされる。
グローバルな視覚情報と局所的な情報の両方を活用する第1のフレームワークであるマルチスケールOOD検出(MODE)を提案する。
論文 参考訳(メタデータ) (2023-08-20T11:56:25Z) - Coarse-to-Fine: Learning Compact Discriminative Representation for
Single-Stage Image Retrieval [11.696941841000985]
検索と参照のパラダイムに従う2段階の手法は優れた性能を達成しているが、それぞれのローカルモジュールとグローバルモジュールは現実世界のアプリケーションでは非効率である。
本稿では,重要な局所記述子を注意深く選択し,大域的な表現に微粒な意味関係を注入する機構を提案する。
提案手法は,Revisited OxfordやRevisited Parisなどのベンチマークを用いて,最先端の単一ステージ画像検索性能を実現する。
論文 参考訳(メタデータ) (2023-08-08T03:06:10Z) - Adaptive Graph Convolution Module for Salient Object Detection [7.278033100480174]
本稿では,複雑なシーンを扱うための適応型グラフ畳み込みモジュール(AGCM)を提案する。
学習可能な領域生成層を用いて入力画像からプロトタイプ特徴を抽出する。
提案したAGCMは,SOD性能を定量的かつ定量的に劇的に向上させる。
論文 参考訳(メタデータ) (2023-03-17T07:07:17Z) - Multi-Content Complementation Network for Salient Object Detection in
Optical Remote Sensing Images [108.79667788962425]
光リモートセンシング画像(RSI-SOD)における有能な物体検出は、いまだに課題である。
本稿では, RSI-SOD における複数コンテンツの相補性を検討するために, MCCNet (Multi-Content Complementation Network) を提案する。
MCCMでは、前景機能、エッジ機能、背景機能、グローバル画像レベル機能など、RSI-SODにとって重要な複数の機能について検討する。
論文 参考訳(メタデータ) (2021-12-02T04:46:40Z) - Boosting Few-shot Semantic Segmentation with Transformers [81.43459055197435]
TRansformer-based Few-shot Semantic segmentation Method (TRFS)
我々のモデルは,グローバル・エンハンスメント・モジュール(GEM)とローカル・エンハンスメント・モジュール(LEM)の2つのモジュールから構成される。
論文 参考訳(メタデータ) (2021-08-04T20:09:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。