論文の概要: VeriCam: A Verification Baseline for the Classification of Unknown Data
- arxiv url: http://arxiv.org/abs/2608.31107v2
- Date: Thu, 03 Sep 2026 20:14:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.430391
- Title: VeriCam: A Verification Baseline for the Classification of Unknown Data
- Title(参考訳): VeriCam: 未知データの分類のための検証ベースライン
- Abstract要約: 本研究では,未知のクラスを未知のデータに分類できる特殊な特徴を学習するためのパイプラインを提案する。
VeriCamは、検証タスクのためにトレーニングされた画像モデルの表現力を利用する。
パイプラインは、現実の交通監視画像を含むLPLCv2データセットで検証される。
- 参考スコア(独自算出の注目度): 1.3202178009901326
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The advent of foundation models have enabled a new era in zero-shot classification. Yet, key challenges persist. Despite their impressive generalization power that leverages the immense pre-training knowledge, both foundation models for image and text as well as vision-text hybrids lack the representational power needed for fine-grained, minutiae-based class separation that some real-world tasks require. To address the current gaps in the literature, we propose VeriCam, a pipeline designed to learn highly specialized features that enable classification of unknown classes in unseen data. VeriCam works by leveraging the representation power of image models trained for the verification task, where the model develops an intricate feature space that incorporates fine-grained details. By training a model to discriminate between pairs of images from the same and different classes, a relational graph is constructed, representing the class relationships between data points. We then present two approaches for graph clustering: a naive algorithm and a specific setup for the Leiden graph clustering algorithm. The pipeline is validated on the LPLCv2 dataset, which comprises real-world traffic surveillance images. We show that the dataset carries an inherent capture device bias that is posed as a generalization challenge for downstream License Plate recognition tasks such as OCR. As such, we dynamically identify capture devices with a label-agnostic approach, enabling the construction of a fair and unbiased benchmark. In the cross-device scenario, our pipeline reaches an F1-Score of 93.45 in the verification baseline and a V-Measure score of 80.13 in the clustering step. All code is publicly available at https://github.com/lmlwojcik/VeriCam
- Abstract(参考訳): 基礎モデルの出現はゼロショット分類の新しい時代を可能にした。
しかし、重要な課題は続く。
膨大な事前学習の知識を活用する、印象的な一般化力にもかかわらず、画像とテキストの基盤モデルと視覚テキストのハイブリッドは、いくつかの現実世界のタスクに必要な微細で微妙なクラス分離に必要な表現力に欠けています。
文献における現在のギャップを解決するために,未知のクラスを未知のデータに分類可能な,高度に専門的な特徴を学習するためのパイプラインであるVeriCamを提案する。
VeriCamは、検証タスクのために訓練された画像モデルの表現力を利用する。
同じクラスと異なるクラスの画像のペアを識別するモデルを訓練することにより、関係グラフを構築し、データポイント間のクラス関係を表現する。
次に、グラフクラスタリングのための2つのアプローチとして、単純アルゴリズムとライデングラフクラスタリングアルゴリズムの具体的設定を提案する。
パイプラインは、現実の交通監視画像を含むLPLCv2データセットで検証される。
このデータセットには固有のキャプチャデバイスバイアスがあり、OCRのような下流のライセンスプレート認識タスクの一般化課題として提起されている。
そのため、ラベルに依存しない方法でキャプチャデバイスを動的に識別し、公正で偏りのないベンチマークの構築を可能にする。
クロスデバイスシナリオでは、検証ベースラインではF1スコア93.45、クラスタリングステップではV-Measureスコア80.13に達する。
すべてのコードはhttps://github.com/lmlwojcik/VeriCamで公開されている。
関連論文リスト
- Dual-Primal Graph VAEs for Noisy Label Aggregation [0.0]
ノイズの多いクラウドソースラベルから根本的真実を推定することは重要な理論的・実践的な問題である。
本稿では,デコーダとエンコーダが,クラウドソースデータセットの隣接グラフ上でGATベースのメッセージパッシングを利用するグラフVAEアーキテクチャを提案する。
我々は,クラウドソーシングベンチマークにおいて,このモデルがアートパフォーマンスの状態を達成していることを示す。
論文 参考訳(メタデータ) (2026-08-11T22:24:16Z) - MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation [89.19760796832765]
MagicSeg"は、オープンワールドセマンティックセグメンテーションのニーズに合わせて自動的にデータセットを生成するパイプラインである。
PASCAL VOC, PASCAL Context, COCOを用いて, 62.9%, 26.7%, 40.2%の性能でSOTAを達成した。
論文 参考訳(メタデータ) (2026-03-20T02:37:38Z) - Heterogeneous LLM Methods for Ontology Learning (Few-Shot Prompting, Ensemble Typing, and Attention-Based Taxonomies) [46.54026795022501]
LLMs4OL 2025チャレンジのタスクA,B,Cに対処する包括的システムを提案する。
提案手法は、検索強化プロンプト、ゼロショット分類、アテンションに基づくグラフモデリングを組み合わせたものである。
これらのモジュラーでタスク固有のソリューションによって、公式のリーダーボードで上位の成果を得られるようになりました。
論文 参考訳(メタデータ) (2025-08-26T20:50:16Z) - Federated Contrastive Learning of Graph-Level Representations [10.092560681589577]
グラフレベルの表現(FCLG)の相互比較学習
本稿では,グラフレベル表現のFederated Contrastive Learning of Graph-level Representations(FCLG)と呼ぶ新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-18T22:10:31Z) - Towards General Visual-Linguistic Face Forgery Detection [95.73987327101143]
ディープフェイクは現実的な顔操作であり、セキュリティ、プライバシー、信頼に深刻な脅威をもたらす可能性がある。
既存の方法は、このタスクを、デジタルラベルまたはマスク信号を使用して検出モデルをトレーニングするバイナリ分類として扱う。
本稿では, 微粒な文レベルのプロンプトをアノテーションとして用いた, VLFFD (Visual-Linguistic Face Forgery Detection) という新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-07-31T10:22:33Z) - Learning Semi-supervised Gaussian Mixture Models for Generalized
Category Discovery [36.01459228175808]
本稿では,表現学習とクラス数推定を交互に行うEMライクなフレームワークを提案する。
汎用画像分類データセットと細粒度オブジェクト認識データセットの双方について,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2023-05-10T13:47:38Z) - Decoupled Multi-task Learning with Cyclical Self-Regulation for Face
Parsing [71.19528222206088]
顔解析のための周期的自己統制型デカップリング型マルチタスク学習を提案する。
具体的には、DML-CSRは、顔解析、バイナリエッジ、カテゴリエッジ検出を含むマルチタスクモデルを設計する。
提案手法は,Helen,CelebA-HQ,LapaMaskのデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2022-03-28T02:12:30Z) - ACTIVE:Augmentation-Free Graph Contrastive Learning for Partial
Multi-View Clustering [52.491074276133325]
部分的マルチビュークラスタリングの問題を解決するために,拡張自由グラフコントラスト学習フレームワークを提案する。
提案手法は、インスタンスレベルのコントラスト学習と欠落データ推論をクラスタレベルに高め、個々の欠落データがクラスタリングに与える影響を効果的に軽減する。
論文 参考訳(メタデータ) (2022-03-01T02:32:25Z) - Dynamic Relevance Learning for Few-Shot Object Detection [6.550840743803705]
動的グラフ畳み込みネットワーク(GCN)を構築するために,すべてのサポート画像とクエリ画像上の関心領域(RoI)の関係を利用した動的関連学習モデルを提案する。
提案モデルでは,より一般化された特徴の学習の有効性を示す総合的な性能が得られた。
論文 参考訳(メタデータ) (2021-08-04T18:29:42Z) - Graph Sampling Based Deep Metric Learning for Generalizable Person
Re-Identification [114.56752624945142]
我々は、最も一般的なランダムサンプリング手法である有名なpkサンプリングは、深層メトリック学習にとって有益で効率的ではないと主張する。
大規模計量学習のためのグラフサンプリング(GS)と呼ばれる効率的なミニバッチサンプリング手法を提案する。
論文 参考訳(メタデータ) (2021-04-04T06:44:15Z) - Spatial-spectral Hyperspectral Image Classification via Multiple Random
Anchor Graphs Ensemble Learning [88.60285937702304]
本稿では,複数のランダムアンカーグラフアンサンブル学習(RAGE)を用いた空間スペクトルHSI分類手法を提案する。
まず、各選択されたバンドのより記述的な特徴を抽出し、局所的な構造と領域の微妙な変化を保存するローカルバイナリパターンを採用する。
次に,アンカーグラフの構成に適応隣接代入を導入し,計算複雑性を低減した。
論文 参考訳(メタデータ) (2021-03-25T09:31:41Z) - Group-Wise Semantic Mining for Weakly Supervised Semantic Segmentation [49.90178055521207]
この研究は、画像レベルのアノテーションとピクセルレベルのセグメンテーションのギャップを埋めることを目標に、弱い監督されたセマンティックセグメンテーション(WSSS)に対処する。
画像群における意味的依存関係を明示的にモデル化し,より信頼性の高い擬似的基盤構造を推定する,新たなグループ学習タスクとしてWSSSを定式化する。
特に、入力画像がグラフノードとして表現されるグループ単位のセマンティックマイニングのためのグラフニューラルネットワーク(GNN)を考案する。
論文 参考訳(メタデータ) (2020-12-09T12:40:13Z) - High-Order Information Matters: Learning Relation and Topology for
Occluded Person Re-Identification [84.43394420267794]
本稿では,高次関係とトポロジ情報を識別的特徴とロバストなアライメントのために学習し,新しい枠組みを提案する。
我々のフレームワークはOccluded-Dukeデータセットで最先端の6.5%mAPスコアを大幅に上回っている。
論文 参考訳(メタデータ) (2020-03-18T12:18:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。