論文の概要: Where Does the Semantic Gain Come From? A Reproduction and Extension of Semantic Knowledge-driven Contrastive Learning for Long-Tailed Recognition
- arxiv url: http://arxiv.org/abs/2610.04104v1
- Date: Fri, 02 Oct 2026 22:17:47 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:42:09.236988
- Title: Where Does the Semantic Gain Come From? A Reproduction and Extension of Semantic Knowledge-driven Contrastive Learning for Long-Tailed Recognition
- Title(参考訳): セマンティック・ゲインはどこから来るのか : セマンティック・ナレッジ駆動型コントラスト学習の再現と拡張
- Abstract要約: Semantic Knowledge-driven Contrastive Learning (SKCL)は、言語モデルを用いてどのクラスが関連しているかを決定し、各イメージをセマンティックな隣人に向けてプルする。
CIFAR-100-LT では、54.02% のトップ-1 の正確さが報告されており、BCL (Ba balanced Contrastive Learning) よりも2.01ポイント高い。
私はSKCL、BCL、ConCutMixを1つのフレームワークで再実装し、公開ベースラインコードでチェックし、3つのシードですべての設定を実行します。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: Semantic Knowledge-driven Contrastive Learning (SKCL) uses a language model to decide which classes are related, and pulls each image towards the prototypes of its semantic neighbours. On CIFAR-100-LT (beta = 100) it reports 54.02% top-1 accuracy, 2.01 points above Balanced Contrastive Learning (BCL), the method it builds on. The code and the class descriptions are not public. I reimplement SKCL, BCL and ConCutMix in one framework, check it against the public baseline code, and run every configuration with three seeds. The two baselines reproduce within 1.5 points, but SKCL built on BCL, as the paper describes it, ends up 0.56 points below BCL. To find out why, I add SKCL to the authors' own ConCutMix code. Trained for the paper's 300 epochs, it reaches 53.69, only 0.33 below the published number. At the same budget, however, the semantic graph adds just 0.23 points over ConCutMix, while training ConCutMix for 100 more epochs adds 1.04. Together with ConCutMix's published lead over BCL (1.15), this explains the claimed gain. A BCL model that never sees the graph already shares 41.2% of the graph's top-2 neighbours with its own most-confused classes (2.0% by chance), which shows why the graph adds so little on these benchmarks. I also test several changes to SKCL. Combining it with the CutMix branch improves it by 1.06 points, and an adaptive version of the graph improves it slightly (+0.34 and +0.28 in two codebases), although these gains are within seed noise.
- Abstract(参考訳): Semantic Knowledge-driven Contrastive Learning (SKCL)は、言語モデルを用いてどのクラスが関連しているかを決定し、各イメージをそのセマンティックな隣人のプロトタイプに向けてプルする。
CIFAR-100-LT (beta = 100)では54.02%のトップ1の精度で、BCL(Ba balanced Contrastive Learning)より2.01ポイント高い。
コードとクラス記述は公開されていない。
私はSKCL、BCL、ConCutMixを1つのフレームワークで再実装し、公開ベースラインコードでチェックし、3つのシードですべての設定を実行します。
2つのベースラインは1.5点以内で再現されるが、BCL上に構築されたSKCLは、論文で説明されているように、BCLより0.56点低い。
理由を見つけるために、著者自身のConCutMixコードにSKCLを追加します。
紙の300エポックのために訓練され、53.69であり、公表された数字よりわずか0.33低い。
しかし、同じ予算で、セマンティックグラフはConCutMixにわずか0.23ポイント、さらに100のエポックでConCutMixをトレーニングすると1.04になる。
ConCutMix の BCL (1.15) に対するリードの公表とともに、これは主張される利益を説明する。
グラフを決して見ることのないBCLモデルは、グラフの上位2つの近隣の41.2%を、自身の最も確信されたクラス(偶然に2.0%)と共有している。
SKCLの変更もいくつかテストしています。
CutMixブランチと組み合わせることで1.06ポイント向上し、グラフの適応バージョンでは2つのコードベースで+0.34と+0.28)わずかに改善されている。
関連論文リスト
- CurveCodec 2: Skeleton-agnostic animation compression with a learned entropy model [27.862690416195083]
骨格運動は全てのフレームで全ての関節の変形として保存されるが、ほとんどは身体によって暗示される。
CurveCodec 2は、すべてのサブトラックをログマップの曲線としてコードし、クローズドループで量子化し、レート歪み選択キーに薄めている。
ネットワークは、送信する残余の分布を学習する。
論文 参考訳(メタデータ) (2026-10-03T01:54:18Z) - Half-Truths Break Similarity-Based Retrieval [21.70058524831519]
テキスト記述が追加の詳細で拡張されると、その詳細が間違っている場合は、画像とテキストの類似性が低下する。
CLIPスタイルのデュアルエンコーダはこの直観に反することが多い。
本稿では,キャプションをエンティティとリレーショナルユニットに分解するCS-CLIPを提案する。
論文 参考訳(メタデータ) (2026-02-27T10:56:31Z) - TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives [65.82577305915643]
Contrastive Language-Image Pretraining (CLIP) モデルは、表現を学ぶためにテキストと視覚的モダリティ間の相互情報を最大化する。
そこで本研究では,テキスト・ツー・イメージ・ジェネレータを用いて,文脈内学習による「ハード」の負の字幕生成と,それに対応する負のイメージ生成が解となることを示す。
提案手法はTripletCLIPと呼ばれ,CLIPの構成能力を向上し,SugarCrepeベンチマークでは9%以上向上した。
論文 参考訳(メタデータ) (2024-11-04T19:24:59Z) - Decoupled Contrastive Learning for Long-Tailed Recognition [58.255966442426484]
Supervised Contrastive Loss (SCL) は視覚表現学習で人気がある。
ロングテール認識のシナリオでは、各クラスのサンプル数が不均衡である場合、2種類の正のサンプルを同じように扱うと、カテゴリー内距離に対するバイアス最適化が導かれる。
そこで我々は,尾級の低表現を緩和するために,頭級から尾級へ知識を伝達するためのパッチベースの自己蒸留法を提案する。
論文 参考訳(メタデータ) (2024-03-10T09:46:28Z) - CLIP-KD: An Empirical Study of CLIP Model Distillation [24.52910358842176]
本稿では,大規模教師CLIPモデルによって指導される小型CLIPモデルを蒸留することを目的とする。
Mean Squared Error損失による単純な機能模倣が驚くほどうまく機能することを示す。
教師と生徒のエンコーダ間の対話的コントラスト学習は、性能向上にも有効である。
論文 参考訳(メタデータ) (2023-07-24T12:24:07Z) - HomoGCL: Rethinking Homophily in Graph Contrastive Learning [64.85392028383164]
HomoGCL はモデルに依存しないフレームワークで、近隣のノードに固有の意味を持つ正の集合を拡大する。
我々は、HomoGCLが6つの公開データセットにまたがって複数の最先端結果をもたらすことを示す。
論文 参考訳(メタデータ) (2023-06-16T04:06:52Z) - Graph Contrastive Learning for Skeleton-based Action Recognition [85.86820157810213]
骨格に基づく行動認識のためのグラフコントラスト学習フレームワークを提案する。
SkeletonGCLは、グラフをクラス識別に強制することで、シーケンス間のグラフ学習を関連付ける。
SkeletonGCLは新しいトレーニングパラダイムを確立し、現在のグラフ畳み込みネットワークにシームレスに組み込むことができる。
論文 参考訳(メタデータ) (2023-01-26T02:09:16Z) - Attentive Mask CLIP [48.206857783966996]
テキスト記述に高い意味的相関を持つトークンを保持するCLIPトレーニングのための注意的トークン除去手法を提案する。
提案手法は、ImageNet-1Kゼロショット分類で43.9%の精度、62.7/42.1ドルの精度、38.0/23.2ドルのI2T/T2I検索精度を実現している。
論文 参考訳(メタデータ) (2022-12-16T18:59:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。