論文の概要: Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training
- arxiv url: http://arxiv.org/abs/2607.20238v1
- Date: Wed, 22 Jul 2026 14:59:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.119599
- Title: Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training
- Title(参考訳): すべてのパッチが同等ではない - 可視赤外事前トレーニングのためのサンプリング項目
- Authors: Qiwei Ma, Bin Deng, Junjie Zhu, Qiangjuan Huang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li,
- Abstract要約: Importance-Aware Smplingは、パッチの信頼性に基づいてトレーニングの重点を調整します。
複数のVIS-IRベンチマークの実験では、強いベースラインよりも一貫した改善が示されている。
- 参考スコア(独自算出の注目度): 44.905875663301515
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visible-infrared (VIS-IR) alignment is a key pre-training task for robust multi-sensor perception. Most existing methods use uniform patch-wise contrastive learning, but this can be unreliable in VIS-IR data because imaging-physics differences make some spatially paired regions inherently less comparable, and aligning them with equal strength hinders representation learning and downstream transfer. In this paper, we revisit VIS-IR pre-training from a sampling perspective and propose Importance-Aware Sampling (IAS), which adjusts training emphasis based on patch reliability. Specifically, IAS (i) derives patch weights from infrared structural cues and uses them to reweight the contrastive objective; (ii) learns a soft importance mask with a lightweight sampler, optionally warm-started from the hand-crafted prior; and (iii) employs a patch curriculum learning strategy that gradually expands from high-reliability regions to harder patches. It is worth noting that IAS is plug-and-play and works with both patch-/correlation-level alignment (e.g., UNIV-style) and image-level contrastive baselines (e.g., ImageBind-style). Extensive experiments on multiple VIS-IR benchmarks demonstrate consistent improvements over strong baselines, including for IR semantic segmentation, IR object detection and VIS semantic segmentation and cross-modal retrieval task. Code will be released on https://github.com/KlayMa527/IAS.
- Abstract(参考訳): 可視赤外アライメント(VIS-IR)は、堅牢なマルチセンサー知覚のためのトレーニング前タスクである。
既存のほとんどの手法ではパッチワイドコントラスト学習を使用しているが、画像と物理の差異によって空間的にペアリングされた領域が本質的に比較しにくくなるため、VIS-IRデータでは信頼性が低い。
本稿では、サンプリングの観点からVIS-IR事前トレーニングを見直し、パッチの信頼性に基づいてトレーニングの重点を調整したImportance-Aware Sampling (IAS)を提案する。
特にIAS
一 赤外線構造的手がかりからパッチウェイトを導き、これを用いて、対照的な目的を重み付けする。
(二)手作り前から任意にウォームスタートした軽量のサンプリング機で柔らかい重要マスクを学ぶこと。
(iii) 信頼性の高い領域からより難しいパッチへ徐々に拡大するパッチカリキュラム学習戦略を採用する。
IASはプラグ&プレイであり、パッチ/相関レベルのアライメント(例:UNIVスタイル)と画像レベルのコントラストベースライン(例:ImageBindスタイル)の両方で動作する。
複数のVIS-IRベンチマークに対する大規模な実験では、IRセマンティックセグメンテーション、IRオブジェクト検出、VISセマンティックセグメンテーション、クロスモーダル検索タスクなど、強力なベースラインよりも一貫した改善が示されている。
コードはhttps://github.com/KlayMa527/IASでリリースされる。
関連論文リスト
- Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning [45.2217589644315]
PointGoalナビゲーションにおける視覚表現学習のためのセンサ誘導適応型コントラスト学習フレームワークを提案する。
トレーニング中、特権付きLiDARセンシングは、幾何学的類似度メトリックと適応温度スケーリングを通じて、対照的な目標を導出する。
得られたエンコーダは、独立して事前訓練され、凍結され、強化学習のバックボーンとして使用される。
論文 参考訳(メタデータ) (2026-06-03T23:15:50Z) - Exposing Vulnerabilities in Visible-Infrared VLMs: A Unified Geometric Adversarial Framework with Cross-Task Transferability [11.461885964494199]
視覚言語モデル(VLM)は多様なマルチモーダルタスクにおいて高い性能を達成しているが、視覚赤外線(VIS-IR)のシナリオにおけるその逆の堅牢性はいまだ未定である。
そこで我々は,VIS-IR VLM 攻撃のための曲面エッジフラクタル幾何対角パッチフレームワーク CFGPatch を提案する。
論文 参考訳(メタデータ) (2026-05-21T10:15:58Z) - Multi-Sensor Matching with HyperNetworks [14.911092205861822]
ハイパーネットワークを活用し、マルチモーダルパッチマッチングを改善します。
本稿では,Siamese CNNを拡張した軽量な記述型学習アーキテクチャを提案する。
また、500Kペアのクロスプラットフォーム(地上/空中)VIS-IRパッチデータセットであるGAP-VIRをリリースしています。
論文 参考訳(メタデータ) (2026-01-18T09:19:33Z) - PANICL: Mitigating Over-Reliance on Single Prompt in Visual In-Context Learning [38.70994263844236]
Visual In-Context Learning (VICL) は、インコンテキストペア(または例)と呼ばれる入力出力イメージペアを使用して、多様な視覚タスクの実行においてモデルをガイドするクエリイメージと併用する。
VICLは、単一のコンテキスト内のペアに対する過度な信頼性に悩まされることが多く、バイアスや不安定な予測につながることがある。
我々は、複数のコンテキスト内ペアを活用することでこの問題を緩和する一般的なトレーニング不要のフレームワークである、PAtchベースの$k$-Nearestのビジュアル・インコンテキスト・ラーニング(PANICL)を紹介した。
論文 参考訳(メタデータ) (2025-09-26T06:13:40Z) - FreRA: A Frequency-Refined Augmentation for Contrastive Learning on Time Series Classification [56.925103708982164]
周波数領域からの新たな視点を示し、ダウンストリーム分類の利点として、グローバル、独立、コンパクトの3つを識別する。
本稿では,分類タスクにおける時系列のコントラスト学習に適した,軽量で効果的な周波数補充拡張(FreRA)を提案する。
FreRAは、時系列分類、異常検出、転送学習タスクにおいて、常に10つの主要なベースラインを上回ります。
論文 参考訳(メタデータ) (2025-05-29T07:18:28Z) - Multi-Domain Biometric Recognition using Body Embeddings [51.36007967653781]
身体埋め込みは中波長赤外線(MWIR)領域と長波長赤外線(LWIR)領域の顔埋め込みよりも優れていた。
我々は、IJB-MDFデータセット上でのベンチマーク結果を確立するために、ビジョントランスフォーマーアーキテクチャを活用している。
また, クロスエントロピーとトリプルト損失の単純な組み合わせで, VISデータにのみ事前訓練された体モデルを微調整することで, 最先端のmAPスコアが得られることを示す。
論文 参考訳(メタデータ) (2025-03-13T22:38:18Z) - IV-tuning: Parameter-Efficient Transfer Learning for Infrared-Visible Tasks [57.940401122426664]
完全な微調整のパラダイムの下では、特徴空間は高度に制約され、低ランクとなり、これは深刻な一般化を損なうことが証明されている。
本稿では,主観的オブジェクト検出,セマンティックセグメンテーション,オブジェクト検出など,様々なIR-VIS下流タスクにPVMをパラメータ効率よく活用するIV-tuningを提案する。
完全な微調整ベースラインと既存のIR-VIS法と比較して、IV-tuningは、バックボーンパラメータの3%未満で、赤外線と可視光の相補的な情報の学習を容易にする。
論文 参考訳(メタデータ) (2024-12-21T14:54:41Z) - Exploring Text-Guided Single Image Editing for Remote Sensing Images [30.66938568608091]
本稿では,テキストガイドによるRSI編集手法を提案する。
大規模なベンチマークのトレーニングを必要とせずに一貫性を維持するために、マルチスケールのトレーニングアプローチが採用されている。
提案手法は,既存の手法と比較して,CLIPスコアと主観評価の両方に有意な利点をもたらす。
論文 参考訳(メタデータ) (2024-05-09T13:45:04Z) - Self-Promoted Supervision for Few-Shot Transformer [178.52948452353834]
SUN(Self-promoted sUpervisioN)は視覚変換器(ViT)のための数発の学習フレームワークである
SUNは、数ショットの学習データセットでViTを事前トレーニングし、各パッチトークンを導くために、個別のロケーション固有の監視を生成する。
実験によると、ViTを使ったSUNは、ViTを使った他の数発の学習フレームワークを大幅に上回っており、CNNの最先端技術よりも高いパフォーマンスを実現している。
論文 参考訳(メタデータ) (2022-03-14T12:53:27Z) - Dense Label Encoding for Boundary Discontinuity Free Rotation Detection [69.75559390700887]
本稿では,分類に基づく比較的研究の少ない方法論について検討する。
我々は2つの側面でフロンティアを推し進めるための新しい手法を提案する。
航空画像のための大規模公開データセットの実験と視覚解析は,我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2020-11-19T05:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。