論文の概要: Mirror-Fusion Attention for Reflection-Aware Self-Supervised Representation Learning
- arxiv url: http://arxiv.org/abs/2607.00850v1
- Date: Wed, 01 Jul 2026 12:16:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.885535
- Title: Mirror-Fusion Attention for Reflection-Aware Self-Supervised Representation Learning
- Title(参考訳): 反射を考慮した自己監督型表現学習のためのミラーフュージョンアテンション
- Abstract要約: Mirror-Fusion-Augmented Self-Supervised Learning (MFASSL)は、標準SSLの前にソフトリフレクションを注入するビジョントランスフォーマーフレームワークである。
MFASSLは、推定対称性軸に沿ったミラーペアビューを構築し、軽量ミラーフュージョンアテンション(MFA)モジュールを導入する。
- 参考スコア(独自算出の注目度): 5.016334858905707
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most self-supervised learning (SSL) methods encourage invariance across augmentations, but strict flip invariance can suppress informative left--right correspondences in approximately bilateral data such as medical images and human faces. We propose Mirror-Fusion-Augmented Self-Supervised Learning (MFASSL), a Vision Transformer framework that injects a soft reflection prior into standard SSL without redesigning the backbone. MFASSL constructs mirror-paired views aligned to an estimated symmetry axis and introduces a lightweight Mirror-Fusion Attention (MFA) module for adaptive token-level interaction between mirrored regions while preserving asymmetric cues. The base SSL objective is further coupled with reflection-consistency and mid-layer token-alignment losses. Across CheXpert, BraTS, CelebA-HQ, and WFLW, MFASSL improves downstream performance, calibration, and reflection robustness over MoCo-v3, DINO, and MAE baselines under matched ViT-B/16 settings. It also achieves stronger and more consistent gains than recent equivariant SSL approaches with only approximately 2.7\% additional parameters. These results show that lightweight geometry-aware priors can effectively complement invariance-based SSL.
- Abstract(参考訳): ほとんどの自己教師付き学習(SSL)法は、増大する範囲での不変性を奨励するが、厳密なフリップ不変性は、医療画像や人間の顔など、ほぼ双方向のデータにおける情報的左右対応を抑えることができる。
バックボーンを再設計することなく,標準SSLにソフトリフレクションを注入するビジョントランスフォーマフレームワークであるMFASSLを提案する。
MFASSLは、推定対称性軸に整列したミラーペアビューを構築し、非対称なキューを保持しながらミラー領域間の適応トークンレベル相互作用のための軽量ミラーフュージョンアテンション(MFA)モジュールを導入する。
SSLの基本目標は、リフレクション一貫性と中間層トークンアライメント損失とさらに結合している。
CheXpert、BraTS、CelebA-HQ、WFLWの他、MFASSLは、VT-B/16設定でのMoCo-v3、DINO、MAEベースラインのダウンストリーム性能、キャリブレーション、リフレクションロバスト性を改善している。
また、約2.7\%の追加パラメータしか持たない最近の同変SSLアプローチよりも強く一貫性のあるゲインを達成する。
これらの結果は、軽量な幾何学的事前認識が分散ベースのSSLを効果的に補完できることを示唆している。
関連論文リスト
- Geometry-Aware Contrastive Learning for Few-Shot Automatic Modulation Recognition [5.310289270050359]
Dynamic-Adaptive Contrastive Learning (DyCo-CL)は、Virtual Adrialversa Augmentation(VAA)とセマンティック一貫性の損失を結合した幾何学的フレームワークである。
DyCo-CLは1ショット設定での精度が6.27%向上した。
論文 参考訳(メタデータ) (2026-05-26T06:33:57Z) - Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control [10.639649058223114]
Reflexは、オン・ポリティクスとオフ・ポリティクスのRLアルゴリズムの両方とシームレスに統合するパラダイムである。
対称性を保存する最適値関数とポリシーの理論解析に基づいて、Reflexはリフレクション対称性をポリシー学習に統合する。
我々はReflexをPPOとSACと統合し、OpenAI GymとDeepMind Controlベンチマークのスイートで評価する。
論文 参考訳(メタデータ) (2026-05-22T09:24:44Z) - MirrorLA: Reflecting Feature Map for Vision Linear Attention [49.41670925034762]
リニアアテンションはトランスフォーマーの2次から線形への計算複雑性を著しく低下させるが、パフォーマンスにおけるソフトマックスに基づくアテンションの遅れは一貫して遅れる。
我々は、受動トランケーションをアクティブなリオリエンテーションに置き換える幾何学的枠組みであるMirrorLAを提案する。
MirrorLAは標準的なベンチマークで最先端のパフォーマンスを実現し、表現の忠実さを損なうことなく厳密な線形効率を実現できることを示した。
論文 参考訳(メタデータ) (2026-02-04T09:14:09Z) - Feature-Space Adversarial Robustness Certification for Multimodal Large Language Models [59.6491828112519]
MLLM(Multimodal large language model)は、様々なアプリケーションにまたがる強力な機能を示す。
MLLMは、その特徴表現を歪め、誤った予測を誘発する敵の摂動に弱い。
本稿では,MLLMの特徴表現レベルにおいて,信頼性の高いロバスト性保証を提供する汎用フレームワークであるFeature-space Smoothing(FS)を提案する。
論文 参考訳(メタデータ) (2026-01-22T18:52:21Z) - Enhancing CLIP Robustness via Cross-Modality Alignment [54.01929554563447]
視覚言語モデルのための最適なトランスポートベースフレームワークであるクロスモダリティアライメントを提案する。
COLAは、グローバルな画像テキストアライメントと特徴空間における局所的な構造的一貫性を復元する。
COLAはトレーニングフリーで、既存の微調整モデルと互換性がある。
論文 参考訳(メタデータ) (2025-10-28T03:47:44Z) - MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding [23.96717124380285]
MergeMixは、SFTとRLを橋渡しするトレーニング時間拡張パラダイムである。
まず、トークンマージによる注意認識画像の混合と、より多くのクラスタ表現と空間コンテキストを適用する。
次に、MLLMに対して、画像と生画像の混合による選好ペアの構築と、SimPO損失による最適化により、嗜好駆動トレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-10-27T16:12:40Z) - RL makes MLLMs see better than SFT [96.508432109136]
マルチモーダル言語モデル(MLLM)の視覚エンコーダの批判的かつ未探索な解析を行う。
その結果、MLLMの学習後戦略(SFTまたはRL)は、下流タスクにおいて異なる結果をもたらすだけでなく、MLLMの根底にある視覚的表現を根本的に再認識することを示した。
次に、私たちの知見をMLLMのための強力なビジョンエンコーダを構築するための簡単なレシピ、Preference-Instructed Vision OpTimization (PIVOT) に再構成する。
論文 参考訳(メタデータ) (2025-10-18T03:37:17Z) - Cross-Modal Consistency Learning for Sign Language Recognition [92.44927164283641]
既存の事前学習方法は、コンパクトなポーズデータのみに焦点を当てている。
クロスモーダル一貫性学習フレームワーク(CCL-SLR)を提案する。
CCL-SLRはRGBから学習し、自己教師付き事前学習に基づいてモダリティをポーズする。
論文 参考訳(メタデータ) (2025-03-16T12:34:07Z) - MAGMA: Manifold Regularization for MAEs [1.7478203318226315]
Masked Autoencoders(MAE)は、自己教師型学習(SSL)において重要な分断である
異なるトランスフォーマー層の表現に適用される新しいバッチワイド層単位の正規化損失であるMAGMAを紹介する。
提案した正規化損失をプラグインすることで,MAEモデルの性能を大幅に向上させることができることを示す。
論文 参考訳(メタデータ) (2024-12-03T22:14:10Z) - Symmetry-Aware Transformer-based Mirror Detection [85.47570468668955]
デュアルパス・シンメトリ・アウェア・トランスフォーマーを用いたミラー検出ネットワーク(SATNet)を提案する。
SATNetにはSymmetry-Aware Attention Module (SAAM)とContrastとFusion Decoder Module (CFDM)の2つの新しいモジュールが含まれている。
実験の結果,SATNet は RGB と RGB-D の両方のミラー検出法に優れることがわかった。
論文 参考訳(メタデータ) (2022-07-13T16:40:01Z) - Directional Self-supervised Learning for Risky Image Augmentations [54.43314754436954]
堅牢な拡張ポリシーのための指向性自己教師型学習パラダイム(DSSL)を提案する。
DSSLは数行のPseudocodeで簡単に実装でき、人気のある自己教師型学習フレームワークに非常に柔軟である。
論文 参考訳(メタデータ) (2021-10-26T10:33:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。