論文の概要: iFAN: Inference-Aware Learning for Plain Mask Transformers
- arxiv url: http://arxiv.org/abs/2608.03216v1
- Date: Tue, 04 Aug 2026 06:51:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.066046
- Title: iFAN: Inference-Aware Learning for Plain Mask Transformers
- Title(参考訳): iFAN: 普通のマスク変換器の推論学習
- Authors: Fang Li, Yu He, Haoyang Tong, Lichen Ma, Jingling Fu, Wenxiao Fan, Tongxuan Liu, Luohang Liu, Ke Zhang, Junshi Huang,
- Abstract要約: Inference-Aware Learning (iFAN)は、マスクトランスフォーマーのトレーニングフレームワークである。
iFANは、クエリ競合を予測されたマスクの品質と整合させ、高信頼だが不正確な競合を抑える。
COCO、ADE20K、Cityscapesの実験では、汎光学、例えばセマンティックセグメンテーションにおける一貫した改善が示されている。
- 参考スコア(独自算出の注目度): 19.684667597224152
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Query-based mask transformers assemble segmentation outputs through pixel-wise competition among query predictions of the final layer, yet this inference process is not explicitly optimized during training. We identify two key mismatches: the query with the highest probability-mask score does not necessarily produce the most accurate mask, and final-layer decoding may discard superior predictions from intermediate layers. To address these issues, we propose Inference-Aware Learning (iFAN), a general training framework for plain mask transformers. iFAN introduces Adjusted Probability-Mask Ranking (APMR), which aligns query competition with predicted mask quality and suppresses high-confidence but inaccurate competitors. We further employ Cross-Layer Self-Distillation (CLSD) to transfer stronger intermediate predictions to the final layer. The ranking and distillation objectives are training-only, while inference retains efficient final-layer decoding. Experiments on COCO, ADE20K, and Cityscapes demonstrate consistent improvements across panoptic, instance, and semantic segmentation, as well as across different architectures, backbone scales, and input resolutions. Overall, iFAN improves performance by an average of 1.20 PQ, 1.30 AP, and 0.63 mIoU, with negligible additional parameters, FLOPs and inference latency.
- Abstract(参考訳): クエリベースのマスクトランスフォーマーは、最終層のクエリ予測におけるピクセルワイズ競合を通じてセグメンテーション出力を組み立てるが、この推論プロセスはトレーニング中に明示的に最適化されない。
高い確率マスクスコアを持つクエリは必ずしも最も正確なマスクを生成するとは限らないし、最終層デコーディングは中間層からの優れた予測を捨てる可能性がある。
これらの課題に対処するため,マスクトランスフォーマーの一般的なトレーニングフレームワークである推論認識学習(iFAN)を提案する。
iFANは、クエリ競合を予測されたマスク品質と整合させ、高信頼だが不正確な競合を抑圧するAdjusted Probability-Mask Ranking (APMR)を導入した。
さらにクロス層自己蒸留(CLSD)を用いて,より強い中間予測を最終層に伝達する。
ランク付けと蒸留の目的はトレーニングのみであり、推論は効率的な最終層復号を保っている。
COCO、ADE20K、Cityscapesの実験では、パン光学、例、セマンティックセグメンテーション、異なるアーキテクチャ、バックボーンスケール、入力解像度で一貫した改善が示されている。
全体として、iFANは平均1.20 PQ、1.30 AP、0.63 mIoUのパフォーマンスを改善し、無視できる追加パラメータ、FLOP、推論遅延を持つ。
関連論文リスト
- The Missing Point in Vision Transformers for Universal Image Segmentation [17.571552686063335]
マスク生成を分類から分離する2段階セグメンテーションフレームワークであるViT-Pを紹介する。
ViT-Pは、事前訓練のないアダプタとして機能し、様々な事前訓練された視覚変換器の統合を可能にする。
COCO、ADE20K、Cityscapesの各データセットにわたる実験は、ViT-Pの有効性を検証する。
論文 参考訳(メタデータ) (2025-05-26T10:29:13Z) - Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning [116.75939193785143]
画像領域における視覚変換器(ViT)のコントラスト学習(CL)は、従来の畳み込みバックボーンのCLに匹敵する性能を達成した。
ViTで事前訓練した3Dポイントクラウドでは、マスク付きオートエンコーダ(MAE)モデリングが主流である。
論文 参考訳(メタデータ) (2024-07-08T12:28:56Z) - Improving Adversarial Robustness of Masked Autoencoders via Test-time
Frequency-domain Prompting [133.55037976429088]
BERTプリトレーニング(BEiT, MAE)を備えた視覚変換器の対向ロバスト性について検討する。
意外な観察は、MAEが他のBERT事前訓練法よりも敵の頑健さが著しく悪いことである。
我々は,MAEの対角的堅牢性を高めるための,シンプルで効果的な方法を提案する。
論文 参考訳(メタデータ) (2023-08-20T16:27:17Z) - Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training [55.12082817901671]
我々はMasked and Permuted Vision Transformer(MaPeT)という自己教師型事前学習手法を提案する。
MaPeTは、自動回帰および置換予測を使用して、パッチ内依存関係をキャプチャする。
以上の結果から,MaPeTはベースラインやコンペティターと同一のモデル設定で比較して,ImageNet上での競合性能を実証した。
論文 参考訳(メタデータ) (2023-06-12T18:12:19Z) - Efficient Masked Autoencoders with Self-Consistency [34.7076436760695]
マスク付き画像モデリング(MIM)はコンピュータビジョンにおける強力な自己教師付き事前学習手法として認識されている。
本研究では,自己整合性(EMAE)を有する効率的なマスク付きオートエンコーダを提案し,事前学習効率を向上させる。
EMAEは、画像分類、オブジェクト検出、セマンティックセグメンテーションなど、さまざまな下流タスクにおける最先端の転送能力を一貫して取得する。
論文 参考訳(メタデータ) (2023-02-28T09:21:12Z) - Improving Self-supervised Pre-training via a Fully-Explored Masked
Language Model [57.77981008219654]
Masked Language Model (MLM)フレームワークは、自己教師型言語事前学習に広く採用されている。
そこで本研究では,テキストシーケンスを複数の非重複セグメントに分割するマスキング手法を提案する。
論文 参考訳(メタデータ) (2020-10-12T21:28:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。