論文の概要: Token-Space Mask Prediction for Efficient Vision Transformer Segmentation
- arxiv url: http://arxiv.org/abs/2605.18177v1
- Date: Mon, 18 May 2026 10:20:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:49.392683
- Title: Token-Space Mask Prediction for Efficient Vision Transformer Segmentation
- Title(参考訳): 効率的な視覚変換器セグメンテーションのためのトークン空間マスク予測
- Authors: Calvin Galagain, Martyna Poreba, François Goulette,
- Abstract要約: TokenMaskはトークンスペースマスクヘッドで、クエリトークン親和性から直接マスクトークンログを計算する。
多様なViTバックボーン、データセット、セグメンテーションタスクにわたって、TokenMaskは一貫して効率を改善している。
- 参考スコア(独自算出の注目度): 3.090546888821788
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Query-based Vision Transformer segmentation models typically reconstruct dense spatial feature maps to predict masks, inheriting design patterns from convolutional architectures. We show that this explicit image-space reconstruction is not required. We introduce TokenMask, a token-space mask head that computes mask logits directly from query-token affinities and performs interpolation in logit space rather than feature space. This reformulation preserves the original linear scoring mechanism while simplifying the computational structure. Across diverse ViT backbones, datasets and segmentation tasks, TokenMask consistently improves efficiency over prior approaches by reducing computational and memory requirements while maintaining competitive accuracy, leading to tangible speedups on NVIDIA Jetson AGX Orin using TensorRT FP16 inference. Overall, TokenMask yields a simpler and more deployment-friendly design for embedded vision systems.
- Abstract(参考訳): クエリベースのVision Transformerセグメンテーションモデルは通常、密集した空間の特徴マップを再構築してマスクを予測し、畳み込みアーキテクチャからデザインパターンを継承する。
この明示的な画像空間再構成は不要であることを示す。
本稿では,トークン空間マスクヘッドであるTokenMaskを紹介した。これは,問合せ親和性から直接マスクロジットを計算し,特徴空間ではなくロジット空間で補間を行う。
この再構成は、計算構造を簡素化しつつ、元の線形スコアリング機構を保存する。
さまざまなViTバックボーン、データセット、セグメンテーションタスクにわたって、TokenMaskは、競争精度を維持しながら計算とメモリ要件を削減し、従来のアプローチよりも効率を継続的に改善し、TensorRT FP16推論を使用したNVIDIA Jetson AGX Orin上での明確なスピードアップにつながった。
全体として、TokenMaskは、組み込みビジョンシステムに対して、よりシンプルで、よりデプロイメントフレンドリな設計を提供する。
関連論文リスト
- GenMask: Adapting DiT for Segmentation via Direct Mask Generation [81.54526445834294]
間接的な適応の代わりに、セグメント化タスクは生成的な方法で直接訓練されるべきである、と我々は主張する。
分割のための極度のノイズレベルと画像生成のための中等度雑音を強調する二元マスクの時間ステップサンプリング戦略を導入する。
GenMaskは,RGB空間における色鮮やかな画像だけでなく,黒と白のセグメンテーションマスクを生成するためのDiTトレインである。
論文 参考訳(メタデータ) (2026-03-25T03:52:05Z) - AFFMAE: Scalable and Efficient Vision Pretraining for Desktop Graphics Cards [8.026364090097951]
Masked Autoencoders (MAE) は可視トークンのみを符号化することで計算を減らす。
本稿では,適応型オフグリッドトークンマージに基づくマスキングフレンドリーな階層型事前トレーニングフレームワークであるAFFMAEを紹介する。
論文 参考訳(メタデータ) (2026-02-18T07:58:47Z) - The Missing Point in Vision Transformers for Universal Image Segmentation [17.571552686063335]
マスク生成を分類から分離する2段階セグメンテーションフレームワークであるViT-Pを紹介する。
ViT-Pは、事前訓練のないアダプタとして機能し、様々な事前訓練された視覚変換器の統合を可能にする。
COCO、ADE20K、Cityscapesの各データセットにわたる実験は、ViT-Pの有効性を検証する。
論文 参考訳(メタデータ) (2025-05-26T10:29:13Z) - High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation [109.19165503929992]
ここでは,CLIPのマスク分類能力を高めるために,生成されたマスクの代わりに接地トラスマスクを使用するMaskCLIP++を提案する。
低コストの微調整を経て、MaskCLIP++はマルチドメインデータセットのマスク分類性能を大幅に改善した。
我々は,A-847,PC-459,A-150,PC-59,PAS-20データセット上で+1.7,+2.3,+2.1,+3.1,+0.3 mIoUの性能改善を実現する。
論文 参考訳(メタデータ) (2024-12-16T05:44:45Z) - ColorMAE: Exploring data-independent masking strategies in Masked AutoEncoders [53.3185750528969]
Masked AutoEncoders (MAE)は、堅牢な自己管理フレームワークとして登場した。
データに依存しないColorMAEという手法を導入し、ランダムノイズをフィルタすることで異なる二元マスクパターンを生成する。
ランダムマスキングと比較して,下流タスクにおける戦略の優位性を示す。
論文 参考訳(メタデータ) (2024-07-17T22:04:00Z) - Mask Propagation for Efficient Video Semantic Segmentation [63.09523058489429]
ビデオセマンティックベースライン劣化(VSS)は、ビデオシーケンス内の各ピクセルにセマンティックラベルを割り当てることを含む。
SSSSと呼ばれるVSSのための効率的なマスク伝搬フレームワークを提案する。
当社のフレームワークは,フレーム単位のMask2Formerと比較して最大4倍のFLOPを削減し,Cityscapes検証セット上では最大2% mIoUしか使用できない。
論文 参考訳(メタデータ) (2023-10-29T09:55:28Z) - MixMask: Revisiting Masking Strategy for Siamese ConvNets [23.946791390657875]
この研究は、textbfMixMaskと呼ばれる新しいフィリングベースのマスキング手法を導入している。
提案手法は,消去された領域を別の画像からのコンテンツに置き換えることにより,従来のマスキング手法で見られる情報の枯渇を効果的に解消する。
我々は,線形探索,半教師付きおよび教師付きファインタニング,オブジェクト検出,セグメンテーションなどの領域におけるフレームワークの性能向上を実証的に検証した。
論文 参考訳(メタデータ) (2022-10-20T17:54:03Z) - SegViT: Semantic Segmentation with Plain Vision Transformers [91.50075506561598]
意味的セグメンテーションのための平易な視覚変換器(ViT)の能力について検討する。
本研究では,学習可能なクラストークンの集合と空間特徴マップの類似性をセグメンテーションマスクに転送するATMモジュールを提案する。
実験の結果,ATMモジュールを用いたSegVitは,通常のViTバックボーンよりも優れていることがわかった。
論文 参考訳(メタデータ) (2022-10-12T00:30:26Z) - SODAR: Segmenting Objects by DynamicallyAggregating Neighboring Mask
Representations [90.8752454643737]
最近の最先端のワンステージインスタンスセグメンテーションモデルSOLOは、入力画像をグリッドに分割し、完全な畳み込みネットワークを備えたグリッドセルオブジェクトマスクを直接予測する。
我々は,SOLOが近傍の格子セルの物体に対して類似したマスクを生成するのを観察する。
観測されたギャップによってモチベーションを得た学習ベースのアグリゲーション手法を開発し,そのリッチな隣り合う情報を活用してSOLOを改善する。
論文 参考訳(メタデータ) (2022-02-15T13:53:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。