論文の概要: ETO:Efficient Transformer-based Local Feature Matching by Organizing Multiple Homography Hypotheses
- arxiv url: http://arxiv.org/abs/2410.22733v2
- Date: Thu, 31 Oct 2024 08:26:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-11-01 09:54:43.174937
- Title: ETO:Efficient Transformer-based Local Feature Matching by Organizing Multiple Homography Hypotheses
- Title(参考訳): ETO:多重ホログラフィー仮説の組織化による効率の良い変圧器を用いた局所特徴マッチング
- Authors: Junjie Ni, Guofeng Zhang, Guanglin Li, Yijin Li, Xinyang Liu, Zhaoyang Huang, Hujun Bao,
- Abstract要約: 局所的な特徴マッチングのための効率的なトランスフォーマーベースネットワークアーキテクチャを提案する。
YFCC100Mデータセットでは、我々のマッチング精度は最先端のトランスフォーマーベースのアーキテクチャであるLoFTRと競合する。
- 参考スコア(独自算出の注目度): 35.31588965060201
- License:
- Abstract: We tackle the efficiency problem of learning local feature matching. Recent advancements have given rise to purely CNN-based and transformer-based approaches, each augmented with deep learning techniques. While CNN-based methods often excel in matching speed, transformer-based methods tend to provide more accurate matches. We propose an efficient transformer-based network architecture for local feature matching. This technique is built on constructing multiple homography hypotheses to approximate the continuous correspondence in the real world and uni-directional cross-attention to accelerate the refinement. On the YFCC100M dataset, our matching accuracy is competitive with LoFTR, a state-of-the-art transformer-based architecture, while the inference speed is boosted to 4 times, even outperforming the CNN-based methods. Comprehensive evaluations on other open datasets such as Megadepth, ScanNet, and HPatches demonstrate our method's efficacy, highlighting its potential to significantly enhance a wide array of downstream applications.
- Abstract(参考訳): 局所的な特徴マッチングを学習する効率問題に取り組む。
近年の進歩により、純粋にCNNベース、トランスフォーマーベースのアプローチが生まれ、それぞれが深層学習技術で強化されている。
CNNベースの手法はマッチング速度が優れていることが多いが、トランスフォーマーベースの手法はより正確なマッチングを提供する傾向がある。
局所的な特徴マッチングのための効率的なトランスフォーマーベースネットワークアーキテクチャを提案する。
この技術は、実世界の連続的な対応を近似するために複数のホモグラフィー仮説を構築し、その洗練を加速するために一方向の相互アテンションを構築する。
YFCC100Mデータセットでは、我々のマッチング精度は最先端のトランスフォーマーベースのアーキテクチャであるLoFTRと競合する一方、推論速度は4倍に向上し、CNNベースの手法よりも優れています。
Megadepth、ScanNet、HPatchesなどの他のオープンデータセットに対する包括的な評価は、我々の方法の有効性を示し、幅広いダウンストリームアプリケーションを大幅に強化する可能性を強調している。
関連論文リスト
- CNN-Transformer Rectified Collaborative Learning for Medical Image Segmentation [60.08541107831459]
本稿では,医用画像セグメンテーションのための強力なCNNベースモデルとトランスフォーマーベースモデルを学習するための,CNN-Transformer修正協調学習フレームワークを提案する。
具体的には,学生ソフトラベルの誤り領域を適応的に選択・修正する基礎的真理を取り入れた修正ロジット・ワイド・コラボレーティブ・ラーニング(RLCL)戦略を提案する。
また,機能空間におけるCNNベースモデルとTransformerベースモデル間の効果的な知識伝達を実現するために,クラス認識型特徴量協調学習(CFCL)戦略を提案する。
論文 参考訳(メタデータ) (2024-08-25T01:27:35Z) - PointMT: Efficient Point Cloud Analysis with Hybrid MLP-Transformer Architecture [46.266960248570086]
本研究は,効率的な特徴集約のための複雑局所的注意機構を導入することで,自己注意機構の二次的複雑さに取り組む。
また,各チャネルの注目重量分布を適応的に調整するパラメータフリーチャネル温度適応機構を導入する。
我々は,PointMTが性能と精度の最適なバランスを維持しつつ,最先端手法に匹敵する性能を実現することを示す。
論文 参考訳(メタデータ) (2024-08-10T10:16:03Z) - TCCT-Net: Two-Stream Network Architecture for Fast and Efficient Engagement Estimation via Behavioral Feature Signals [58.865901821451295]
本稿では,新しい2ストリーム機能融合 "Tensor-Convolution and Convolution-Transformer Network" (TCCT-Net) アーキテクチャを提案する。
時間空間領域における意味のあるパターンをよりよく学習するために、ハイブリッド畳み込み変換器を統合する「CT」ストリームを設計する。
並行して、時間周波数領域からリッチなパターンを効率的に抽出するために、連続ウェーブレット変換(CWT)を用いて情報を2次元テンソル形式で表現する「TC」ストリームを導入する。
論文 参考訳(メタデータ) (2024-04-15T06:01:48Z) - CT-MVSNet: Efficient Multi-View Stereo with Cross-scale Transformer [8.962657021133925]
クロススケールトランス(CT)プロセスは、追加計算なしで異なる段階の表現を特徴付ける。
複数のスケールで異なる対話型アテンションの組み合わせを利用する適応型マッチング認識変換器(AMT)を導入する。
また、より細かなコストボリューム構成に大まかにグローバルな意味情報を埋め込む2機能ガイドアグリゲーション(DFGA)も提案する。
論文 参考訳(メタデータ) (2023-12-14T01:33:18Z) - Evolutionary Neural Architecture Search for Transformer in Knowledge
Tracing [8.779571123401185]
本稿では,入力特徴選択を自動化する進化的ニューラルアーキテクチャ探索手法を提案し,ローカル・グローバル・コンテキスト・モデリングのバランシングを実現するためにどの操作を適用すべきかを自動決定する。
2つの最大かつ最も困難な教育データセットの実験結果は、提案手法によって発見されたアーキテクチャの有効性を実証している。
論文 参考訳(メタデータ) (2023-10-02T13:19:33Z) - Fourier Test-time Adaptation with Multi-level Consistency for Robust
Classification [10.291631977766672]
本稿では,Fourier Test-Time Adaptation (FTTA) と呼ばれる新しい手法を提案する。
FTTAは、予測の自己監督を行うために、ペア入力の信頼性の高い多レベル整合性測定を構築する。
異なる形態と器官を持つ3つの大きな分類データセットで広範囲に検証された。
論文 参考訳(メタデータ) (2023-06-05T02:29:38Z) - Magic ELF: Image Deraining Meets Association Learning and Transformer [63.761812092934576]
本稿では,CNN と Transformer を統合化して,画像デライニングにおける学習のメリットを活用することを目的とする。
降雨除去と背景復旧を関連づける新しいマルチインプット・アテンション・モジュール (MAM) を提案する。
提案手法(ELF)は,最先端手法(MPRNet)を平均0.25dB向上させる。
論文 参考訳(メタデータ) (2022-07-21T12:50:54Z) - Rich CNN-Transformer Feature Aggregation Networks for Super-Resolution [50.10987776141901]
近年の視覚変換器と自己注意は,様々なコンピュータビジョンタスクにおいて有望な成果を上げている。
我々は,CNNの局所的特徴とトランスフォーマーが捉えた長距離依存性を活用する,超解像(SR)タスクのための効果的なハイブリッドアーキテクチャを提案する。
提案手法は,多数のベンチマークデータセットから最先端のSR結果を得る。
論文 参考訳(メタデータ) (2022-03-15T06:52:25Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z) - HiFT: Hierarchical Feature Transformer for Aerial Tracking [16.78336740951222]
航空追跡のための効率的かつ効果的な階層型特徴変換器 (HiFT) を提案する。
HiFTは空間的(浅層)と意味論的(深層)の相互融合を実現するために多層畳み込み層を用いる
4つの航空ベンチマークの総合的な評価は、HiFTの有効性を証明している。
論文 参考訳(メタデータ) (2021-07-31T10:04:45Z) - Thinking Fast and Slow: Efficient Text-to-Visual Retrieval with
Transformers [115.90778814368703]
目的は,大規模画像とビデオデータセットの言語検索である。
このタスクでは、独立してテキストとビジョンを共同埋め込み空間 a.k.a にマッピングする。
デュアルエンコーダは 検索スケールとして魅力的です
視覚テキスト変換器をクロスアテンションで使用する別のアプローチは、関節埋め込みよりも精度が大幅に向上する。
論文 参考訳(メタデータ) (2021-03-30T17:57:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。