論文の概要: Topology-Aware Global-Local Mamba Networks for Palm Vein Biometrics
- arxiv url: http://arxiv.org/abs/2608.08951v1
- Date: Sun, 09 Aug 2026 23:04:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.003077
- Title: Topology-Aware Global-Local Mamba Networks for Palm Vein Biometrics
- Title(参考訳): パーム静脈バイオメトリックスのためのトポロジーを考慮したグローバルローカルマンバネットワーク
- Abstract要約: パームベイン認識(Palm-vein recognition)は、局所的な血管のテクスチャと血管のグローバルな配置の両方が識別情報を伝達する微視的生体計測タスクである。
マルチスケールな局所的特徴を組み込んだトポロジ対応のグローバルローカルバックボーン,固定されたソベル粒度のエッジ上に構築された構造化方向ストリーム,および4方向状態空間走査グローバルパスを提案する。
- 参考スコア(独自算出の注目度): 1.5484595752241122
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Palm-vein recognition is a fine-grained biometric task in which both local vascular texture and the global layout of the vessel tree carry discriminative information, while public datasets remain limited. We propose a topology-aware global-local backbone that combines multi-scale local features, a structureguided directional stream built on a fixed Sobel-magnitude edge prior, and a four-direction state-space scan global pathway within six Topology-Aware Blocks. A staged gated fusion integrates local, structural, and global representations in that order. On HKPUNIR, our method achieves 99.13% top-1 accuracy and 0.08% EER with 7.2 M parameters; on VERA Palm Vein, it achieves 92.42% accuracy and 0.61% EER. Across both datasets it attains the lowest EER among ResNet50, Vim-S, ViT-S, and GLVM at the smallest parameter count, while GLVM remains the strongest in top-1 accuracy and the cheapest in FLOPs. Code is available upon request.
- Abstract(参考訳): パームベイン認識(Palm-vein recognition)は、局所的な血管のテクスチャと血管木のグローバルなレイアウトの両方が識別情報を持ち、パブリックデータセットは限定的である、きめ細かなバイオメトリックなタスクである。
マルチスケールな局所特徴を組み込んだトポロジ対応グローバルローカルバックボーン,固定されたソベル-マグニチュードエッジ上に構築された指向性ストリーム,および6つのトポロジ-アウェアブロック内の4方向状態空間走査グローバルパスを提案する。
段階的なゲート融合は、その順序で局所的、構造的、大域的表現を統合する。
HKPUNIRでは99.13%、EERは0.08%、パラメータは7.2M、VERA Palm Veinでは92.42%、EERは0.61%である。
両方のデータセット全体では、ResNet50、Vim-S、ViT-S、GLVMの中で最小のEERを最小のパラメータカウントで達成している。
コードは要求に応じて入手できる。
関連論文リスト
- One Query, Many Scales: Sparse Mixture-of-Experts for Efficient Hierarchical Cross-View Geo-Localization [18.593712283784708]
クロスビュージオローカライゼーションは、地上ビュークエリのためにジオタグ付き衛星画像を取得する。
局所階層探索からグローバルなマルチスケール表現学習を分離する,スパース・オブ・サーキットのデュアルエンコーダであるGeoMoEを紹介する。
論文 参考訳(メタデータ) (2026-08-02T07:53:17Z) - One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding [23.58705585303581]
クロス層エビデンスブリッジのための単一フォワードフレームワークであるInnerZoomを提案する。
結果は、InnerZoomがOSWorld-Gで64.7、UI-Visionで40.2、OSWorld-GRで73.1、MMBench-GUIで87.6を達成したことを示唆している。
論文 参考訳(メタデータ) (2026-06-29T10:20:39Z) - BRIDGE and TCH-Net: Heterogeneous Benchmark and Multi-Branch Baseline for Cross-Domain IoT Botnet Detection [1.2019888796331233]
IoTボットネット検出は進歩しているが、ほとんどの公開システムは単一のデータセットで検証されており、環境全体にわたって一般化されることはめったにない。
BRIDGEは、IoT侵入検知のための、初めて公式に指定された異種マルチデータセットベンチマークである。
我々は,LODO F1 = 0.5577 において,単一ベンチマーク最適化からクロス環境一般化へとアジェンダをシフトさせる最初のコミュニティ一般化ベースラインを確立する。
論文 参考訳(メタデータ) (2026-04-13T11:25:39Z) - PRUE: A Practical Recipe for Field Boundary Segmentation at Scale [50.194423500109025]
本研究では,大域境界線決定のためのセグメント化と地理空間基盤モデル(GFM)を初めて体系的に評価する。
U-Netセマンティックセマンティックセグメンテーションモデルは、パフォーマンスとデプロイメントのメトリクスのスイートにおいて、インスタンスベースとGFMの代替よりも優れています。
我々のアプローチは、モデル設計、トレーニング、推論にまたがる、信頼性があり、スケーラブルで再現可能なフィールド境界記述のための実践的なフレームワークを提供します。
論文 参考訳(メタデータ) (2026-03-28T02:47:46Z) - CrossEarth-SAR: A SAR-Centric and Billion-Scale Geospatial Foundation Model for Domain Generalizable Semantic Segmentation [51.94680303125737]
我々は、新しい物理誘導型スパース・オブ・エキスパート(MoE)アーキテクチャに基づいて構築された、最初の10億ドル規模のSARビジョン基盤モデルであるCrossEarth-SARを紹介する。
大規模な事前トレーニングを容易にするために,公共およびプライベートなSAR画像を統合する弱く完全に教師付きデータセットであるCrossEarth-SAR-200Kを開発した。
また、8つの異なる領域ギャップをまたいだ22のサブベンチマークからなるベンチマークスイートを導入し、SAR画像上でのドメイン一般化セマンティックセマンティックセグメンテーションのための最初の統一標準を確立した。
論文 参考訳(メタデータ) (2026-03-12T14:52:35Z) - TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation [70.23578202012048]
Vision-Language Navigation (VLN) は、アーキテクチャ上のミスマッチのため、大きなビジョン-Language Models (VLM) に固有の課題を提示している。
我々は,VLMのバックボーンにトポロジ構造を明示的に注入するエンドツーエンドフレームワークであるTagaVLM(トポロジ・アウェア・グローバルアクション推論)を提案する。
トポロジ的ノード情報を強化するため、Interleaved Navigation Promptはノードレベルのビジュアルテキストアライメントを強化する。
埋め込みトポロジグラフでは、このモデルはグローバルな行動推論が可能であり、堅牢な経路補正を可能にする。
論文 参考訳(メタデータ) (2026-03-03T13:28:07Z) - GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving [55.14836667214487]
GeoFocusは、2つのコアモジュールからなる新しいフレームワークである。
GeoFocusは、主要な特殊モデルよりも4.7%の精度向上を実現している。
多様な視覚条件下でのMATHVERSEの強靭性を示す。
論文 参考訳(メタデータ) (2026-02-09T11:15:01Z) - UAGLNet: Uncertainty-Aggregated Global-Local Fusion Network with Cooperative CNN-Transformer for Building Extraction [83.48950950780554]
リモートセンシング画像からの抽出は、複雑な構造変化のために難しい課題である。
既存の方法は、セグメンテーションモデルにおけるマルチスケール特徴をキャプチャするために、畳み込みブロックまたは自己アテンションブロックを使用する。
高品質なグローバルローカルなビジュアルセマンティクスを活用するために,不確実性集約型グローバルローカルフュージョンネットワーク(UAGLNet)を提案する。
論文 参考訳(メタデータ) (2025-12-15T02:59:16Z) - G-MSGINet: A Grouped Multi-Scale Graph-Involution Network for Contactless Fingerprint Recognition [20.458766184257147]
G-MSGINetは、接触レス指紋認識のための統一されたフレームワークである。
生の入力画像から直接、微妙な局所化とアイデンティティの埋め込みを共同で行う。
3つのベンチマークデータセットの大規模な実験は、G-MSGINetが97.0%から99.1%の範囲で0.83pm0.02$、ランク1の識別精度で一貫してF1スコアを達成していることを示している。
論文 参考訳(メタデータ) (2025-05-13T05:24:24Z) - Global Context Vision Transformers [78.5346173956383]
我々は,コンピュータビジョンのパラメータと計算利用を向上する新しいアーキテクチャであるGC ViT(Global context vision transformer)を提案する。
本稿では,ViTにおける帰納バイアスの欠如に対処し,アーキテクチャにおける可溶性逆残差ブロックを改良して活用することを提案する。
提案したGC ViTは,画像分類,オブジェクト検出,セマンティックセマンティックセグメンテーションタスクにまたがる最先端の処理結果を実現する。
論文 参考訳(メタデータ) (2022-06-20T18:42:44Z) - GraNet: Global Relation-aware Attentional Network for ALS Point Cloud
Classification [7.734726150561088]
ALS点群のセマンティックラベリングに着目した新しいニューラルネットワークを提案する。
GraNetは局所幾何学的記述と局所依存性を学習する。
2つのALSポイントクラウドデータセット上で実験を行った。
論文 参考訳(メタデータ) (2020-12-24T23:54:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。