論文の概要: HVPNet: A Bio-Inspired Network for General Salient and Camouflaged Object Detection
- arxiv url: http://arxiv.org/abs/2606.31496v1
- Date: Tue, 30 Jun 2026 11:14:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.190963
- Title: HVPNet: A Bio-Inspired Network for General Salient and Camouflaged Object Detection
- Title(参考訳): HVPNet: 汎用およびカモフラージュされたオブジェクト検出のためのバイオインスパイアされたネットワーク
- Abstract要約: オブジェクト検出のためのシンプルなが一般的なバイオインスパイアされた計算アーキテクチャであるHVPNetを提案する。
概念的メタファーとしての網膜の多層情報統合に基づいて、網膜統合モジュール(RIM)を設計した。
これらの特徴をフル活用するために、デコードプロセスを低レベルおよび高レベルな視覚段階に分解する皮質デコーダ(CD)をさらに設計する。
- 参考スコア(独自算出の注目度): 4.440088375981152
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In recent years, most research on multimodal salient object detection (SOD) and camouflaged object detection (COD) typically aims to improve performance through complex cross-modal feature fusion and decoding structures. However, this approach leads to an excessively large model parameter scale and often fails to deliver satisfactory detection performance due to structural redundancy. In contrast, the human visual process is able to efficiently perform salient and camouflaged object identification without such complex structures. This contrast raises an important question: Can we draw conceptual inspiration from the human visual process to achieve a simpler modeling strategy, and still realize accurate and efficient object detection? To answer this question, we propose HVPNet, a simple yet general bio-inspired computational architecture. Drawing on the multi-layered information integration of the retina as a conceptual metaphor, we designed a Retinal Integration Module (RIM), which effectively integrates multimodal features through a level-specific multi-stage integration strategy. To fully exploit these features, we further design a cortical decoder (CD) that breaks down the decoding process into low- and high-level visual stages, abstracting the hierarchical processing in the human visual cortex. Benefiting from these designs, HVPNet can readily extend to seven tasks across four modalities. Without bells and whistles, it establishes an excellent accuracy-efficiency trade-off across 22 datasets spanning these seven tasks. Our code is available at https://github.com/jiaweiXu1029/HVPNet.
- Abstract(参考訳): 近年, マルチモーダル・サリエント・オブジェクト検出(SOD)とカモフラーグ・オブジェクト検出(COD)のほとんどの研究は, 複雑なクロスモーダルな特徴融合とデコード構造による性能向上を目的としている。
しかし、このアプローチは過大なモデルパラメータスケールをもたらし、しばしば構造的冗長性のために良好な検出性能を提供できない。
対照的に、人間の視覚過程は、そのような複雑な構造を伴わずに、効率よく、健全で偽造された物体識別を行うことができる。
人間の視覚的プロセスから概念的インスピレーションを引き出して、よりシンプルなモデリング戦略を実現し、正確かつ効率的な物体検出を実現することができるか?
この疑問に答えるために、我々はシンプルなが一般的なバイオインスパイアされた計算アーキテクチャであるHVPNetを提案する。
概念的メタファーとして網膜の多層情報統合を基礎として、レベル固有の多段階統合戦略によりマルチモーダル機能を効果的に統合するRetinal Integration Module (RIM) を設計した。
これらの特徴をフル活用するために、デコードプロセスを低レベルおよび高レベルな視覚段階に分解し、人間の視覚野における階層的処理を抽象化する皮質デコーダ(CD)をさらに設計する。
これらの設計により、HVPNetは容易に4つのモードで7つのタスクに拡張できる。
ベルとホイッスルなしでは、これらの7つのタスクにまたがる22のデータセット間で、優れた精度と効率のトレードオフを確立する。
私たちのコードはhttps://github.com/jiaweiXu1029/HVPNet.comから入手可能です。
関連論文リスト
- MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - MSRNet: A Multi-Scale Recursive Network for Camouflaged Object Detection [19.92307841724757]
カモフラージュされたオブジェクト検出は、環境にシームレスに結合するオブジェクトの識別とセグメンテーションを必要とする、新しいコンピュータビジョンタスクである。
本稿では、ピラミッドビジョン変換器のバックボーンを介してマルチスケール特徴を抽出するマルチスケール再帰ネットワークを提案する。
より精密な物体検出のために、我々はマルチグラニュラリティ・フュージョン・ユニットを組み込むことで特徴を洗練する。
論文 参考訳(メタデータ) (2025-11-16T22:29:06Z) - Shared Neural Space: Unified Precomputed Feature Encoding for Multi-Task and Cross Domain Vision [6.3796451378950385]
本稿では,エンコーダ・デコーダ・フレームワークが視覚および撮像タスク間で機能をプリコンプリートするユニバーサルニューラル・スペースを提案する。
エンコーダは変換を意識し、一般化可能な表現を学び、複数の下流AIモジュールが同じ機能空間を共有できるようにします。
我々は、NSにおいて、復調、復調、深度推定、セマンティックセグメンテーションなどの画像および視覚モジュールを効率的に実行できることを実証した。
論文 参考訳(メタデータ) (2025-09-24T18:48:58Z) - GCRPNet: Graph-Enhanced Contextual and Regional Perception Network for Salient Object Detection in Optical Remote Sensing Images [68.33481681452675]
本稿では,GCRPNet(Graph-enhanced contextual and Regional Recognition Network)を提案する。
これはMambaアーキテクチャの上に構築され、長距離依存関係を同時にキャプチャし、地域的特徴表現を強化する。
マルチスケールの畳み込みによって処理される特徴マップに対して適応的なパッチスキャンを行い、リッチなローカル領域情報をキャプチャする。
論文 参考訳(メタデータ) (2025-08-14T11:31:43Z) - LWGANet: Addressing Spatial and Channel Redundancy in Remote Sensing Visual Tasks with Light-Weight Grouped Attention [13.76497295033739]
リモートセンシング(RS)視覚分析のための軽量ニューラルネットワークは、2つの固有の冗長性を克服しなければならない。
既存のモデルは、しばしば自然画像用に設計されているが、RSシナリオにおけるこの2つの課題に対処することができない。
RS固有の特性のために設計された軽量バックボーンであるLWGANetを提案する。
論文 参考訳(メタデータ) (2025-01-17T08:56:17Z) - ZoomNeXt: A Unified Collaborative Pyramid Network for Camouflaged Object Detection [70.11264880907652]
最近のオブジェクト(COD)は、現実のシナリオでは極めて複雑で難しい、視覚的にブレンドされたオブジェクトを周囲に分割しようと試みている。
本研究では,不明瞭な画像を観察したり,ズームインしたりアウトしたりする際の人間の行動を模倣する,効果的な統合協調ピラミッドネットワークを提案する。
我々のフレームワークは、画像とビデオのCODベンチマークにおいて、既存の最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2023-10-31T06:11:23Z) - General-Purpose Multimodal Transformer meets Remote Sensing Semantic
Segmentation [35.100738362291416]
マルチモーダルAIは、特にセマンティックセグメンテーションのような複雑なタスクのために、補完的なデータソースを活用する。
汎用マルチモーダルネットワークの最近のトレンドは、最先端の性能を達成する大きな可能性を示している。
本稿では,3次元畳み込みを利用して重要なローカル情報をエンコードし,同時にモーダルな特徴を学習するUNet型モジュールを提案する。
論文 参考訳(メタデータ) (2023-07-07T04:58:34Z) - Spatial-Temporal Graph Enhanced DETR Towards Multi-Frame 3D Object Detection [54.041049052843604]
STEMDは,多フレーム3Dオブジェクト検出のためのDETRのようなパラダイムを改良した,新しいエンドツーエンドフレームワークである。
まず、オブジェクト間の空間的相互作用と複雑な時間的依存をモデル化するために、空間的時間的グラフアテンションネットワークを導入する。
最後に、ネットワークが正のクエリと、ベストマッチしない他の非常に類似したクエリを区別することが課題となる。
論文 参考訳(メタデータ) (2023-07-01T13:53:14Z) - A Simple Single-Scale Vision Transformer for Object Localization and
Instance Segmentation [79.265315267391]
We propose a simple and compact ViT architecture called Universal Vision Transformer (UViT)。
UViTは、オブジェクト検出とインスタンスセグメンテーションタスクで強力なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2021-12-17T20:11:56Z) - Dense Multiscale Feature Fusion Pyramid Networks for Object Detection in
UAV-Captured Images [0.09065034043031667]
本研究では,よりリッチな特徴を可能な限り得ることを目的とした,高密度多スケール特徴融合ピラミッドネットワーク(dmffpn)と呼ばれる新しい手法を提案する。
具体的には、密度の高い接続は、異なる畳み込み層からの表現を完全に活用するように設計されている。
VisDrone-DETと呼ばれるドローンベースのデータセットの実験は、我々の方法の競争力を示唆している。
論文 参考訳(メタデータ) (2020-12-19T10:05:31Z) - Learning Enriched Features for Real Image Restoration and Enhancement [166.17296369600774]
畳み込みニューラルネットワーク(CNN)は、画像復元作業における従来のアプローチよりも劇的に改善されている。
ネットワーク全体を通して空間的精度の高い高解像度表現を維持することを目的とした,新しいアーキテクチャを提案する。
提案手法は,高解像度の空間的詳細を同時に保存しながら,複数のスケールからの文脈情報を組み合わせた豊富な特徴集合を学習する。
論文 参考訳(メタデータ) (2020-03-15T11:04:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。