論文の概要: DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction
- arxiv url: http://arxiv.org/abs/2607.16012v1
- Date: Fri, 17 Jul 2026 14:46:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.876292
- Title: DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction
- Title(参考訳): DPNeXt - ViT-based Multi-Task Dense Prediction のための軽量多機能融合フレームワーク
- Abstract要約: 本稿では,マルチスケール機能融合デコーダDPNeXtを提案する。
DPNeXtは、凍結VFM利用を改善するために、二重の深さ分離可能な逆ボトルネックを使用する。
また,Multi-Task boundary Guidance(MTBG)戦略についても紹介する。
- 参考スコア(独自算出の注目度): 4.094848360328624
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-Task Learning (MTL) in robotics perception systems supports comprehensive 3D spatial scene understanding by integrating semantic segmentation and depth estimation. While Vision Foundation Models (VFMs) are increasingly adopted as robust feature encoders, existing decoding strategies present a critical bottleneck. To address this, we propose DPNeXt, a streamlined multi-scale feature fusion decoder and efficient alternative to the standard Dense Prediction Transformer (DPT). DPNeXt uses dual depthwise separable inverted bottlenecks to improve frozen VFM utilization through fusion-centric decoding and independent task modularization. To further mitigate negative inductive transfer between tasks, we introduce the Multi-Task Boundary Guidance (MTBG) strategy. Unlike prior boundary-aware methods that add fusion modules or gating, MTBG applies symmetric boundary-focused supervision to encourage geometric consistency without extra annotation or inference cost. Experiments on Cityscapes show that DPNeXt-S outperforms prior state-of-the-art (SOTA) MTL models, while DPNeXt-B further improves the overall performance and achieves the best results among the compared methods. On NYUv2, DPNeXt-B also achieves the best semantic segmentation and depth estimation results among the compared methods while requiring substantially fewer trainable parameters than prior large-scale MTL models. Compared with the standard DPT, DPNeXt-S reduces trainable parameters by 78.6% and achieves the fastest inference speed among the compared models on resource-constrained laptop hardware. The source code, model checkpoints, and a demo video will be made available at https://github.com/kangjehun/DPNeXt.
- Abstract(参考訳): ロボット認識システムにおけるマルチタスク学習(MTL)は、セマンティックセグメンテーションと深さ推定を統合することで、総合的な3次元空間シーン理解を支援する。
Vision Foundation Models (VFM) はロバストな機能エンコーダとしてますます採用されているが、既存のデコード戦略は重大なボトルネックとなっている。
そこで本研究では,Dense Prediction Transformer (DPT) の効率的な代替手段であるDPNeXtを提案する。
DPNeXtは、融合中心のデコードと独立タスクのモジュール化により、凍結VFM利用を改善するために、二重の深さ分離可能な逆ボトルネックを使用する。
タスク間の負の帰納的伝達をさらに緩和するために,マルチタスク境界ガイダンス(MTBG)戦略を導入する。
融合加群やゲーティングを追加する従来の境界認識法とは異なり、MTBGは追加のアノテーションや推論コストを伴わずに幾何的一貫性を促進するために対称的な境界中心の監督を適用している。
Cityscapesの実験では、DPNeXt-Sは先行技術(SOTA)MTLモデルよりも優れており、DPNeXt-Bは全体的な性能をさらに向上し、比較した手法の最良の結果が得られる。
NYUv2では、DPNeXt-Bは、従来の大規模MTLモデルよりもトレーニング可能なパラメータをかなり少なく必要としながら、比較手法の中で最高のセマンティックセグメンテーションと深さ推定結果を達成する。
標準のDPTと比較して、DPNeXt-Sはトレーニング可能なパラメータを78.6%削減し、リソース制約のラップトップハードウェアで比較したモデルの中で最速の推論速度を達成する。
ソースコード、モデルチェックポイント、デモビデオはhttps://github.com/kangjehun/DPNeXt.comで公開される。
関連論文リスト
- MAny: Merge Anything for Multimodal Continual Instruction Tuning [52.50936513604062]
textbfMAny(textbfMAny)は、textbfCross-modal textbfProjection textbfMergingを通じてタスク固有の知識を統合するフレームワークである。
textbfLow-rank textbfParameter textbfMerging (textbfLPM)
論文 参考訳(メタデータ) (2026-04-15T15:57:23Z) - Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation [8.840077295284393]
MoBaNetはパラメータ効率とモダリティバランスを持つ対称核融合フレームワークである。
ほとんど凍結されたVFMバックボーン上に構築されたMoBaNetは、一般化可能な表現を維持するために対称なデュアルストリームアーキテクチャを採用している。
ISPRS VaihingenとPotsdamベンチマークの実験は、MoBaNetが最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-03-18T13:23:58Z) - Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking [16.123153889076104]
本稿では,PEFTに基づくマルチモーダルトラッキングのためのSparse-Dense Mixture of Experts Adapter (SDMoEA) フレームワークを提案する。
マルチレベル多モード核融合における高次相関のモデル化における既存の追跡手法の限界を克服するため,Gram-based Semantic Alignment Hypergraph Fusion (GSAHF)モジュールを提案する。
提案手法は,複数のマルチモーダルトラッキングベンチマークにおいて,他のPEFT手法と比較して優れた性能を実現する。
論文 参考訳(メタデータ) (2026-03-14T02:51:10Z) - Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing [8.705453442427585]
大規模言語モデル(LLM)は様々な推論タスクでほぼ人間に近い性能を達成した。
リソース制約のあるIoT(Internet-of-Things)デバイスへのデプロイメントは、大量のパラメータフットプリントとメモリ集約型の自己回帰デコーディングのため、依然として現実的ではない。
この研究は、エッジデバイスにLLMを配置するために明示的に設計された最初の自動回帰対応分割コンピューティングフレームワークを紹介した。
論文 参考訳(メタデータ) (2025-11-06T02:55:07Z) - Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model [81.01939699480094]
本稿では,MVSに拡散モデルを導入する新しいMVSフレームワークを提案する。
深度推定の識別特性を考慮し,拡散過程を導出する条件エンコーダを設計する。
本稿では,新しいMVSフレームワークであるDiffMVSとCasMVSの2つの新しいMVS手法を提案する。
論文 参考訳(メタデータ) (2025-09-18T17:59:19Z) - DIMM: Decoupled Multi-hierarchy Kalman Filter for 3D Object Tracking [50.038098341549095]
状態推定は、高い操作性を持つ3次元物体追跡において困難である。
本稿では,各方向の異なる動きモデルから推定される推定を効果的に組み合わせる新しいフレームワークであるDIMMを提案する。
DIMMは既存の状態推定手法のトラッキング精度を31.61%99.23%向上させる。
論文 参考訳(メタデータ) (2025-05-18T10:12:41Z) - Taming Flow Matching with Unbalanced Optimal Transport into Fast Pansharpening [10.23957420290553]
本稿では,一段階の高品位パンシャーピングを実現するための最適輸送フローマッチングフレームワークを提案する。
OTFMフレームワークは、パンシャーピング制約の厳格な遵守を維持しつつ、シミュレーション不要なトレーニングとシングルステップ推論を可能にする。
論文 参考訳(メタデータ) (2025-03-19T08:10:49Z) - Joint Transmit and Pinching Beamforming for Pinching Antenna Systems (PASS): Optimization-Based or Learning-Based? [89.05848771674773]
MISO (Multiple-input Single-output) フレームワークを提案する。
それは複数の導波路で構成されており、多数の低コストアンテナ(PA)を備えている。
PAの位置は、大規模パスと空間の両方にまたがるように再構成することができる。
論文 参考訳(メタデータ) (2025-02-12T18:54:10Z) - Towards Efficient Pareto Set Approximation via Mixture of Experts Based Model Fusion [53.33473557562837]
大規模深層ニューラルネットワークに対する多目的最適化問題を解くことは、損失ランドスケープの複雑さと高価な計算コストのために難しい課題である。
本稿では,専門家(MoE)をベースとしたモデル融合を用いて,この問題を実用的でスケーラブルに解決する手法を提案する。
特殊な単一タスクモデルの重みをまとめることで、MoEモジュールは複数の目的間のトレードオフを効果的に捉えることができる。
論文 参考訳(メタデータ) (2024-06-14T07:16:18Z) - Joint Spatial-Temporal and Appearance Modeling with Transformer for
Multiple Object Tracking [59.79252390626194]
本稿ではTransSTAMという新しい手法を提案する。Transformerを利用して各オブジェクトの外観特徴とオブジェクト間の空間的時間的関係の両方をモデル化する。
提案手法はMOT16, MOT17, MOT20を含む複数の公開ベンチマークで評価され, IDF1とHOTAの両方で明確な性能向上を実現している。
論文 参考訳(メタデータ) (2022-05-31T01:19:18Z) - Dynamic Spatial Propagation Network for Depth Completion [6.3447233767041356]
本稿では,周辺画素間の親和性を注目に基づくアプローチで学習する効率的なモデルを提案する。
実際に,本手法では,他のSPNの性能に適合するイテレーションを少なくし,全体としてより優れた結果が得られる。
論文 参考訳(メタデータ) (2022-02-20T09:43:17Z) - EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation [62.210091681352914]
自律運転やロボティクスなど,多くのアプリケーションを対象とした3次元セマンティックセマンティックセグメンテーションのためのマルチセンサフュージョンについて検討する。
本研究では,知覚認識型マルチセンサフュージョン(PMF)と呼ばれる協調融合方式について検討する。
本稿では,2つのモードから特徴を分離して抽出する2ストリームネットワークを提案する。
論文 参考訳(メタデータ) (2021-06-21T10:47:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。