論文の概要: AHMAD: Adaptive Hybrid Multi-task Vision Learning with Assisted Distillation for Keypoint Detection
- arxiv url: http://arxiv.org/abs/2609.35490v1
- Date: Mon, 28 Sep 2026 16:00:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.068734
- Title: AHMAD: Adaptive Hybrid Multi-task Vision Learning with Assisted Distillation for Keypoint Detection
- Title(参考訳): AHMAD:キーポイント検出のための拡張型適応型ハイブリッドマルチタスクビジョン学習
- Abstract要約: 汎用マルチタスクビジョンモデルは、単一のフレームワーク内で複数のビジョンタスクを統合することを目的としている。
AHMADは、異なるキービジョンタスクを統合する汎用マルチタスク学習のためのフレームワークである。
提案手法では,これらの5つのタスクを,複数の軽量タスク固有のプロジェクタを備えた共有エンコーダデコーダという,統一された構造に組み込む。
- 参考スコア(独自算出の注目度): 54.6609606673955
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalist multitasking vision models aim to unify multiple vision tasks within a single framework, enabling more efficient and versatile learning. However, handling diverse vision tasks -- spanning dense and sparse predictions -- remains challenging due to their inherently varying output structures. In this paper, we propose AHMAD, a simple yet effective framework for generalist multitask learning that integrates different key vision tasks: semantic segmentation, instance segmentation, depth estimation, keypoint detection, and object detection. Our approach incorporates these five tasks into a unified structure: a shared encoder-decoder with several lightweight task-specific projectors. Under the multitask learning paradigm, we observed a complementary performance gain, achieving a state-of-the-art PQ of 53.1 and an mIoU of 66.5 for COCO-val panoptic and semantic segmentation, respectively. Additionally, for top-down keypoint detection, which typically incurs high computational overhead due to multiple forward passes, we introduce a knowledge distillation-based method that enables a single forward pass over the entire image, greatly improving efficiency. Ultimately, our model delivers a lightweight yet effective generalist multitask learning framework, demonstrating strong performance across five vision tasks.
- Abstract(参考訳): 汎用マルチタスクビジョンモデルは、単一のフレームワーク内で複数のビジョンタスクを統合することを目的としており、より効率的で汎用的な学習を可能にする。
しかし、多種多様な視覚タスク(密度とスパース予測にまたがる)を扱うことは、本質的に異なる出力構造のため、依然として困難である。
本稿では,意味的セグメンテーション,インスタンスセグメンテーション,深さ推定,キーポイント検出,オブジェクト検出など,さまざまなキービジョンタスクを統合する汎用マルチタスク学習のための,シンプルで効果的なフレームワークであるAHMADを提案する。
提案手法では,これらの5つのタスクを,複数の軽量タスク固有のプロジェクタを備えた共有エンコーダデコーダという,統一された構造に組み込む。
マルチタスク学習のパラダイムでは,COCO-valパノプティクスとセマンティックセグメンテーションでそれぞれ53.1の最先端PQと66.5のmIoUを達成した。
さらに,複数前方通過による高い計算オーバーヘッドを生じるトップダウンキーポイント検出に対しては,画像全体への単一の前方通過を可能にする知識蒸留法を導入し,効率を大幅に向上させる。
最終的に、我々のモデルは軽量で効果的な汎用マルチタスク学習フレームワークを提供し、5つのビジョンタスクで強力なパフォーマンスを示す。
関連論文リスト
- VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization [87.26383908243878]
マルチモーダル大言語モデルにおける視覚エンコーダは,その高密度な特徴表現に欠けていることを示す。
本稿では,協調学習のための新しいマルチタスクフレームワークであるVersaViTを提案する。
論文 参考訳(メタデータ) (2026-02-10T16:08:19Z) - Revisiting Multi-Task Visual Representation Learning [52.93947931352643]
本稿では,マルチタスク・ビジュアル事前学習フレームワークであるMTVを紹介する。
我々は、高容量の「エキスパート」モデルを利用して、高密度で構造化された擬似ラベルを大規模に合成する。
以上の結果から,MTV が "Best-of-both-worlds" のパフォーマンスを達成できることが示唆された。
論文 参考訳(メタデータ) (2026-01-20T11:59:19Z) - Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models [50.98559225639266]
6つのタスクカテゴリにまたがる18のベンチマークを用いて,異なるエンコーダ層からの視覚的特徴の寄与について検討した。
この結果から,多層構造はタスク依存性の相補的な長所を提供し,均一な融合が最適以下の性能をもたらすことが明らかとなった。
テキスト命令に基づいて動的に多層視覚特徴を統合する命令誘導型視覚アグリゲータを提案する。
論文 参考訳(メタデータ) (2024-12-26T05:41:31Z) - @Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology [31.779074930032184]
視覚障害者を支援するための人間中心補助技術(AT)は、複数のタスクを同時に実行することのできるジェネラリストへと進化している。
われわれはまず、PVIsで事前設計されたユーザースタディによってガイドされた新しいATベンチマーク(@Bench)を作成する。
さらに、全てのタスクを同時に処理し、PVIを支援するためにより補助的な機能に拡張できる新しいATモデル(@Model)を提案する。
論文 参考訳(メタデータ) (2024-09-21T18:30:17Z) - A Multitask Deep Learning Model for Classification and Regression of Hyperspectral Images: Application to the large-scale dataset [44.94304541427113]
ハイパースペクトル画像上で複数の分類タスクと回帰タスクを同時に行うマルチタスク深層学習モデルを提案する。
我々は、TAIGAと呼ばれる大規模なハイパースペクトルデータセットに対するアプローチを検証した。
結果の総合的定性的および定量的分析により,提案手法が他の最先端手法よりも有意に優れていることを示す。
論文 参考訳(メタデータ) (2024-07-23T11:14:54Z) - Visual Exemplar Driven Task-Prompting for Unified Perception in
Autonomous Driving [100.3848723827869]
本稿では,タスク固有のプロンプトを通じて視覚的見本を提示する,効果的なマルチタスクフレームワークVE-Promptを提案する。
具体的には、境界ボックスと色に基づくマーカーに基づいて視覚的な例を生成し、ターゲットカテゴリの正確な視覚的外観を提供する。
我々は変圧器をベースとしたエンコーダと畳み込み層を橋渡しし、自律運転における効率的かつ正確な統合認識を実現する。
論文 参考訳(メタデータ) (2023-03-03T08:54:06Z) - Effective Adaptation in Multi-Task Co-Training for Unified Autonomous
Driving [103.745551954983]
本稿では,3つの下流タスクにおけるMoCoやSimCLRなど,多種多様な自己監督手法の転送性能について検討する。
彼らのパフォーマンスは、サブ最適か、あるいはシングルタスクベースラインよりもはるかに遅れていることに気付きました。
汎用マルチタスクトレーニングのための,単純かつ効果的な事前訓練-適応-ファインチューンパラダイムを提案する。
論文 参考訳(メタデータ) (2022-09-19T12:15:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。