論文の概要: From General Actions to Domain-Specific Monitoring: Prior-Adaptive Transfer for Skeleton-Based Action Recognition
- arxiv url: http://arxiv.org/abs/2607.03327v1
- Date: Fri, 03 Jul 2026 13:43:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.590226
- Title: From General Actions to Domain-Specific Monitoring: Prior-Adaptive Transfer for Skeleton-Based Action Recognition
- Title(参考訳): 一般行動からドメイン特異的モニタリングへ:骨格に基づく行動認識のための事前適応的伝達
- Authors: Hao Wang, Di Yang, Jiangtao Wang,
- Abstract要約: Prior-Transfer Skeletons (PATS) は、タスク関連動作パターンを保持することで一般的な骨格モデルに適応するフレームワークである。
PATSはビデオから骨格信号を抽出する標準的なパイプラインに従い、一般的なアクションでトレーニングされたバックボーン時間を使用する。
2つの特定のアクション認識タスクの実験は、競合するベースラインよりもパフォーマンスと効率が一貫した改善を示している。
- 参考スコア(独自算出の注目度): 6.158036203501125
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Skeleton-based action recognition models have recently shown strong performance on large-scale benchmarks with general actions. However, directly transferring them to domain-specific tasks e.g., healthcare monitoring, is often suboptimal, as such tasks are narrow in scope and may be relevant to only a subset of general motion priors. Moreover, not all pretrained motion patterns are equally useful for a specific task, and retaining less relevant components may hinder adaptation and increase computational cost. To address these challenges, we propose Prior-Adaptive Transfer of Skeletons (PATS), a framework that adapts general skeleton-based models by selectively retaining task-relevant motion priors while filtering redundant ones during transfer. PATS follows a standard pipeline that extracts skeleton signals from videos and employs a spatio-temporal backbone pre-trained on general actions. The key contribution lies in a novel Adaptive Prior Transfer module, which performs model compression as a prior selection mechanism through iterative pruning and refinement. Experiments on two specific action recognition tasks, Alzheimer's detection and fall detection, show consistent improvements in both performance and efficiency over competitive baselines. The code will be released upon acceptance.
- Abstract(参考訳): スケルトンをベースとしたアクション認識モデルは、最近、一般的なアクションを持つ大規模ベンチマークで強いパフォーマンスを示している。
しかしながら、医療監視などのドメイン固有のタスクに直接転送することは、スコープが狭く、一般的な動作前のサブセットにのみ関連があるため、しばしばサブ最適である。
さらに、事前訓練されたすべての動きパターンは、特定のタスクに等しく有用であり、関連性の低いコンポーネントを保持することは、適応を妨げ、計算コストを増大させる可能性がある。
これらの課題に対処するために,移動中に冗長な動きをフィルタリングしながらタスク関連動作を選択的に保持することにより,一般的な骨格モデルに適応するフレームワークであるPrior-Adaptive Transfer of Skeletons (PATS)を提案する。
PATSはビデオから骨格信号を抽出し、一般的なアクションに基づいて事前訓練された時空間バックボーンを使用する標準的なパイプラインに従っている。
重要な貢献はAdaptive Prior Transferモジュールで、反復的なプルーニングとリファインメントを通じて事前選択メカニズムとしてモデル圧縮を実行する。
アルツハイマーの検出と転倒検出という2つの特定の行動認識タスクの実験は、競争ベースラインよりもパフォーマンスと効率の両面で一貫した改善を示している。
コードは受理時にリリースされます。
関連論文リスト
- PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation [50.8450025321217]
Vision-Language-Action(VLA)モデルは、汎用的なロボットポリシーに有望なパラダイムを提供する。
これらのボトルネックは、一般的なダイレクトインストラクション・トゥ・コントロルマッピング(Direct Instruction-to-Control Mapping)に由来すると我々は主張する。
本稿では,このパラダイムをPrimitive-Centric Disassemble & AssembleパラダイムにシフトさせるフレームワークであるPrimitiveVLAを提案する。
論文 参考訳(メタデータ) (2026-05-27T15:41:18Z) - Efficient and Adaptive Human Activity Recognition via LLM Backbones [39.42078885809324]
本稿では,大規模事前学習言語モデル(LLM)をセンサベースHARの汎用時間バックボーンとして再利用するパラダイムシフトを提案する。
提案手法は, 高速収束, 強力なデータ効率, 堅牢なデータ転送を実現する。
論文 参考訳(メタデータ) (2026-05-12T12:06:39Z) - HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing [0.0]
メモリファースト適応フレームワークHY-WU(Weight Unleashing)を提案する。
適応圧力を1つの共有パラメータポイントの上書きから逸脱させる。
HY-WUは神経モジュールとして機能的(操作レベル)メモリを実装している。
論文 参考訳(メタデータ) (2026-03-07T14:40:05Z) - Controllable-LPMoE: Adapting to Challenging Object Segmentation via Dynamic Local Priors from Mixture-of-Experts [16.21786310193235]
制御可能LPMoEと呼ばれる、トレーニング可能なパラメータが少ない新しい動的事前学習パラダイムを提案する。
入力画像から多種多様な局所前駆体を異種畳み込みによりキャプチャする軽量な動的混合局所前駆体抽出器を構築した。
また、コサインアラインな変形性アテンションとチャネル指向適応スケールエンハンスメントを利用した双方向インタラクションアダプタを設計する。
論文 参考訳(メタデータ) (2025-10-24T03:03:59Z) - GLAD: Generalizable Tuning for Vision-Language Models [41.071911050087586]
GLAD (Generalizable LoRA tuning with RegulArized GraDient) という,よりシンプルで汎用的なフレームワークを提案する。
我々は,LoRAを適用するだけで,現在の最先端のプロンプトベースの手法に匹敵するダウンストリームタスクのパフォーマンスが得られることを示す。
論文 参考訳(メタデータ) (2025-07-17T12:58:15Z) - Parameter-Efficient and Memory-Efficient Tuning for Vision Transformer: A Disentangled Approach [87.8330887605381]
本稿では,学習可能なパラメータをわずかに限定して,事前学習した視覚変換器を下流認識タスクに適用する方法を示す。
学習可能で軽量なモジュールを用いてタスク固有のクエリを合成する。
本手法はメモリ制約下での最先端性能を実現し,実環境における適用性を示す。
論文 参考訳(メタデータ) (2024-07-09T15:45:04Z) - SkeleTR: Towrads Skeleton-based Action Recognition in the Wild [86.03082891242698]
SkeleTRは骨格に基づく行動認識のための新しいフレームワークである。
まず、グラフ畳み込みによる各骨格配列の人体内骨格力学をモデル化する。
次に、スタック化されたTransformerエンコーダを使用して、一般的なシナリオにおけるアクション認識に重要な人物のインタラクションをキャプチャする。
論文 参考訳(メタデータ) (2023-09-20T16:22:33Z) - Optimizing a Transformer-based network for a deep learning seismic
processing workflow [0.0]
StorSeismicは、様々な地震処理タスクに対応するためにTransformerをベースとした最近導入されたモデルである。
微調整作業における事前学習と競争の速さを観察し,バニラモデルと比較してトレーニングすべきパラメータを少なくする。
論文 参考訳(メタデータ) (2023-08-09T07:11:42Z) - Motion Style Transfer: Modular Low-Rank Adaptation for Deep Motion
Forecasting [79.56014465244644]
本稿では,新しい領域への深部動き予測モデルを効率的に適用するための伝達学習手法を提案する。
エンコーダ全体を更新する従来の微調整アプローチとは異なり、主な考え方は調整可能なパラメータの量を減らすことである。
提案するアダプタ設計であるMoSAは,いくつかの予測ベンチマークにおいて,先行手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2022-11-06T16:14:17Z) - Adversarial Feature Augmentation and Normalization for Visual
Recognition [109.6834687220478]
最近のコンピュータビジョンの進歩は、分類モデルの一般化能力を改善するために、逆データ拡張を利用する。
本稿では,中間的特徴埋め込みにおける敵対的拡張を提唱する効率的かつ効率的な代替手法を提案する。
代表的なバックボーンネットワークを用いて,多様な視覚認識タスクにまたがる提案手法を検証する。
論文 参考訳(メタデータ) (2021-03-22T20:36:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。