論文の概要: PIDNet: Progressive Implicit Decouple Network for Multimodal Action Quality Assessment
- arxiv url: http://arxiv.org/abs/2605.08945v1
- Date: Sat, 09 May 2026 13:33:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.982982
- Title: PIDNet: Progressive Implicit Decouple Network for Multimodal Action Quality Assessment
- Title(参考訳): PIDNet:マルチモーダル行動品質評価のためのプログレッシブ・インシシシット・デデュープル・ネットワーク
- Abstract要約: アクション品質アセスメント(AQA)は、ビデオにおける人間のアクションの実行品質を自動的に定量化することを目的としており、競争スポーツ判定などのアプリケーションに有用である。
本稿では,モーダリティ特化情報,モーダル間補完手段,グローバル品質セマンティクスを統合した,プログレッシブな暗黙的疎結合・融合ネットワーク(PIDNet)を提案する。
Rhythmic Gymnastics および Fis-V データセットの実験により、PIDNet は既存の単調法やマルチモーダル法と比較して、良好な誤差制御と高い競合スコアの相関が得られた。
- 参考スコア(独自算出の注目度): 14.92667427129547
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action quality assessment (AQA) aims to automatically quantify the execution quality of human actions in videos and is valuable for applications such as competitive sports judging. In multimodal AQA, quality evidence from different modalities is heterogeneous, and quality cues evolve progressively over time. Existing methods often rely on coarse fusion or unified temporal modeling, which may blur modality-specific cues, preserve cross-modal redundancy, and weaken stage-specific quality evidence. To address these issues, we propose a progressive implicit decoupling and fusion network (PIDNet) that progressively integrates modality-specific information, cross-modal complementary cues, and global quality semantics for accurate assessment. Specifically, we design an iMambaWave module that maps RGB, optical flow, and audio features into a shared latent space and disentangles them with a Bi-Mamba branch and a wavelet-transform branch to capture long-range temporal dependencies and local perturbation details, respectively. A gated aggregation mechanism adaptively fuses temporal and frequency-domain information. We further build a three-stage progressive fusion network using Group3M blocks, where modality complementary attention retrieves cross-modal evidence while suppressing redundancy, and multi-scale convolutions enrich feature representations. Experiments on the Rhythmic Gymnastics and Fis-V datasets show that PIDNet achieves highly competitive score correlation with favorable error control compared with existing unimodal and multimodal methods. Ablation studies verify the effectiveness of each component. Moreover, iMambaWave consistently improves visual representation and temporal modeling across multiple backbones, showing good generalization and plug-and-play capability.
- Abstract(参考訳): アクション品質アセスメント(AQA)は、ビデオにおける人間のアクションの実行品質を自動的に定量化することを目的としており、競争スポーツ判定などのアプリケーションに有用である。
マルチモーダルAQAでは、異なるモダリティによる品質証拠は不均一であり、品質の手がかりは時間とともに徐々に進化していく。
既存の手法は、しばしば粗い融合や統合時間モデリングに依存しており、これはモダリティ固有の手がかりを曖昧にし、相互の冗長性を保ち、ステージ固有の品質証拠を弱める可能性がある。
これらの課題に対処するため,モーダリティ特化情報,相互補完的手法,グローバル品質セマンティクスを段階的に統合する,プログレッシブな暗黙的疎結合・融合ネットワーク(PIDNet)を提案する。
具体的には、RGB、光フロー、オーディオ特徴を共有潜在空間にマッピングするiMambaWaveモジュールを設計し、それらをBi-MambaブランチとWavelet-transformブランチで切り離して、それぞれ長距離時間依存性と局所摂動の詳細をキャプチャする。
ゲート集約機構は、時間領域と周波数領域情報を適応的に融合する。
さらに、3段階のプログレッシブ・フュージョン・ネットワークをGroup3Mブロックを用いて構築し、モダリティ補完的注意が冗長性を抑えながらクロスモーダルな証拠を検索し、マルチスケールの畳み込みが特徴表現を豊かにする。
Rhythmic Gymnastics および Fis-V データセットの実験により、PIDNet は既存の単調法やマルチモーダル法と比較して、良好な誤差制御と高い競合スコアの相関が得られた。
アブレーション研究は各成分の有効性を検証する。
さらに、iMambaWaveは、複数のバックボーンにまたがる視覚的表現と時間的モデリングを一貫して改善し、優れた一般化とプラグアンドプレイ機能を示している。
関連論文リスト
- Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment [41.72676356491381]
行動品質アセスメント(AQA)は、人がどれだけ運動を行うかを評価することを目的としている。
ユニモーダルアプローチは、現実の環境での運動品質の微妙な手がかりを捉えるのにしばしば苦労する。
適応アライメントを備えた2段階多モード融合フレームワークであるDualAlignを提案する。
論文 参考訳(メタデータ) (2026-07-08T14:09:13Z) - CATNet: Collaborative Alignment and Transformation Network for Cooperative Perception [9.983779569276475]
コラボレーティブアライメント・アンド・トランスフォーメーション・ネットワーク(CATNet)は、マルチエージェントシステムにおける時間遅延とノイズ干渉を解決する適応補償フレームワークである。
まず、非同期機能ストリームの整合性を備えた時空間リカレントシンクロナイゼーション(STSync)を紹介します。
第2に,大域的雑音を抑制し,局所的特徴歪みを再構成するDual-Branch Wavelet Enhanced Denoiser (WTDen) を設計する。
第三に、ロバスト融合のための重要な知覚機能に動的にフォーカスする適応的特徴選択器(AdpSel)を構築する。
論文 参考訳(メタデータ) (2026-03-05T15:07:36Z) - FusAD: Time-Frequency Fusion with Adaptive Denoising for General Time Series Analysis [92.23551599659186]
時系列分析は、金融、医療、産業、気象学などの分野において重要な役割を果たす。
FusADは多様な時系列タスク用に設計された統合分析フレームワークである。
論文 参考訳(メタデータ) (2025-12-16T04:34:27Z) - UniDiff: A Unified Diffusion Framework for Multimodal Time Series Forecasting [90.47915032778366]
マルチモーダル時系列予測のための統合拡散フレームワークUniDiffを提案する。
コアには統一的で並列な融合モジュールがあり、単一のクロスアテンション機構がタイムスタンプからの構造化情報とテキストからのセマンティックコンテキストを統合する。
8つの領域にわたる実世界のベンチマークデータセットの実験は、提案したUniDiffモデルが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-12-08T05:36:14Z) - FAIM: Frequency-Aware Interactive Mamba for Time Series Classification [87.84511960413715]
時系列分類(TSC)は、環境モニタリング、診断、姿勢認識など、多くの実世界の応用において重要である。
本稿では,周波数対応対話型マンバモデルであるFAIMを提案する。
FAIMは既存の最先端(SOTA)手法を一貫して上回り、精度と効率のトレードオフが優れていることを示す。
論文 参考訳(メタデータ) (2025-11-26T08:36:33Z) - Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment [5.262258418692889]
長時間の行動品質評価(AQA)は、最大数分間の動画における人間の活動の質を評価することに焦点を当てている。
LMAC-Net(Long-term Multimodal Attention Consistency Network)では,マルチモーダル特徴を明示的に整列する多モーダルアテンション一貫性機構を導入している。
RGデータセットとFis-Vデータセットで実施された実験は、LMAC-Netが既存の手法を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2025-07-29T15:58:39Z) - DAMS:Dual-Branch Adaptive Multiscale Spatiotemporal Framework for Video Anomaly Detection [7.117824587276951]
この研究は、マルチレベル特徴とデカップリング融合に基づくDual-Branch Adaptive Multiscale Stemporal Framework (DAMS)と呼ばれるデュアルパスアーキテクチャを提供する。
主処理経路は、適応型マルチスケール時間ピラミッドネットワーク(AMTPN)と畳み込みブロック注意機構(CBAM)を統合している。
論文 参考訳(メタデータ) (2025-07-28T08:42:00Z) - CLAMP: Contrastive Learning with Adaptive Multi-loss and Progressive Fusion for Multimodal Aspect-Based Sentiment Analysis [0.6961946145048322]
本稿では,Adaptive Multi-lossとProgressive Attention Fusionを用いた,エンドツーエンドのコントラスト学習フレームワークを提案する。
このフレームワークは、Progressive Attention Fusion Network、Multi-task Contrastive Learning、Adaptive Multi-loss Aggregationの3つの新しいモジュールで構成されている。
標準の公開ベンチマークによる評価は、CLAMPが既存の最先端技術よりも一貫して優れていることを示している。
論文 参考訳(メタデータ) (2025-07-21T11:49:57Z) - Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models [0.0]
モーダリティ・アウェア・アダプティブ・フュージョン・スケジューリング(MA-AFS)は、各モーダリティの寄与をインスタンス単位で動的に調節することを学ぶ。
本研究は, 適応融合の重要性を強調し, 信頼性と不確実性を考慮したマルチモーダル学習に向けた有望な方向性を開く。
論文 参考訳(メタデータ) (2025-06-15T05:57:45Z) - Assessor360: Multi-sequence Network for Blind Omnidirectional Image
Quality Assessment [50.82681686110528]
Blind Omnidirectional Image Quality Assessment (BOIQA)は、全方位画像(ODI)の人間の知覚品質を客観的に評価することを目的としている。
ODIの品質評価は、既存のBOIQAパイプラインがオブザーバのブラウジングプロセスのモデリングを欠いているという事実によって著しく妨げられている。
Assessor360と呼ばれるBOIQAのための新しいマルチシーケンスネットワークを提案する。
論文 参考訳(メタデータ) (2023-05-18T13:55:28Z) - Attention Bottlenecks for Multimodal Fusion [90.75885715478054]
機械知覚モデルは典型的にはモダリティに特化しており、単調なベンチマークのために最適化されている。
複数の層でのモジュラリティ融合に「融合」を用いる新しいトランスフォーマーアーキテクチャを導入する。
我々は、徹底的なアブレーション研究を行い、複数のオーディオ視覚分類ベンチマークで最先端の結果を得る。
論文 参考訳(メタデータ) (2021-06-30T22:44:12Z) - Searching Multi-Rate and Multi-Modal Temporal Enhanced Networks for
Gesture Recognition [89.0152015268929]
RGB-Dジェスチャ認識のための最初のニューラルアーキテクチャサーチ(NAS)手法を提案する。
提案手法は,1)3次元中央差分畳畳み込み(3D-CDC)ファミリーによる時間的表現の強化,および多モードレート分岐と横方向接続のための最適化されたバックボーンを含む。
結果として得られたマルチレートネットワークは、RGBと深さ変調と時間力学の関係を理解するための新しい視点を提供する。
論文 参考訳(メタデータ) (2020-08-21T10:45:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。