論文の概要: Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment
- arxiv url: http://arxiv.org/abs/2607.07438v1
- Date: Wed, 08 Jul 2026 14:09:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.403509
- Title: Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment
- Title(参考訳): 適応アライメントを用いた2段階多モード核融合による行動品質評価
- Abstract要約: 行動品質アセスメント(AQA)は、人がどれだけ運動を行うかを評価することを目的としている。
ユニモーダルアプローチは、現実の環境での運動品質の微妙な手がかりを捉えるのにしばしば苦労する。
適応アライメントを備えた2段階多モード融合フレームワークであるDualAlignを提案する。
- 参考スコア(独自算出の注目度): 41.72676356491381
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action Quality Assessment (AQA) aims to evaluate how well a person performs a movement, which is essential in applications such as sports scoring, skill assessment, and healthcare. However, unimodal approaches often struggle to capture subtle cues of movement quality in real-world settings. Although multi-modal inputs provide complementary information, existing methods still face two major challenges: heterogeneous modalities often lead to cross-modal misalignment and unstable fusion, and reliable multi-modal annotation is costly, resulting in limited dataset diversity. To address these challenges, we propose DualAlign, a two-stage multi-modal fusion framework with adaptive alignment. The framework first constructs a coherent visual representation by maximizing shared structural information across RGB video, optical flow, and skeleton modalities. Textual semantics are then incorporated after visual stabilization, allowing high-level descriptions to complement rather than distort the underlying visual manifold. To evaluate the framework under realistic multi-modal conditions, we introduce MM--JDM, a movement-quality assessment dataset integrating RGB videos, optical flow, skeleton sequences, and structured text. MM--JDM naturally exhibits modality noise, class imbalance, and label scarcity, making it a challenging benchmark for studying multi-modal fusion and alignment. Extensive experiments show that DualAlign improves average correlation on MM--JDM by 21.16% over the state-of-the-art methods and achieves gains of 3.53% and 5.95% on the RG and Fis-V benchmarks, respectively. DualAlign also remains robust under missing-modality and label-scarce conditions.
- Abstract(参考訳): アクション品質アセスメント(AQA)は、スポーツスコア、スキルアセスメント、医療などの応用に欠かせない運動の実施方法を評価することを目的としている。
しかし、ユニモーダルアプローチは、現実の環境での運動品質の微妙な手がかりを捉えるのに苦労することが多い。
多モード入力は相補的な情報を提供するが、既存の手法は依然として2つの大きな課題に直面している。
これらの課題に対処するため、適応アライメントを備えた2段階のマルチモーダル融合フレームワークであるDualAlignを提案する。
このフレームワークは、まず、RGBビデオ、光学フロー、骨格モーダルの共有構造情報を最大化することにより、コヒーレントな視覚表現を構築する。
テキストセマンティクスは視覚安定化後に組み込まれ、基礎となる視覚多様体を歪ませるのではなく、高レベルな記述を補完することができる。
現実的なマルチモーダル条件下でフレームワークを評価するために,RGBビデオ,光フロー,骨格配列,構造化テキストを統合した運動品質評価データセットMM-JDMを導入する。
MM-JDMは自然にモダリティノイズ、クラス不均衡、ラベル不足を呈し、マルチモーダル融合とアライメントを研究する上で困難なベンチマークとなる。
大規模な実験により、DualAlignは最先端の手法でMM-JDMの平均相関を21.16%改善し、それぞれRGとFis-Vのベンチマークで3.53%と5.95%のゲインを達成した。
DualAlignは、モダリティの欠如やラベルスカース条件下でも堅牢である。
関連論文リスト
- PIDNet: Progressive Implicit Decouple Network for Multimodal Action Quality Assessment [14.92667427129547]
アクション品質アセスメント(AQA)は、ビデオにおける人間のアクションの実行品質を自動的に定量化することを目的としており、競争スポーツ判定などのアプリケーションに有用である。
本稿では,モーダリティ特化情報,モーダル間補完手段,グローバル品質セマンティクスを統合した,プログレッシブな暗黙的疎結合・融合ネットワーク(PIDNet)を提案する。
Rhythmic Gymnastics および Fis-V データセットの実験により、PIDNet は既存の単調法やマルチモーダル法と比較して、良好な誤差制御と高い競合スコアの相関が得られた。
論文 参考訳(メタデータ) (2026-05-09T13:33:16Z) - Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition [60.20529806857076]
マルチモーダル感情認識は、テキスト、ビデオ、音声などの手がかりを融合させ、個人の感情状態を理解する。
従来の手法では、機械的に独立な単調なパフォーマンスに依存することと、感情タスクで要求されるきめ細かい表現と相反する粗粒の融合という2つの主な制限に直面していた。
我々は,マルチスケールバンド分解とエキスパートコラボレーションを通じて,微細な相補的特徴をモデル化するために,Atsukoという名前のComplementarity-Supervised Multi-Band Expert Networkを提案する。
論文 参考訳(メタデータ) (2026-03-07T03:58:48Z) - SGMA: Semantic-Guided Modality-Aware Segmentation for Remote Sensing with Incomplete Multimodal Data [31.146366498415784]
マルチモーダルセマンティックセグメンテーションは、リモートセンシング地球観測のための多様なセンサーからの補完情報を統合する。
IMSSは3つの主要な課題に直面している:マルチモーダル不均衡、支配的なモダリティが脆弱なモダリティを抑えること、スケール、形状、方向のクラス内変化、矛盾するキーと矛盾するセマンティック応答を生み出すクロスモーダル不均一。
本稿では,セマンティック・ガイド・モダリティ・アウェア(SGMA)フレームワークを提案する。セマンティック・モダリティ・アウェア(SGMA)フレームワークは,クラス内変動の低減とセマンティックガイダンスによる相互不整合の緩和を図りつつ,バランスの取れたマルチモーダル学習を実現する。
論文 参考訳(メタデータ) (2026-03-03T01:28:21Z) - Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment [5.262258418692889]
長時間の行動品質評価(AQA)は、最大数分間の動画における人間の活動の質を評価することに焦点を当てている。
LMAC-Net(Long-term Multimodal Attention Consistency Network)では,マルチモーダル特徴を明示的に整列する多モーダルアテンション一貫性機構を導入している。
RGデータセットとFis-Vデータセットで実施された実験は、LMAC-Netが既存の手法を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2025-07-29T15:58:39Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - DMAF-Net: An Effective Modality Rebalancing Framework for Incomplete Multi-Modal Medical Image Segmentation [7.441945494253697]
DMAF-Net(Dynamic Modality-Aware Fusion Network)と呼ばれる新しいモデルを提案する。
まず、欠落したモダリティ干渉を抑制するために、動的モダリティ・アウェア・フュージョン(DMAF)モジュールを導入する。
第二に、グローバルな特徴アライメントを強制するために、相乗的関係蒸留とプロトタイプ蒸留のフレームワークを設計する。
第3に、不均衡な損失率で最適化を安定化するための動的トレーニングモニタリング(DTM)戦略を提案する。
論文 参考訳(メタデータ) (2025-06-13T11:38:18Z) - BiXFormer: A Robust Framework for Maximizing Modality Effectiveness in Multi-Modal Semantic Segmentation [55.486872677160015]
マスクレベルの分類タスクとしてマルチモーダルなセマンティックセグメンテーションを再構成する。
統一モダリティマッチング(UMM)とクロスモダリティアライメント(CMA)を統合したBiXFormerを提案する。
合成および実世界のマルチモーダルベンチマーク実験により,本手法の有効性を実証した。
論文 参考訳(メタデータ) (2025-06-04T08:04:58Z) - Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark [69.02666229531322]
モダリティ不完全産業異常検出(MIIAD)の先駆的研究を紹介する。
その結果,既存のMIAD手法はMIIADベンチでは性能が悪く,性能が著しく低下していることが判明した。
本稿では,新しい2段階のロバストモードアリティファジングと検出フレームwoRk(RADAR)を提案する。
論文 参考訳(メタデータ) (2024-10-02T16:47:55Z) - Efficient Multimodal Transformer with Dual-Level Feature Restoration for
Robust Multimodal Sentiment Analysis [47.29528724322795]
マルチモーダルセンシング分析(MSA)が近年注目を集めている。
著しい進歩にもかかわらず、堅牢なMSAへの道にはまだ2つの大きな課題がある。
デュアルレベル特徴回復 (EMT-DLFR) を用いた高効率マルチモーダル変圧器 (Efficient Multimodal Transformer) を提案する。
論文 参考訳(メタデータ) (2022-08-16T08:02:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。