論文の概要: Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition
- arxiv url: http://arxiv.org/abs/2608.04623v1
- Date: Wed, 05 Aug 2026 09:28:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.801087
- Title: Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition
- Title(参考訳): 拡散における視覚的アンコリング:マルチモーダルゼロショットスケルトン行動認識
- Authors: Zehao Bao, Shujun Guo, Bruce X. B. Yu,
- Abstract要約: Zero-shot Skeleton Action Recognition (ZSAR) は、見えない動作が類似した骨格関節ダイナミクスを共有するが、オブジェクトやシーンコンテキストが異なる場合、あいまいなままである。
既存のマルチモーダルメソッドは通常、独立したスケルトンとRGBスコアリングブランチを保持し、出力を融合する。
骨格データ再構成時に安定した視覚的アンカーとして機能する非拡散RGB条件トークンを用いたテキスト条件記述型変換器を提案する。
- 参考スコア(独自算出の注目度): 4.970910262474302
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Zero-shot Skeleton Action Recognition (ZSAR) remains ambiguous when unseen actions share similar skeleton joint dynamics but differ in objects or scene context. RGB provides these missing cues, yet existing multimodal methods typically maintain independent skeleton and RGB scoring branches and fuse their outputs. Without using unlabeled test data for adaptation or fusion calibration, a fixed fusion weight cannot capture class-pair-dependent modality reliability, while an adaptive rule lacks target-side feedback for deciding which branch should dominate. We bypass this weight-selection problem via the classify-by-generation paradigm, where each class is scored by how accurately a text-conditioned denoiser predicts the noise added to the skeleton feature. This formulation separates the progressively corrupted skeleton from fixed conditioning, allowing RGB and text to jointly condition a single class-scoring function rather than produce independent scores. We instantiate this idea as Multimodal Triplet Diffusion for Skeleton-Text Matching (TDSM-MM), augmenting a text-conditioned denoising Transformer with a non-diffused RGB condition token that serves as a stable visual anchor during skeleton data reconstruction. Our proposed TDSM-MM has been ablated via extensive experiments and achieved the best inductive accuracy on three of four NTU-60/120 splits and surpasses the transductive state-of-the-art on NTU-120 96/24 (i.e., 71.3% vs. 69.1%), without test-time adaptation, suggesting that diffusion-based methods can be a promising direction for zero-shot learning.
- Abstract(参考訳): Zero-shot Skeleton Action Recognition (ZSAR) は、見えない動作が類似した骨格関節ダイナミクスを共有するが、オブジェクトやシーンコンテキストが異なる場合、あいまいなままである。
RGBは、これらの欠落した手がかりを提供するが、既存のマルチモーダルメソッドは通常、独立したスケルトンとRGBスコアングブランチを保持し、出力を融合させる。
適応化や融合校正のためにラベル付けされていないテストデータを使用しなければ、固定融合重みはクラスペアに依存したモダリティの信頼性を捉えることができず、適応ルールはどのブランチが支配されるべきかを決定するための目標側フィードバックを欠いている。
この重み選択問題は,テキストコンディショニングされたデノイザが骨格に付加されるノイズをどれだけ正確に予測するかによって各クラスがスコア付けされる,分類・世代別パラダイムによって回避される。
この定式化は、進行的に腐敗した骨格を固定された条件付けから切り離し、RGBとテキストが独立したスコアを生成するのではなく、単一のクラススコア関数を共同で条件付けすることを可能にする。
我々は、このアイデアを、スケルトンテキストマッチング(TDSM-MM)のためのマルチモーダルトリプレット拡散(Multimodal Triplet Diffusion for Skeleton-Text Matching)として、スケルトンデータ再構成時に安定した視覚的アンカーとして機能する非拡散RGB条件トークンでテキスト条件付き復調変換器を増強する。
NTU-120 96/24 (71.3% vs. 69.1%) では, 拡散法がゼロショット学習の有望な方向である可能性が示唆された。
関連論文リスト
- Probing Diffusion Denoising Dynamics for Contrastive Representation Learning [48.679227622825806]
本研究では,事前学習した拡散モデルの認知力学を識別的表現学習に適応させる方法について検討する。
D$3$CL をこの問題の調査として提示する。
雑音レベルのコントラスト学習は、生成性能を維持しつつ、識別的タスクの認知表現を構造化できることを示す。
論文 参考訳(メタデータ) (2026-07-10T03:23:44Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities [54.87947751720332]
欠落モード設定下での安定した性能を維持するために,新しいセグメンテーションモデルD3Segを提案する。
提案モデルでは, 腫瘍造影法 (ET) で約1.5~2.0%, 腫瘍コア法 (TC) で約1.0%, 複数の欠損モードで約1.0%を達成している。
論文 参考訳(メタデータ) (2026-05-21T09:55:42Z) - TripleFDS: Triple Feature Disentanglement and Synthesis for Scene Text Editing [56.73004765030206]
STE(Scene Text Editing)は、視覚的一貫性を維持しながら、画像中のテキストを自然に修正することを目的としている。
本稿では,モジュラー属性をアンタングル化したSTEのための新しいフレームワークであるTripleFDSを提案する。
TripleFDSは、メインストリームのSTEベンチマークで最先端の画像忠実度(SSIM 44.54)とテキスト精度(ACC 93.58%)を達成する。
論文 参考訳(メタデータ) (2025-11-17T14:15:03Z) - UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation [104.59740403500132]
マルチモーダルイメージセグメンテーションは、不完全/破損したモダリティの劣化による実際のデプロイメント課題に直面している。
階層型自己教師型補償(HSSC)による統一Modality-relaxセグメンテーションネットワーク(UniMRSeg)を提案する。
我々のアプローチは、入力レベル、特徴レベル、出力レベルをまたいだ完全なモダリティと不完全なモダリティの間の表現ギャップを階層的に橋渡しします。
論文 参考訳(メタデータ) (2025-09-19T17:29:25Z) - Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition [25.341177384559174]
ゼロショットスケルトンに基づくアクション認識では、スケルトン特徴とアクションラベルのテキスト特徴との整合が不可欠である。
以前の方法は、スケルトンとテキスト潜在空間の直接的なアライメントに焦点を当てていた。
ZSARのための拡散型スケルトンテキストアライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-16T08:55:18Z) - SA-DVAE: Improving Zero-Shot Skeleton-Based Action Recognition by Disentangled Variational Autoencoders [7.618223798662929]
本稿では,分散変分オートエンコーダを用いたSA-DVAE-セマンティックアライメントを提案する。
このアイデアは,一対のモダリティ特異的変分オートエンコーダと全補正ペナルティによって実現される。
実験の結果,SA-DAVEは既存手法よりも性能が向上していることがわかった。
論文 参考訳(メタデータ) (2024-07-18T12:35:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。