論文の概要: Fine-Grained Action Recognition with Cross-Attentive Latent Sparse Experts
- arxiv url: http://arxiv.org/abs/2608.13458v1
- Date: Thu, 13 Aug 2026 16:41:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.60622
- Title: Fine-Grained Action Recognition with Cross-Attentive Latent Sparse Experts
- Title(参考訳): 交叉性遅発性スパース専門家による微粒化行動認識
- Abstract要約: FineXは微細なキューをRGBの外観に分解し、ヒートマップ幾何学と骨格グラフトポロジーを描画する。
FineXは、Gym99、Gym288、Diving48の最先端の結果を達成する。
- 参考スコア(独自算出の注目度): 3.8329413925526192
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-grained human action recognition (FHAR) must distinguish visually similar actions that differ mainly in body configuration, timing, or local appearance. RGB representations retain visual context but often suppress joint-level geometry, whereas skeleton representations encode kinematics but discard dense spatial detail. We introduce FineX, which factorizes fine-grained cues into RGB appearance, pose heatmap geometry, and skeletal-graph topology. Pairwise cross-attention enables symmetric, stream-preserving information exchange, followed by a streamwise latent sparse Mixture-of-Experts that routes each representation to a content-dependent subset of shared experts, regularized by a load-balancing objective. FineX achieves state-of-the-art results on Gym99, Gym288, and Diving48. On the long-tailed Gym288, it raises mean class accuracy from 68.6% to 76.2% (+7.6 points) without textual supervision or large-scale vision-language pre-training, demonstrating the benefit of structured visual-pose-graph fusion and conditional expert refinement for FHAR.
- Abstract(参考訳): きめ細かい人間の行動認識(FHAR)は、主に体の構成、タイミング、局部的な外観が異なる視覚的に類似した動作を区別しなければならない。
RGB表現は視覚的文脈を保持するが、しばしば関節レベルの幾何学を抑圧するが、スケルトン表現はキネマティクスをエンコードするが、密集した空間的詳細を放棄する。
本研究では,微細なキューをRGBの外観に分解し,熱マップの形状と骨格図のトポロジーを示すFineXを紹介する。
ペアワイズ・クロスアテンションにより、対称なストリーム保存情報交換が可能となり、続いてストリームワイズ・スパース・ミックス・オブ・エキスパートが、ロードバランシングの目的によって正規化され、各表現を共有専門家のコンテンツ依存サブセットにルーティングする。
FineXは、Gym99、Gym288、Diving48の最先端の結果を達成する。
長い尾のGym288では、平均クラス精度が68.6%から76.2%(+7.6ポイント)に上昇し、テキストによる監督や大規模な視覚言語による事前訓練が無くなり、構造化されたビジュアル・フォー・グラフ・フュージョンとFHARの条件付きエキスパート・リファインメントの利点が証明された。
関連論文リスト
- TailProp: content-adaptive light- and heavy-tailed propagation for vision [11.825348402205051]
本稿では,階層型視覚バックボーンであるTailPropを紹介した。
TailPropは画像分類、オブジェクト検出、セマンティックセグメンテーション、ロバスト性、クロスバック復元などにわたって、一致した伝搬ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-09-10T04:38:45Z) - Text-Guided Visual Dependency Graph Learning with Cross-Modal Attention Priors [11.338098263634537]
本稿では,視覚言語表現学習とスパースガウスモデルを橋渡しするフレームワークであるCM-GLassoを提案する。
CM-GLassoは、画像としてクラス属性記述を描画して処理するテキスト視覚化戦略(i)、天然画像としてSigLIP-2ビジョンエンコーダ(ii)、高次元パッチを小さなセマンティックグラフノードに凝縮するクロスアテンション蒸留機構(ii)、共有およびクラス固有精度コンポーネントを単一の凸対象内で推定する共同ADMM定式化(iii)、の3つの主要なコンポーネントを導入している。
論文 参考訳(メタデータ) (2026-08-19T09:57:34Z) - Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach [60.596944437968524]
partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
論文 参考訳(メタデータ) (2026-07-01T10:03:11Z) - Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space [63.220767051340005]
赤外線と可視画像の融合は相補的なモダリティを統合することを目的としている。
双曲的多様体学習によるテキスト駆動型融合フレームワークを提案する。
実験の結果,提案手法はベンチマークデータセットの最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2026-06-13T04:33:33Z) - Graph-based Semantic Calibration Network for Unaligned UAV RGBT Image Semantic Segmentation and A Large-scale Benchmark [18.688304653741522]
微細なRGBT画像セマンティックセマンティックセグメンテーションは、全天候無人航空機(UAV)のシーン理解に不可欠である。
UAV RGBT画像セマンティックセマンティックスセグメンテーションのためのグラフベースセマンティックネットワーク(GSCNet)を提案する。
GSCNetは最先端の手法よりも優れており,粒度の細かいカテゴリーでは顕著に向上している。
論文 参考訳(メタデータ) (2026-04-29T17:01:38Z) - Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation [0.3437656066916039]
画像セグメント化の参照は、自然言語表現によって記述された画像領域のためのピクセルレベルのマスクを作成することを目的としている。
画像セグメンテーションを参照するための空間分割型エキスパートルーティングアーキテクチャSERAを提案する。
SERAは、視覚言語フレームワーク内の2つの相補的な段階において、軽量で表現を意識した専門家の洗練を導入する。
論文 参考訳(メタデータ) (2026-03-13T00:37:20Z) - Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation [120.23172120151821]
本稿では,事前学習した拡散モデルのバックボーンから視覚的特徴と意味的特徴を分離するための新しいアプローチを提案する。
注釈付きセマンティックと視覚対応を備えた画像ペアを構築する自動パイプラインを導入する。
被験者駆動画像生成における視覚的不整合を定量化する新しい指標であるビジュアルセマンティックマッチングを提案する。
論文 参考訳(メタデータ) (2025-09-26T07:11:55Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - CRIA: A Cross-View Interaction and Instance-Adapted Pre-training Framework for Generalizable EEG Representations [52.251569042852815]
CRIAは、可変長および可変チャネルコーディングを使用して、異なるデータセット間でEEGデータの統一表現を実現する適応フレームワークである。
このモデルでは、時間的、スペクトル的、空間的特徴を効果的に融合させるクロスアテンション機構を採用している。
テンプル大学脳波コーパスとCHB-MITデータセットによる実験結果から、CRIAは既存の方法よりも、同じ事前学習条件で優れていることが示された。
論文 参考訳(メタデータ) (2025-06-19T06:31:08Z) - Geometry-Editable and Appearance-Preserving Object Compositon [67.98806888489385]
汎用オブジェクト合成(GOC)は、対象オブジェクトを望まれる幾何学的性質を持つ背景シーンにシームレスに統合することを目的としている。
近年のアプローチは意味的埋め込みを導出し、それらを高度な拡散モデルに統合し、幾何学的に編集可能な生成を可能にする。
本稿では,まずセマンティックな埋め込みを活用して,所望の幾何学的変換を暗黙的にキャプチャするDistangled Geometry-editable and Outearance-Preserving Diffusionモデルを提案する。
論文 参考訳(メタデータ) (2025-05-27T09:05:28Z) - Mixture of Scale Experts for Alignment-free RGBT Video Object Detection and A Unified Benchmark [5.068440399797739]
既存のRGB-Thermal Video Object Detection (RGBT VOD) 法は、画像ペアの手動アライメントに依存している。
我々はMixture of Scale Experts Network(MSENet)と呼ばれる新しいフレームワークを提案する。
MSENetは、異なる知覚スケールで訓練された複数の専門家を統合し、RGBと熱画像のペア間のスケールの差異をキャプチャすることを可能にする。
論文 参考訳(メタデータ) (2024-10-16T01:06:12Z) - Guided Interpretable Facial Expression Recognition via Spatial Action Unit Cues [55.97779732051921]
オーキューを分類器学習に明示的に組み込むための新しい学習戦略が提案されている。
分類性能を劣化させることなく階層的解釈性を向上させることができることを示す。
論文 参考訳(メタデータ) (2024-02-01T02:13:49Z) - Part Aware Contrastive Learning for Self-Supervised Action Recognition [18.423841093299135]
本稿では,骨格表現学習のための注意に基づくコントラスト学習フレームワークであるSkeAttnCLRを提案する。
提案するSkeAttnCLRはNTURGB+D, NTU120-RGB+D, PKU-MMDデータセットの最先端手法より優れている。
論文 参考訳(メタデータ) (2023-05-01T05:31:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。