論文の概要: One for All: Generalist Foundation Model for Cross-Sensor Skeleton Representation Learning
- arxiv url: http://arxiv.org/abs/2609.07078v1
- Date: Mon, 07 Sep 2026 06:05:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:44:22.890418
- Title: One for All: Generalist Foundation Model for Cross-Sensor Skeleton Representation Learning
- Title(参考訳): オール・フォー・オール:クロスセンサー・骨格表現学習のためのジェネリスト基礎モデル
- Abstract要約: 各種センサを用いたセンサ統一型骨格表現学習を実現するために,SOfA(Skeleton One for All)を導入する。
各種の関節計数による次元的ギャップに対応するため,学習可能な標準関節スロットの固定サイズセットを導入する。
SOfAは、センサー固有の入力から骨格情報を動的に集約するアテンションメカニズムによってこれらのスロットを埋める。
- 参考スコア(独自算出の注目度): 30.16840983345016
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: For learning generalizable motion representations from large-scale unlabeled data, Self-supervised learning (SSL) has become a widely adopted methodology. However, existing approaches are primarily limited by the inherent heterogeneity of skeleton data---characterized by varying joint counts, indexing protocols, and topological structures across different sensors---which typically necessitates training separate, sensor-specific, or even entirely dataset-specific models. To overcome this, we introduce SOfA (Skeleton One for All), the first generalist foundation model designed to achieve sensor-unified skeleton representation learning across diverse sensors. To accommodate the dimensional gap caused by varying joint counts, we introduce a fixed-size set of learnable Canonical Joint Slots, acting as a universal vessel that seamlessly accommodates arbitrary skeletal topologies. SOfA fills these slots via an attention mechanism that dynamically aggregates skeletal information from sensor-specific inputs. Furthermore, we resolve joint index misalignment between various sensors by introducing a Semantic Joint Embedding derived from a pre-trained text encoder, rather than relying on absolute positional embeddings. To validate our approach, we standardized ten 3D skeleton datasets for unified training. Extensive experiments demonstrate that SOfA can serve as a truly universal encoder, achieving state-of-the-art (SOTA) performance across a wide range of downstream tasks and sensor types, often outperforming dataset-specific specialist models with a single foundation model.
- Abstract(参考訳): 大規模未ラベルデータから一般化可能な動作表現を学習するために,自己教師付き学習(SSL)が広く採用されている。
しかし、既存のアプローチは、主に、様々な関節数、インデックスプロトコル、異なるセンサー間のトポロジ構造によって特徴付けられる、スケルトンデータ固有の不均一性によって制限されている。
そこで本研究では,センサ統一型骨格表現学習を実現するための基礎モデルであるSOfA(Skeleton One for All)を紹介する。
任意の骨格トポロジをシームレスに許容する普遍的な容器として機能する,学習可能な標準関節スロットの固定サイズセットを導入する。
SOfAは、センサー固有の入力から骨格情報を動的に集約するアテンションメカニズムによってこれらのスロットを埋める。
さらに,定位埋め込みに頼るのではなく,事前学習したテキストエンコーダをベースとしたセマンティック・ジョイント・エンベディングを導入することで,各種センサ間の協調インデックスの不整合を解消する。
アプローチを検証するため、統一トレーニングのために10の3Dスケルトンデータセットを標準化した。
大規模な実験では、SOfAが真に普遍的なエンコーダとして機能し、幅広い下流タスクやセンサタイプにわたる最先端(SOTA)のパフォーマンスを実現し、単一の基盤モデルでデータセット固有のスペシャリストモデルを上回ることが示されている。
関連論文リスト
- SSC-Priors: Exploring Semantic and Visibility Priors to Boost Lidar Semantic Scene Completion [61.665449818739155]
本稿では,ライダー・セマンティック・シーン・コンプリート(SSC)のための既存ネットワークの性能向上戦略について検討する。
我々は、既存のアプローチを改善するために、意味的な擬似ラベルとセンサ可視情報を使用する。
そこで本研究では,既成のSSCモデルの性能を著しく向上させ,意味的な擬似ラベルを用いた入力点雲の実現について述べる。
論文 参考訳(メタデータ) (2026-09-15T16:37:46Z) - One Model to Magnify Them All: Efficient Scale-Invariant Histopathology via Conditional Normalization and Continuous Magnification Training [2.519619892651923]
ディープラーニングモデルは、スケールの変動に敏感である。
本研究では,小画素サイズからアフィンパラメータを生成する機構である条件正規化(CLN)を提案する。
PANDA前立腺癌データセットでは、我々のアプローチは独立に訓練された単磁化モデルと一致し、評価された倍率ごとに上位3人のパフォーマーの中でランク付けされる。
論文 参考訳(メタデータ) (2026-08-10T10:28:43Z) - Skeleton-to-Image Encoding: Enabling Skeleton Representation Learning via Vision-Pretrained Models [110.11712022072975]
骨格配列を画像ライクなデータに変換する新しい表現であるSkeleton-to-Imageを紹介する。
この符号化により、自己教師付き骨格表現学習のための強力な視覚事前学習モデルが利用可能となる。
論文 参考訳(メタデータ) (2026-03-06T06:54:55Z) - One Language-Free Foundation Model Is Enough for Universal Vision Anomaly Detection [65.11602552904456]
Universal Visual Anomaly Detection (AD) は、オープンかつダイナミックなシナリオに向けて、異常画像とセグメント異常領域を識別することを目的としている。
現在の手法は、複雑なプロンプトエンジニアリング、精巧な適応モジュール、そして挑戦的な訓練戦略に苦しむことが多い。
本稿では,Universal Vision Anomaly Detection(UniADet)のための,恥ずかしいほどシンプルで汎用的で効果的なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-09T06:05:18Z) - SpecAware: A Spectral-Content Aware Foundation Model for Unifying Multi-Sensor Learning in Hyperspectral Remote Sensing Mapping [9.392313789126714]
SpecAwareは、HSIマッピングのためのマルチセンサー学習を統合するための新しいハイパースペクトルスペクトルコンテンツ認識基盤モデルである。
SpecAwareのコアは、HSIデータのための2ステップのハイパーネットワーク駆動エンコーディングプロセスである。
6つのデータセットの実験では、SpecAwareが優れた特徴表現を学習できることが示されている。
論文 参考訳(メタデータ) (2025-10-31T06:28:14Z) - CoPS: Conditional Prompt Synthesis for Zero-Shot Anomaly Detection [6.1568149026052374]
Conditional Prompt Synthesis (CoPS)は、視覚的特徴に条件付き動的プロンプトを合成し、ZSAD性能を向上させる新しいフレームワークである。
CoPSは、13の産業および医療データセットの分類とセグメンテーションの両方において、最先端の手法を2.5%AUROCで上回っている。
論文 参考訳(メタデータ) (2025-08-05T13:47:45Z) - Private Training & Data Generation by Clustering Embeddings [74.00687214400021]
差分プライバシー(DP)は、個々のデータを保護するための堅牢なフレームワークを提供する。
本稿では,DP合成画像埋め込み生成のための新しい原理的手法を提案する。
経験的に、合成的に生成された埋め込みに基づいて訓練された単純な2層ニューラルネットワークは、最先端(SOTA)分類の精度を達成する。
論文 参考訳(メタデータ) (2025-06-20T00:17:14Z) - Spatial-Temporal-Spectral Unified Modeling for Remote Sensing Dense Prediction [20.1863553357121]
リモートセンシングのための現在のディープラーニングアーキテクチャは、基本的に堅固である。
本稿では,統合モデリングのための空間時間スペクトル統一ネットワーク(STSUN)について紹介する。
STSUNは任意の空間サイズ、時間長、スペクトル帯域で入力および出力データに適応することができる。
様々な密集した予測タスクと多様な意味クラス予測を統一する。
論文 参考訳(メタデータ) (2025-05-18T07:39:17Z) - Toward Foundation Model for Multivariate Wearable Sensing of Physiological Signals [2.370585289844609]
本稿では,ウェアラブルセンシングデータから情報表現を抽出するための,最初のマルチモーダル・ユビキタス基盤モデルを提案する。
具体的には,センサ内およびセンサ間の両方の信号パターンを検出するための特別な連絡トークンを共用したチャネル認識型アテンション機構を設計する。
本モデルでは, メンタルヘルス, 身体状態推定, バイタルサイン推定, 疾患リスク評価など, 11のパブリックなウェアラブルセンシングデータセットに対して, 異常な一般化性を示す。
論文 参考訳(メタデータ) (2024-12-12T23:35:18Z) - A Generically Contrastive Spatiotemporal Representation Enhancement for 3D Skeleton Action Recognition [10.403751563214113]
本稿では, 比較時空間表現拡張(CSRE)フレームワークを提案する。
具体的には、その表現を空間的特徴と時間的特徴に分解し、微細な動きパターンを探索する。
潜伏したデータ分布を明示的に活用するために、コントラスト学習に注意的特徴を用いて、クロスシーケンスセマンティックリレーションをモデル化する。
論文 参考訳(メタデータ) (2023-12-23T02:54:41Z) - Domain Adaptive Synapse Detection with Weak Point Annotations [63.97144211520869]
弱点アノテーションを用いたドメイン適応型シナプス検出のためのフレームワークであるAdaSynを提案する。
I SBI 2023のWASPSYNチャレンジでは、我々の手法が第1位にランクインした。
論文 参考訳(メタデータ) (2023-08-31T05:05:53Z) - SkeletonMAE: Graph-based Masked Autoencoder for Skeleton Sequence
Pre-training [110.55093254677638]
我々はSkeleton Sequence Learning(SSL)という,効率的なスケルトンシーケンス学習フレームワークを提案する。
本論文では,SkeletonMAEという非対称なグラフベースのエンコーダデコーダ事前学習アーキテクチャを構築する。
我々のSSLは、さまざまなデータセットにまたがってうまく一般化し、最先端の自己教師型スケルトンベースのアクション認識手法よりも優れています。
論文 参考訳(メタデータ) (2023-07-17T13:33:11Z) - FSAR: Federated Skeleton-based Action Recognition with Adaptive Topology
Structure and Knowledge Distillation [23.0771949978506]
既存の骨格に基づく行動認識手法は、典型的には集中学習パラダイムに従っており、人間関連のビデオを公開する際にプライバシー上の懸念を生じさせる。
我々は,局所的な機密データにアクセスせずにグローバルに一般化されたモデルを構築することのできる,新しいフェデレート・骨格に基づく行動認識(FSAR)パラダイムを導入する。
論文 参考訳(メタデータ) (2023-06-19T16:18:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。