論文の概要: HALO: A Heterogeneity-Aware Language-Aligned IMU Foundation Model for Open-Set Human Activity Recognition
- arxiv url: http://arxiv.org/abs/2608.27233v1
- Date: Thu, 27 Aug 2026 15:17:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.458983
- Title: HALO: A Heterogeneity-Aware Language-Aligned IMU Foundation Model for Open-Set Human Activity Recognition
- Title(参考訳): HALO:オープンセット人間活動認識のための異種言語対応IMU基礎モデル
- Abstract要約: ドメイン固有のIMU基盤モデルであるHALO(Heterogeneity-Aware Language-aligned Open-set Model)を紹介する。
異種性を考慮した言語対応オープンセットモデルは、2段階のトレーニングフレームワークを通じて2つの重要な課題に対処する。
Heterogeneity-Aware Language-aligned Open-set modelは、87のトレーニングラベル全てで測定されたゼロショットオープンセットの精度を13.7%向上させる。
- 参考スコア(独自算出の注目度): 11.807649073272245
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human Activity Recognition (HAR) using inertial measurement units (IMUs) enables a wide range of applications, yet the field still lacks a unified model that can generalize across diverse subjects, devices, and activities. Training such a model is difficult due to two key challenges: sensing heterogeneity -- differences in sampling rates, channel configurations, and sensor placements -- and poor generalization to unseen activities and label vocabularies. We introduce HALO (Heterogeneity-Aware Language-aligned Open-set model), a domain-specific IMU foundation model that addresses both challenges through a two-stage training framework. Stage 1 pretrains the IMU encoder with heterogeneity-aware self-supervised learning, including adaptive-pooling tokenization, channel-independent feature extraction, and contextualized sensor conditioning that injects natural-language sensor descriptions into each channel embedding. Stage 2 aligns this IMU encoder with text embeddings via synonym-aware soft contrastive learning, enabling open-set recognition via cosine-similarity retrieval without per-dataset classifiers. Trained on 10 public HAR datasets and evaluated on 7 held-out datasets, HALO outperforms five state-of-the-art baselines on all 8 aggregate metrics, and still leads on 3 of 4 settings under baseline-matched inputs. Despite using only ~35M trainable parameters -- 10x fewer than the latest foundation model MOMENT (341.2M) -- HALO improves zero-shot open-set accuracy, measured over all 87 training labels, by 13.7 percentage points. On two further datasets with severe distribution shift, every model including HALO collapses zero-shot. A video demonstration of HALO's performance in real world is available at https://youtu.be/rooVKragtFU
- Abstract(参考訳): 慣性測定ユニット(IMU)を用いたHAR(Human Activity Recognition)は、幅広い応用を可能にするが、様々な対象、装置、活動にまたがって一般化できる統一されたモデルはいまだに存在しない。
このようなモデルのトレーニングは、サンプリング率、チャネル構成、センサー配置の違いなど、不均一性を検知することと、目に見えないアクティビティやラベルの語彙への一般化が不十分な2つの主要な課題のために難しい。
HALO(Heterogeneity-Aware Language-aligned Open-set Model)はドメイン固有のIMU基盤モデルであり、2段階のトレーニングフレームワークを通じて両方の課題に対処する。
ステージ1は、適応プールトークン化、チャンネル非依存の特徴抽出、および各チャネル埋め込みに自然言語センサー記述を注入するコンテキスト化されたセンサー条件付けを含む、不均一性に意識した自己教師付き学習でIMUエンコーダを事前訓練する。
ステージ2では、このIMUエンコーダを同義語対応のソフトコントラスト学習によるテキスト埋め込みと整合させ、データ単位の分類なしでコサイン類似性検索によるオープンセット認識を可能にする。
10の公開HARデータセットに基づいてトレーニングされ、7つのホールトアウトデータセットで評価され、HALOは8つの集計メトリクスすべてに対して5つの最先端ベースラインを上回り、ベースラインマッチングされた入力では4つの設定のうち3つを導いている。
トレーニング可能なパラメータはわずか35Mであり、最新の基礎モデルMOMENT (341.2M) の10倍も小さいが、HALOはゼロショットのオープンセット精度を改善し、87のトレーニングラベル全てで13.7%の精度で測定した。
分布シフトが激しい2つのデータセットでは、HALOを含むすべてのモデルがゼロショットで崩壊する。
実世界のHALOのパフォーマンスのデモはhttps://youtu.be/rooVKragtFUで公開されている。
関連論文リスト
- Closing the Modality Gap in Zero-Shot HAR: Contrastive Training and Separability-Optimized Prototypes on IMU Data [0.0]
PAMAP2データセット上で,3つの推論手法と2つのトレーニングパイプラインを組み合わせた7つの構成を評価する。
モダリティギャップは,目的によって支配される訓練時間現象であることがわかった。
また、テストセットのクラス分布が不均衡である場合、全体的な精度が誤解を招く一次指標であることを実証する。
論文 参考訳(メタデータ) (2026-06-09T12:39:41Z) - Pearl: A Foundation Model for Placing Every Atom in the Right Location [52.35027831422145]
タンパク質-リガンド共フォールディングの基礎モデルであるPearlを紹介した。
パールはタンパク質-リガンド結合における新しい最先端性能を確立している。
Pearlは、パブリックなRuns N' PosesとPoseBustersベンチマークでAlphaFold 3や他のオープンソースベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:36:51Z) - Preliminary Use of Vision Language Model Driven Extraction of Mouse Behavior Towards Understanding Fear Expression [5.170961907232911]
この研究は、マウスの様々な振る舞いを分類するために、ビデオにテキスト入力をエンコードする視覚言語モデル(VLM)を確立する。
我々はオープンソースのQwen2.5-VLモデルを用いて、プロンプト、ラベル付き例を用いたインコンテキスト学習(ICL)、フレームレベルの前処理による性能の向上を行う。
論文 参考訳(メタデータ) (2025-10-22T01:33:39Z) - ShortcutBreaker: Low-Rank Noisy Bottleneck with Global Perturbation Attention for Multi-Class Unsupervised Anomaly Detection [59.89803740308262]
ShortcutBreakerはMUADタスクのための新しい統合された機能再構成フレームワークである。
ショートカットの問題に対処する2つの重要なイノベーションが特徴だ。
提案手法は,4つのデータセットに対して,99.8%,98.9%,90.6%,87.8%の顕著な画像レベルのAUROCを実現する。
論文 参考訳(メタデータ) (2025-10-21T06:51:30Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - DeepHeteroIoT: Deep Local and Global Learning over Heterogeneous IoT Sensor Data [9.531834233076934]
本稿では,畳み込みニューラルネットワークと双方向Gated Recurrent Unitを併用して,局所的特徴とグローバルな特徴をそれぞれ学習する新しいディープラーニングモデルを提案する。
特に、このモデルはデータセット全体で平均3.37%の精度と2.85%のF1スコアの絶対的な改善を実現している。
論文 参考訳(メタデータ) (2024-03-29T06:24:07Z) - WEAR: An Outdoor Sports Dataset for Wearable and Egocentric Activity Recognition [22.988658969594276]
視覚と慣性に基づく人間活動認識(HAR)のための屋外スポーツデータセットWEARを紹介する。
合計18種類のワークアウト活動を行う22人の被験者のデータを,11箇所の外部で記録した同期慣性(アクセラレーション)とカメラ(エゴセントリックビデオ)データを用いて収集した。
ベンチマークの結果,センサ配置により,各モードが予測性能に相補的な強度と弱点を与えることがわかった。
論文 参考訳(メタデータ) (2023-04-11T09:31:07Z) - End-to-End Zero-Shot HOI Detection via Vision and Language Knowledge
Distillation [86.41437210485932]
我々は、ゼロショットHOI検出を前進させ、同時に見えないHOIと見えないHOIの両方を検出することを目指している。
本稿では,視覚言語による知識蒸留によるエンドツーエンドのゼロショットHOI検出フレームワークを提案する。
本手法は, 従来のSOTAを8.92%, 全体の10.18%で上回っている。
論文 参考訳(メタデータ) (2022-04-01T07:27:19Z) - Disentangle Your Dense Object Detector [82.22771433419727]
深層学習に基づく高密度物体検出器はここ数年で大きな成功を収め、ビデオ理解などのマルチメディアアプリケーションにも応用されてきた。
しかし、現在の高密度検出器の訓練パイプラインは、保持できない多くの接続に妥協されている。
そこで本研究では, 簡易かつ効果的な遠心分離機構を設計し, 現在の最先端検出器に統合するDED(Disentangled Dense Object Detector)を提案する。
論文 参考訳(メタデータ) (2021-07-07T00:52:16Z) - Invariant Feature Learning for Sensor-based Human Activity Recognition [11.334750079923428]
被験者やデバイス間で共有される共通情報を抽出する不変特徴学習フレームワーク(IFLF)を提案する。
実験により、IFLFは、一般的なオープンデータセットと社内データセットをまたいだ主題とデバイスディバージョンの両方を扱うのに効果的であることが示された。
論文 参考訳(メタデータ) (2020-12-14T21:56:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。