論文の概要: SincDPNet: Interpretable Raw-Waveform Bathroom Activity Recognition for Assistive Living
- arxiv url: http://arxiv.org/abs/2609.34907v1
- Date: Mon, 28 Sep 2026 11:10:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:45:45.586711
- Title: SincDPNet: Interpretable Raw-Waveform Bathroom Activity Recognition for Assistive Living
- Title(参考訳): SincDPNet:補助生活のための解釈可能なRaw-Waveform Bathroom活性認識
- Abstract要約: 浴室音響環境認識は、継続的なビデオ監視が望ましくない環境での環境支援生活を支援することができる。
この研究は、5つの環境にまたがって記録された21,387の注釈付きクリップを含む、7クラスの浴室音響イベントデータセットであるデータセットを導入している。
SincDPNetは、学習可能なシンクフィルタバンクを備えたコンパクトな生波形分類器であり、その後、深さ方向に分離可能な畳み込み体を備える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bathroom acoustic-event recognition can support ambient assisted living in settings where continuous video monitoring is undesirable. However, practical deployment requires models that are compact, interpretable, and robust to changes in the recording environment. This work introduces \dataset{}, a seven-class bathroom acoustic-event dataset containing 21{,}387 annotated clips recorded across five environments, and proposes SincDPNet, a compact raw-waveform classifier with a learnable sinc filter bank followed by a depthwise-separable convolutional body. Each sinc filter is controlled by two frequency parameters, allowing the learned passbands to be inspected directly in hertz while keeping the front end small. To reduce room-specific leakage, recording sessions and environments are separated before overlapping windows are assigned to the training, validation, and test partitions. We further use multi-objective Bayesian optimization as a design tool to examine the validation performance--model-size trade-off across 24 configurations. The selected designs span different operating points: the best-performing model achieves 80.2\% accuracy and 0.760 macro-F1 with 14{,}040 parameters, while the compact $N_f=25$ configuration uses only 2{,}848 parameters and achieves 75.7\% accuracy, 0.661 macro-F1, and 0.716 MCC on the held-out environment. Analysis of the learned filters and confusion patterns shows that spectral overlap contributes to confusion among water-related events, while the \textit{Door}/\textit{Walker/Crutch} errors also reflect similarities in their transient temporal structure.
- Abstract(参考訳): 浴室音響環境認識は、継続的なビデオ監視が望ましくない環境での環境支援生活を支援することができる。
しかし、実際の展開には、記録環境の変化に対してコンパクトで解釈可能で堅牢なモデルが必要である。
本研究は,5つの環境にわたって記録された21{,}387の注釈付きクリップを含む7クラスの浴室音響イベントデータセットである「dataset{}」を紹介し,学習可能なシンクフィルタバンクを備えたコンパクトな生波形分類器である「SincDPNet」を提案する。
それぞれのシンクフィルタは2つの周波数パラメータで制御され、前端を小さく保ちながら、学習したパスバンドを直接ヘルツで検査することができる。
部屋固有のリークを減らすために、オーバーラップウィンドウがトレーニング、検証、テストパーティションに割り当てられる前に、セッションと環境を分離する。
さらに,多目的ベイズ最適化を設計ツールとして用いて,評価性能の検証を行う。
最高の性能モデルは80.2\%、14{,}040パラメータの0.760マクロF1、コンパクトな$N_f=25$構成は2{,}848パラメータのみを使用し、75.7\%の精度、0.661マクロF1、0.716MCCである。
学習したフィルタと混乱パターンの解析は、スペクトルの重なりが水関連の事象の混同に寄与し、また \textit{Door}/\textit{Walker/Crutch} の誤差はその一時的な時間構造における類似性を反映していることを示している。
関連論文リスト
- Towards Deployable Underwater Vessel Classification [7.305200173116163]
本稿では,多表現特徴工学,時間統計プール,コンパクト畳み込みアーキテクチャを組み合わせた水中音響分類フレームワークを提案する。
従来および聴覚に触発された複数の表現を調査し,ShipsEarデータセット上の軽量分類器と標準ニューラルネットワーク(CNN)を評価した。
論文 参考訳(メタデータ) (2026-09-24T07:50:50Z) - Task-Oriented Candidate-Latent Feedback for Coarse-to-Fine Sensing in Distributed OFDM-ISAC Networks [6.604029885021074]
将来の統合センシング通信(ISAC)アーキテクチャは、推論を行うセンシング機能(SF)から測定を取得するセンシングエンティティ(SE)を分離する。
単一ターゲット推定のための候補遅延フィードバックを用いた学習に基づく粗大なセンサパイプラインを提案する。
論文 参考訳(メタデータ) (2026-08-04T08:26:06Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - Aionoscope: Debugging Latent-State Accessibility in Time-Series Representations [59.34593956287438]
Aionoscope(アイオノスコープ)は、凍結した時系列表現における潜在状態のアクセシビリティを検査するための診断ツールである。
アイオノスコープはプロセス生成を観察レンダリングから切り離し、正確な分類と密度のラベルを持つシード合成ストリームを生成する。
論文 参考訳(メタデータ) (2026-07-01T13:54:20Z) - Exact Stiefel Optimization for Probabilistic PLS: Closed-Form Updates, Error Bounds, and Calibrated Uncertainty [5.844591976842085]
本研究では,雑音事前推定,制約付き確率最適化,予測キャリブレーションを組み合わせたエンドツーエンドフレームワークを開発した。
我々は、任意のガウス化により、このフレームワークをガウス以下の設定に拡張し、ブロック構造フィッシャー解析により、クローズドフォームの標準エラーを提供する。
論文 参考訳(メタデータ) (2026-05-12T06:38:12Z) - SEER: Spectral Entropy Encoding of Roles for Context-Aware Attention-Based Design Pattern Detection [0.0]
本稿では,ソースコードからGang of Four(GoF)デザインパターンを検出するために,従来のContext Is All You Needのアップグレード版を提案する。
SEERはこれらの制限に、(i)各クラスの相互作用グラフのラプラシアンスペクトルからメンバーごとのロール埋め込みを導出するスペクトルエントロピーロールエンコーダ、(ii)メソッドカテゴリに経験的校正期間を割り当てる時間重呼出コンテキストの2つの原則で対処する。
PyDesignNet上のSEER(1,832ファイル、35,000のシーケンス、23のGoFパターン)を評価し、以前のシステムよりも一貫した利得を観察する。
論文 参考訳(メタデータ) (2026-01-19T19:13:40Z) - Self-Supervised Compression and Artifact Correction for Streaming Underwater Imaging Sonar [14.023965177100239]
実時間撮像ソナーは、光センシングが信頼性の低い環境下での水中監視において重要なツールとなっている。
クリーンノイズペアや合成仮定を使わずに圧縮とアーティファクトの補正を共同で行う自己教師型フレームワークSCOPEを提案する。
SCOPEは太平洋岸北西部の3つの河川に数ヶ月間展開され、野生でのリアルタイムサケの列挙と環境モニタリングを支援している。
論文 参考訳(メタデータ) (2025-11-17T21:19:15Z) - MASS: MoErging through Adaptive Subspace Selection [55.03293736484465]
モデルマージの新しいアプローチであるMASS(MoErging through Adaptive Subspace Selection)を提案する。
MASSはタスクごとに最も健全な特異なコンポーネントのみを格納し、それらを共有モデルにマージする。
我々は,8,14,20タスクのベンチマークに対して,ViT-B-16,ViT-B-32,ViT-L-14を用いて,CLIPに基づく画像分類のMASSを評価する。
論文 参考訳(メタデータ) (2025-04-06T08:49:52Z) - SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention [53.4441894198495]
大きな言語モデル(LLM)は、非常に長いコンテキストウィンドウをサポートするようになった。
バニラの注意の二次的な複雑さは、TTFT(Time-to-First-Token)レイテンシを著しく長くする。
適応型構造とほぼロスレスなスパースアテンションであるSampleAttentionを提案する。
論文 参考訳(メタデータ) (2024-06-17T11:05:15Z) - Filter Pruning for Efficient CNNs via Knowledge-driven Differential
Filter Sampler [103.97487121678276]
フィルタプルーニングは同時に計算を加速し、CNNのメモリオーバーヘッドを低減する。
本稿では,MFM(Masked Filter Modeling)フレームワークを用いた知識駆動型微分フィルタサンプリング(KDFS)を提案する。
論文 参考訳(メタデータ) (2023-07-01T02:28:41Z) - Temporal-Spatial Neural Filter: Direction Informed End-to-End
Multi-channel Target Speech Separation [66.46123655365113]
ターゲット音声分離とは、混合信号からターゲット話者の音声を抽出することを指す。
主な課題は、複雑な音響環境とリアルタイム処理の要件である。
複数話者混合から対象音声波形を直接推定する時間空間ニューラルフィルタを提案する。
論文 参考訳(メタデータ) (2020-01-02T11:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。