論文の概要: Data-Efficient Deep Learning: Empirical Guidelines for Training Set Size Estimation in Inertial Sensor Classification
- arxiv url: http://arxiv.org/abs/2607.09402v1
- Date: Fri, 10 Jul 2026 13:30:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.852388
- Title: Data-Efficient Deep Learning: Empirical Guidelines for Training Set Size Estimation in Inertial Sensor Classification
- Title(参考訳): データ効率のよいディープラーニング:慣性センサ分類におけるセットサイズ推定のための実証的ガイドライン
- Abstract要約: 本稿では,バイナリとマルチクラスの両方のシナリオで分類性能を解析する統合フレームワークを提案する。
本稿では,学習曲線の安定化に必要なサンプルサイズとして定義される定量的安定点測定法を提案する。
小型のパイロット実験からデータ要求を抽出するための一般化可能なフレームワークを提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep learning models dependency on large-scale inertial datasets presents a significant bottleneck in inertial sensor-based classification tasks, such as human activity recognition and smartphone location recognition. In these domains, data collection requires massive recording campaigns that are complex, time-consuming, and difficult to scale. Currently, data-driven guidelines for determining the minimum sample size required to reach a desired accuracy level do not exist. To address this gap, this study presents a systematic empirical evaluation of learning curve convergence rates in inertial classification. We introduce a unified framework that analyzes classification performance under both binary and multi-class scenarios, and derive an empirical formula to estimate performance relative to dataset size. Testing across six diverse, real-world datasets totaling 102.7 hours of inertial measurements demonstrates that accuracy follows a consistent logarithmic growth pattern, regardless of task complexity. Leveraging this finding, we propose a quantitative stability point metric, defined as the sample size required for the learning curve to stabilize within a predefined mean absolute percentage deviation of its asymptotic maximum. Our analysis reveals that models often reach practical stability with substantially fewer samples than traditional heuristics suggest. Ultimately, we offer a generalizable framework to extrapolate total data requirements from small-scale pilot studies, optimizing the tradeoff between recording effort and model reliability. These findings shift the prevailing paradigm from maximizing data volume toward optimizing data efficiency, offering concrete, data-backed guidelines for planning recording campaigns in inertial sensing applications.
- Abstract(参考訳): 大規模慣性データセットに依存するディープラーニングモデルは、人間の活動認識やスマートフォンの位置認識といった慣性センサーに基づく分類タスクにおいて、重大なボトルネックとなる。
これらのドメインでは、データ収集には、複雑で、時間がかかり、スケールが難しい大規模な記録キャンペーンが必要です。
現在、所望の精度に達するために必要な最小サンプルサイズを決定するためのデータ駆動ガイドラインは存在しない。
このギャップに対処するため,慣性分類における学習曲線収束率の系統的評価を行った。
本稿では,バイナリとマルチクラスの両方のシナリオで分類性能を解析する統合フレームワークを導入し,データセットサイズに対して性能を推定するための経験的公式を導出する。
6つの多様な実世界のデータセットで102.7時間の慣性測定を行い、精度はタスクの複雑さに関係なく一貫した対数的成長パターンに従うことを示した。
この知見を生かして, 学習曲線が漸近的最大値の絶対値偏差を予め定義した平均値偏差内で安定化するために必要なサンプルサイズとして定義される定量的安定点測定法を提案する。
我々の分析では、モデルが従来のヒューリスティックよりもかなり少ないサンプルで実用的安定性に達することがしばしば明らかになっている。
最終的に、我々は、小規模のパイロット研究から全データ要求を抽出し、記録作業とモデルの信頼性のトレードオフを最適化する、一般化可能なフレームワークを提供します。
これらの知見は,データボリュームの最大化からデータ効率の最適化へ移行し,慣性センシングアプリケーションにおける記録キャンペーン計画のための具体的なデータ支援ガイドラインを提供する。
関連論文リスト
- InfoAtlas: A Foundation Model for Zero-Shot Statistical Dependence Estimate [68.14572758582081]
InfoAtlasは、反復最適化の必要性を排除する基礎的なモデルのようなアーキテクチャである。
さまざまな依存構造を特定し、データセットから直接MIを予測することを学ぶ。
実験の結果、InfoAtlasは最先端のニューラル推定器と精度で一致し、100倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-05-29T18:16:51Z) - Online Data Curation for Object Detection via Marginal Contributions to Dataset-level Average Precision [9.096185004908692]
DetGainは、オブジェクト検出に特化したオンラインデータキュレーション手法である。
予測品質に基づいて、各画像の限界摂動をデータセットレベルの平均精度(AP)に推定する。
論文 参考訳(メタデータ) (2025-11-18T07:08:18Z) - Scaling Laws for the Value of Individual Data Points in Machine Learning [55.596413470429475]
個々のデータポイントの値のスケーリング行動を調べることによって、新しい視点を導入する。
スケーリング法則を支持するための学習理論を提供し、それが様々なモデルクラスにまたがっていることを実証的に観察する。
私たちの研究は、個々のデータポイントの値のスケーリング特性を理解し、活用するための第一歩です。
論文 参考訳(メタデータ) (2024-05-30T20:10:24Z) - Stochastic Amortization: A Unified Approach to Accelerate Feature and Data Attribution [62.71425232332837]
雑音ラベル付きモデルを用いたトレーニングは安価で驚くほど効果的であることを示す。
このアプローチは、いくつかの特徴属性とデータ評価手法を著しく加速し、しばしば既存のアプローチよりも桁違いにスピードアップする。
論文 参考訳(メタデータ) (2024-01-29T03:42:37Z) - Online Tensor Inference [0.0]
従来のオフライン学習は、各計算繰り返しにおける全てのデータの保存と利用を伴い、高次元テンソルデータには実用的ではない。
既存の低ランクテンソル法は、オンラインの方法での統計的推論能力に欠ける。
本手法では,広範囲なメモリ要求を伴わずに効率的なリアルタイムデータ処理を実現するため,グラディエント・Descent (SGD) を用いる。
論文 参考訳(メタデータ) (2023-12-28T16:37:48Z) - Online Importance Sampling for Stochastic Gradient Optimization [33.42221341526944]
本稿では,トレーニング中のデータの重要度を効率的に計算する実用的なアルゴリズムを提案する。
また、ネットワーク出力の損失w.r.t.の導出に基づく新しいメトリクスを導入し、ミニバッチの重要度サンプリング用に設計した。
論文 参考訳(メタデータ) (2023-11-24T13:21:35Z) - Revisiting Sample Size Determination in Natural Language Understanding [18.637079595450366]
特定のモデルのパフォーマンスを達成するために、どれだけのデータポイントをラベル付けする必要があるかを正確に知ることは、アノテーションの全体的な予算を削減するための有益なステップである。
我々は,少量のトレーニングサンプルに基づいて,達成可能なモデルの最大性能を予測するための,シンプルで効果的な手法を導出した。
論文 参考訳(メタデータ) (2023-07-01T16:08:52Z) - Smooth densities and generative modeling with unsupervised random
forests [1.433758865948252]
密度推定器の重要な応用は合成データ生成である。
パラメータ制約を伴わない任意の次元における滑らかな密度を推定するための,教師なしランダム森林に基づく新しい手法を提案する。
提案手法の整合性を証明し,既存の木質密度推定器に対する利点を実証する。
論文 参考訳(メタデータ) (2022-05-19T09:50:25Z) - Information-Theoretic Odometry Learning [83.36195426897768]
生体計測推定を目的とした学習動機付け手法のための統合情報理論フレームワークを提案する。
提案フレームワークは情報理論言語の性能評価と理解のためのエレガントなツールを提供する。
論文 参考訳(メタデータ) (2022-03-11T02:37:35Z) - Straggler-Resilient Federated Learning: Leveraging the Interplay Between
Statistical Accuracy and System Heterogeneity [57.275753974812666]
フェデレーション学習は、データをローカルに保持しながら、クライアントのネットワークに分散したデータサンプルから学習する。
本稿では,学習手順を高速化するために,クライアントデータの統計的特徴を取り入れてクライアントを適応的に選択する,ストラグラー・レジリエントなフェデレーション学習手法を提案する。
論文 参考訳(メタデータ) (2020-12-28T19:21:14Z) - Variable Skipping for Autoregressive Range Density Estimation [84.60428050170687]
深部自己回帰モデルを用いた距離密度推定を高速化する手法である可変スキップについて述べる。
可変スキップは、10-100$timesの効率向上をもたらすことを示す。
論文 参考訳(メタデータ) (2020-07-10T19:01:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。