Fugu-MT 論文翻訳(概要): A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training

論文の概要: A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training

arxiv url: http://arxiv.org/abs/2103.07554v1
Date: Fri, 12 Mar 2021 22:18:34 GMT
ステータス: 翻訳完了
システム内更新日: 2021-03-16 14:22:27.558270
Title: A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training
Title（参考訳）: 識別シーケンス学習のための自然勾配とヘッセンフリーを組み合わせた分散最適化フレームワーク
Authors: Adnan Haider and Chao Zhang and Florian L. Kreyssig and Philip C. Woodland
Abstract要約: 本稿では、ニューラルネットワークトレーニングのための自然勾配およびヘッセンフリー(NGHF)最適化フレームワークを提案する。これは、自然勾配(ng)法とヘッセンフリー(hf)や他の二次法からの局所曲率情報を組み合わせた線形共役勾配(cg)アルゴリズムに依存している。さまざまな音響モデルタイプのマルチジャンル放送データセットで実験が報告されています。
参考スコア（独自算出の注目度）: 16.83036203524611
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: This paper presents a novel natural gradient and Hessian-free (NGHF) optimisation framework for neural network training that can operate efficiently in a distributed manner. It relies on the linear conjugate gradient (CG) algorithm to combine the natural gradient (NG) method with local curvature information from Hessian-free (HF) or other second-order methods. A solution to a numerical issue in CG allows effective parameter updates to be generated with far fewer CG iterations than usually used (e.g. 5-8 instead of 200). This work also presents a novel preconditioning approach to improve the progress made by individual CG iterations for models with shared parameters. Although applicable to other training losses and model structures, NGHF is investigated in this paper for lattice-based discriminative sequence training for hybrid hidden Markov model acoustic models using a standard recurrent neural network, long short-term memory, and time delay neural network models for output probability calculation. Automatic speech recognition experiments are reported on the multi-genre broadcast data set for a range of different acoustic model types. These experiments show that NGHF achieves larger word error rate reductions than standard stochastic gradient descent or Adam, while requiring orders of magnitude fewer parameter updates.
Abstract（参考訳）: 本論文では,ニューラルネットワークトレーニングのための自然勾配とヘッセンフリー(NGHF)最適化フレームワークを提案する。これは、自然勾配(ng)法とヘッセンフリー(hf)や他の二次法からの局所曲率情報を組み合わせた線形共役勾配(cg)アルゴリズムに依存している。 CGにおける数値問題に対する解決策は、有効なパラメータ更新を、通常よりもはるかに少ないCGイテレーションで生成することができる(例)。 200の代わりに5-8)。また,共有パラメータを持つモデルに対するcg個別イテレーションの進捗を改善するための新しい事前調整手法を提案する。他のトレーニング損失やモデル構造にも適用できるが、標準リカレントニューラルネットワーク、長期短期記憶、出力確率計算のための時間遅延ニューラルネットワークモデルを用いたハイブリッド隠れマルコフモデル音響モデルの格子に基づく判別シーケンストレーニングについて検討する。各種音響モデルを対象としたマルチジャンル放送データセットに音声認識実験を報告する。これらの実験は、NGHFが標準の確率勾配降下やアダムよりも大きな単語誤り率の減少を達成し、パラメータ更新の順序を小さくすることを示した。

関連論文リスト

ReDiSC: A Reparameterized Masked Diffusion Model for Scalable Node Classification with Structured Predictions [64.17845687013434]
本稿では,構造化ノード分類のための構造拡散モデルであるReDiSCを提案する。本稿では,ReDiSCが最先端のGNN,ラベル伝搬,拡散ベースラインと比較して,優れた,あるいは高い競争力を発揮することを示す。特にReDiSCは、従来の構造化拡散法が計算制約によって失敗する大規模データセットに効果的にスケールする。
論文参考訳（メタデータ） (2025-07-19T04:46:53Z)
Private Training & Data Generation by Clustering Embeddings [74.00687214400021]
差分プライバシー(DP)は、個々のデータを保護するための堅牢なフレームワークを提供する。本稿では,DP合成画像埋め込み生成のための新しい原理的手法を提案する。経験的に、合成的に生成された埋め込みに基づいて訓練された単純な2層ニューラルネットワークは、最先端(SOTA)分類の精度を達成する。
論文参考訳（メタデータ） (2025-06-20T00:17:14Z)
A Principled Bayesian Framework for Training Binary and Spiking Neural Networks [1.6658912537684454]
スパイキングベイズニューラルネットワーク(英: Spiking Bayesian Neural Networks、SBNN)は、後部雑音を用いてIW-STでバイナリニューラルネットワークとスパイキングニューラルネットワークを訓練する変分推論フレームワークである。低バイアス条件、消失勾配、KL項をリンクすることにより、正規化なしで深い残留ネットワークのトレーニングを可能にする。
論文参考訳（メタデータ） (2025-05-23T14:33:20Z)
Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-Based Decoding [84.3224556294803]
拡散モデルは、画像、分子、DNA、RNA、タンパク質配列の自然なデザイン空間を捉えるのに優れている。これらの設計空間の自然性を保ちながら、下流の報酬関数を最適化することを目指している。提案アルゴリズムは,中間雑音状態が将来高い報酬をもたらすことの先駆けとして,ソフトバリュー関数を統合する。
論文参考訳（メタデータ） (2024-08-15T16:47:59Z)
Neural Network-Based Score Estimation in Diffusion Models: Optimization and Generalization [12.812942188697326]
拡散モデルは、忠実さ、柔軟性、堅牢性を改善した高品質なサンプルを生成する際に、GANと競合する強力なツールとして登場した。これらのモデルの主要な構成要素は、スコアマッチングを通じてスコア関数を学ぶことである。様々なタスクにおいて経験的な成功にもかかわらず、勾配に基づくアルゴリズムが証明可能な精度でスコア関数を学習できるかどうかは不明である。
論文参考訳（メタデータ） (2024-01-28T08:13:56Z)
Diffusion-Model-Assisted Supervised Learning of Generative Models for Density Estimation [10.793646707711442]
本稿では,密度推定のための生成モデルを訓練するためのフレームワークを提案する。スコアベース拡散モデルを用いてラベル付きデータを生成する。ラベル付きデータが生成されると、シンプルな完全に接続されたニューラルネットワークをトレーニングして、教師付き方法で生成モデルを学ぶことができます。
論文参考訳（メタデータ） (2023-10-22T23:56:19Z)
Domain Generalization Guided by Gradient Signal to Noise Ratio of Parameters [69.24377241408851]
ソースドメインへのオーバーフィッティングは、ディープニューラルネットワークの勾配に基づくトレーニングにおいて一般的な問題である。本稿では,ネットワークパラメータの勾配-信号-雑音比(GSNR)を選択することを提案する。
論文参考訳（メタデータ） (2023-10-11T10:21:34Z)
Implicit Stochastic Gradient Descent for Training Physics-informed Neural Networks [51.92362217307946]
物理インフォームドニューラルネットワーク(PINN)は、前方および逆微分方程式問題の解法として効果的に実証されている。 PINNは、近似すべきターゲット関数が高周波またはマルチスケールの特徴を示す場合、トレーニング障害に閉じ込められる。本稿では,暗黙的勾配降下法(ISGD)を用いてPINNを訓練し,トレーニングプロセスの安定性を向上させることを提案する。
論文参考訳（メタデータ） (2023-03-03T08:17:47Z)
An alternative approach to train neural networks using monotone variational inequality [22.320632565424745]
本稿では,モノトーンベクトル場を用いたニューラルネットワークトレーニングの代替手法を提案する。我々のアプローチは、事前訓練されたニューラルネットワークのより効率的な微調整に利用できる。
論文参考訳（メタデータ） (2022-02-17T19:24:20Z)
Scaling Structured Inference with Randomization [64.18063627155128]
本稿では、構造化されたモデルを数万の潜在状態に拡張するためにランダム化された動的プログラミング(RDP)のファミリを提案する。我々の手法は古典的DPベースの推論に広く適用できる。また、自動微分とも互換性があり、ニューラルネットワークとシームレスに統合できる。
論文参考訳（メタデータ） (2021-12-07T11:26:41Z)
Cogradient Descent for Dependable Learning [64.02052988844301]
双線形最適化問題に対処するために,CoGDアルゴリズムに基づく信頼度の高い学習法を提案する。 CoGDは、ある変数がスパーシティ制約を持つ場合の双線形問題を解くために導入された。また、特徴と重みの関連を分解するためにも使用できるため、畳み込みニューラルネットワーク(CNN)をより良く訓練するための我々の手法をさらに一般化することができる。
論文参考訳（メタデータ） (2021-06-20T04:28:20Z)
Convergence rates for gradient descent in the training of overparameterized artificial neural networks with biases [3.198144010381572]
近年、人工ニューラルネットワークは、古典的なソリューションが近づいている多数の問題に対処するための強力なツールに発展しています。ランダムな勾配降下アルゴリズムが限界に達する理由はまだ不明である。
論文参考訳（メタデータ） (2021-02-23T18:17:47Z)
Asymmetric Heavy Tails and Implicit Bias in Gaussian Noise Injections [73.95786440318369]
我々は、勾配降下(SGD)のダイナミクスに対する注射ノイズの影響であるGNIsのいわゆる暗黙効果に焦点を当てています。この効果は勾配更新に非対称な重尾ノイズを誘発することを示す。そして、GNIが暗黙のバイアスを引き起こすことを正式に証明し、これは尾の重みと非対称性のレベルによって異なる。
論文参考訳（メタデータ） (2021-02-13T21:28:09Z)
Autoregressive Score Matching [113.4502004812927]
自動回帰条件スコアモデル(AR-CSM)を提案する。 AR-CSMモデルでは、このデータ分布とモデル分布のばらつきを効率的に計算し、最適化することができ、高価なサンプリングや対向訓練を必要としない。本研究では,合成データに対する密度推定,画像生成,画像復調,暗黙エンコーダを用いた潜在変数モデルの訓練に応用できることを示す。
論文参考訳（メタデータ） (2020-10-24T07:01:24Z)
A Novel Neural Network Training Framework with Data Assimilation [2.948167339160823]
勾配計算を避けるため,データ同化に基づく勾配なし学習フレームワークを提案する。その結果,提案手法は勾配法よりも優れた性能を示した。
論文参考訳（メタデータ） (2020-10-06T11:12:23Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。