論文の概要: Does a prosody-trained representation help beyond trainable fusion? A parameter-matched study with frozen HuBERT
- arxiv url: http://arxiv.org/abs/2609.36754v1
- Date: Tue, 29 Sep 2026 05:25:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.209126
- Title: Does a prosody-trained representation help beyond trainable fusion? A parameter-matched study with frozen HuBERT
- Title(参考訳): プロソディ-トレーニングされた表現は、訓練可能な融合を超えて役立つか? 凍結したHuBERTを用いたパラメータマッチング研究
- Abstract要約: 我々は、凍結したバックボーン認識器(Baseline)と、学習された表現(Learned)で供給される0個の補助入力(Null)と、訓練可能な融合(Null)を比較した。
Buckeye, Switchboard, AMI IHM の他、Null は WER を Baseline 上で 0.71-1.45 で削減するが、Learred は Null と +0.07, -0.09, +0.00 で大きく異なる。
しかし、推論における表現の削除やミスマッチは学習WERを増大させるため、学習は表現に依存するがパラメータマッチング制御に対して測定可能な漸進WERは示さない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Explicit prosodic cues may help automatic speech recognition (ASR) of spontaneous speech, but auxiliary representations typically require additional trainable components, making it unclear whether gains come from the auxiliary information or the fusion mechanism. We address this using a frozen HuBERT backbone and a 64-dimensional representation trained to predict log F0, voicing, Delta log F0, log energy, and spectral tilt. We compare a frozen-backbone recognizer (Baseline), trainable fusion with zero auxiliary input (Null), and the same fusion supplied with the learned representation (Learned). Across Buckeye, Switchboard, and AMI IHM, Null reduces WER by 0.71-1.45 points over Baseline, whereas Learned differs from Null by +0.07, -0.09, and +0.00 points, with no significant differences. However, removing or mismatching the representation at inference increases Learned WER. Thus, Learned depends on the representation yet shows no measurable incremental WER benefit over the parameter-matched control.
- Abstract(参考訳): 明示的な韻律的手がかりは、自然発話の自動音声認識(ASR)に役立つが、補助表現は通常、追加の訓練可能なコンポーネントを必要とする。
凍結したHuBERTバックボーンと64次元の表現を用いてこの問題に対処し、ログF0, ボイシング, デルタログF0, ログエネルギー, スペクトル傾きを予測する。
我々は、凍結したバックボーン認識器(Baseline)、学習可能な融合をゼロ補助入力(Null)、学習された表現(Learned)で供給される同じ融合と比較する。
Buckeye, Switchboard, AMI IHM の他、Null は WER を Baseline 上で 0.71-1.45 で削減するが、Learred は Null と +0.07, -0.09, +0.00 で大きく異なる。
しかし、推論時に表現を削除またはミスマッチすると、Learned WERが増加する。
したがって、Learredはパラメータマッチング制御よりも測定可能な漸進的なWERの利点を示していない。
関連論文リスト
- Self-Confirming Superposition Traps in Reinforcement Learning [62.71685993550818]
強化学習はエージェントのポリシーによって選択されたデータに基づいて表現し、その結果のリターンを使って次の選択を導く。
これらのデータに対して表現フィッティングがグローバルに最適である場合でも,このループは低リターンポリシーを維持可能であることを示す。
論文 参考訳(メタデータ) (2026-09-26T21:56:26Z) - A Probe Shift Is Not a Fairness Fix: The Limits of Representation Steering in Speech Models [9.715150075665354]
我々は、事前訓練されたASRエンコーダから線形に読み取れる話者リンク属性が、グループ単語エラー率のギャップを減らすのに有用な方向を与えるかどうかを問う。
本研究は,表現,伝播,タスクレベルでの発話バイアス介入の評価を動機づけるものである。
論文 参考訳(メタデータ) (2026-09-16T12:01:30Z) - Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition [4.970910262474302]
Zero-shot Skeleton Action Recognition (ZSAR) は、見えない動作が類似した骨格関節ダイナミクスを共有するが、オブジェクトやシーンコンテキストが異なる場合、あいまいなままである。
既存のマルチモーダルメソッドは通常、独立したスケルトンとRGBスコアリングブランチを保持し、出力を融合する。
骨格データ再構成時に安定した視覚的アンカーとして機能する非拡散RGB条件トークンを用いたテキスト条件記述型変換器を提案する。
論文 参考訳(メタデータ) (2026-08-05T09:28:00Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Explicit Fuzzy Logic in the Feed-Forward Layer: Self-Forgetting Quantifiers Discover Legible Grammatical-Licensing Detectors [0.2663471820643486]
NC-FFNはGELUベースラインのパープレキシティを結び、各ユニットは明示的な論理形式を持つ。
どちらも、シーケンス量子化器の小さなブロックで解決する。
その結果、パラメータニュートラルな言語モデル品質トランスが実現した。
論文 参考訳(メタデータ) (2026-06-30T15:46:27Z) - Reward-Informed Sparse Autoencoders and the Solution-Completeness Confound [39.146761527401424]
我々は報酬インフォームドSAE(RI-SAE)を構築する。
我々はGRPOトラジェクトリを高逆(良い)と低逆(悪い)推論に分割し、標準のJumpReLU SAEをそれらのアクティベーションで訓練した。
Llama-3.1-8Bでは、16,384の機能のスパースサブセットがクラスを分離する(選択された機能ではsilhouette 0.79、全コードでは0.005)。
論文 参考訳(メタデータ) (2026-06-25T15:45:28Z) - DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation [49.98710755440242]
蒸留により、コンパクトなビジョンランゲージモデル(VLM)が強力な推論能力を得ることができる。
標準チャート/文書推論データセットにおけるプロンプトの最大69%は、事実上ゼロデルタである。
既存のデータセットをシードとして再利用し、学生の障害モードを積極的にターゲットとして、より良いプロンプトを生成するためのステージド合成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-15T02:04:12Z) - Elastic Weight Removal for Faithful and Abstractive Dialogue Generation [61.40951756070646]
対話システムは、関連する文書に含まれる知識に忠実な応答を生成するべきである。
多くのモデルは、それと矛盾したり、検証不可能な情報を含んでいる代わりに幻覚応答を生成する。
本手法は,幻覚と抽出反応を同時に阻止するために拡張できることが示唆された。
論文 参考訳(メタデータ) (2023-03-30T17:40:30Z) - InfoNCE Loss Provably Learns Cluster-Preserving Representations [54.28112623495274]
InfoNCEが有限個の負のサンプルで学習した表現は、データのクラスタに対して一致していることを示す。
我々の主な成果は、InfoNCEが有限個の負のサンプルで学んだ表現もまた、データのクラスタと一致していることを示すことである。
論文 参考訳(メタデータ) (2023-02-15T19:45:35Z) - R\'enyiCL: Contrastive Representation Learning with Skew R\'enyi
Divergence [78.15455360335925]
我々はR'enyiCLという新しい頑健なコントラスト学習手法を提案する。
我々の手法は R'enyi divergence の変動的下界の上に構築されている。
我々は,R'enyi の対照的な学習目的が,自然に強い負のサンプリングと簡単な正のサンプリングを同時に行うことを示す。
論文 参考訳(メタデータ) (2022-08-12T13:37:05Z) - Audio Deepfake Detection Based on a Combination of F0 Information and
Real Plus Imaginary Spectrogram Features [51.924340387119415]
ASVspoof 2019 LAデータセットの実験結果から,提案手法はオーディオディープフェイク検出に非常に有効であることがわかった。
提案方式は音声深度検出作業に非常に有効であり,ほぼ全てのシステムにまたがる等価誤差率(EER)が0.43%に達する。
論文 参考訳(メタデータ) (2022-08-02T02:46:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。