論文の概要: OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL
- arxiv url: http://arxiv.org/abs/2606.30356v1
- Date: Mon, 29 Jun 2026 14:24:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.278481
- Title: OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL
- Title(参考訳): OLIVE:音声SSLのための波形再構成によるビュー拡張潜在予測
- Authors: Karl El Hajal, Mathew Magimai. -Doss,
- Abstract要約: Invariant Views and rEconstruction (OLIVE) を用いたオンライン潜時予測を提案する。
OLIVEは、視野拡大マスク付き潜伏予測と波形再構成を統一目的下で組み合わせる。
これらの目的が幅広いタスクをサポートする表現を可能にすることを示す。
- 参考スコア(独自算出の注目度): 29.271901838279987
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose Online Latent prediction with Invariant Views and rEconstruction (OLIVE), a self-supervised speech representation learning framework that jointly optimizes analysis and synthesis objectives. OLIVE combines view-augmented masked latent prediction with waveform reconstruction under a unified objective. Reconstruction constrains early encoder features to retain signal-level information, while masked latent prediction shapes later contextual representations toward invariance for robust downstream performance. We show that these objectives enable representations that support a broad range of tasks. In particular, OLIVE improves results on generation and speaker tasks, maintains competitive performance on recognition and semantic tasks, and improves waveform reconstruction.
- Abstract(参考訳): Invariant Views and rEconstruction (OLIVE) を用いたオンライン潜時予測を提案する。
OLIVEは、視野拡大マスク付き潜伏予測と波形再構成を統一目的下で組み合わせる。
レコンストラクションは、信号レベル情報を保持するために初期エンコーダの特徴を制約するが、マスク付き潜在予測は、後続の文脈的表現を、堅牢な下流のパフォーマンスに向ける。
これらの目的が幅広いタスクをサポートする表現を可能にすることを示す。
特に、OLIVEは、生成タスクと話者タスクの結果を改善し、認識タスクと意味タスクの競合性能を維持し、波形再構成を改善する。
関連論文リスト
- What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction [9.020077150911526]
動作関連構造は、主に画素再構成の忠実度ではなく、時間的ビデオ事前学習によって駆動される。
本研究は,行動関連ビデオ表現の主成分として時間的予測構造(再構成忠実性ではなく,時間的予測構造)を同定した。
論文 参考訳(メタデータ) (2026-06-05T04:43:02Z) - Predictive-Generative Drift Decomposition for Speech Enhancement and Separation [42.49632892186173]
本稿では,先行した生成音声による予測手法を増強する,音声強調と分離のためのプラグアンドプレイフレームワークを提案する。
表現力学をタスク固有のドリフトとデノナイジングコンポーネントに分解し、予測推定を生成的サンプリングプロセスに直接組み込む。
これにより、強い事前学習された予測子と生成モデルのパワーを結合する数学的基盤の枠組みが得られる。
論文 参考訳(メタデータ) (2026-05-07T13:04:38Z) - EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models [37.917978019436674]
EIDOSは、将来の価値予測から潜在空間予測学習に移行する基礎モデルファミリーである。
我々は、潜伏表現の進化を予測するために因果変換器を訓練し、構造化および時間的に整合した潜伏状態の出現を促す。
論文 参考訳(メタデータ) (2026-02-15T07:07:20Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction [5.796028565806211]
本稿では,事前学習された視覚言語基盤モデルを用いた意味分布誘導型再構築フレームワークを提案する。
対照的な目的は、再構成された表現と対象の意味分布を一致させる。
膝と脳のデータセットの実験では、画像からのセマンティックな先行は微細な解剖学的構造を保ち、知覚の質が優れていることが示されている。
論文 参考訳(メタデータ) (2025-11-24T19:15:47Z) - AURORA: Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation [113.75682363364004]
AURORAは、参照音声視覚セグメント化における真の推論と言語理解を強化するために設計されたフレームワークである。
AURORAはRef-AVSベンチマークの最先端性能を達成し、非参照セグメンテーションに効果的に一般化する。
論文 参考訳(メタデータ) (2025-08-04T07:47:38Z) - Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space [74.12387631212609]
本稿では、音声波形を連続的な潜在表現の列に符号化することで、音声言語モデリングの代替手法であるSLEDを紹介する。
SLEDは離散化エラーを回避し、既存の言語モデルに共通する複雑な階層アーキテクチャの必要性を排除する。
実験結果から,SLEDはゼロショット音声合成とストリーミング音声合成の両方において高い性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-05-19T14:38:59Z) - Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment [57.0121616203175]
本研究では,視覚言語アライメントを改善するための細粒度検証器として,モデル自身のビジュアルエンコーダを利用する新たな自己アライメント手法であるFiSAOを提案する。
ビジョンエンコーダからのトークンレベルのフィードバックを活用することで、FiSAOは視覚言語アライメントを大幅に改善する。
論文 参考訳(メタデータ) (2024-10-18T03:34:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。