論文の概要: Voice Memory for Agentic Speech Recognition
- arxiv url: http://arxiv.org/abs/2607.26410v1
- Date: Wed, 29 Jul 2026 02:42:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.526872
- Title: Voice Memory for Agentic Speech Recognition
- Title(参考訳): エージェント音声認識のための音声記憶
- Abstract要約: エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
- 参考スコア(独自算出の注目度): 66.69623133635868
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Voice Memory, a inference-only scheme for agentic speech recognition: at stream time, a frozen corrector reads a single per-domain memory.md and decides per utterance whether to act on the hypothesis or abstain and keep the 1-best. Asynchronously, a score-gated optimizer revises that file through bounded edits, accepting an edit only when it strictly improves a held-out score. Extended from classical ASR-LM framework, we refer this split the listener-thinker architecture; the two roles are coupled only through the memory, so no weights change and the learned skill stays auditable and portable. Restraint turns out to be the operative skill this loop discovers: unconstrained generative error correction (GER) over-corrects, breaking correct tokens on up to 64% of its edits on financial news, and Voice Memory, reduces this rate to 35%. Across ten HyPoradise domains with an open corrector, Voice Memory, lowers weighted word error rate from 8.36% to 7.52% (7.47% with three added in-context examples) without regressing any dataset below its 1-best baseline; gains concentrate where recoverable headroom is largest, including air-travel commands (8.40% to 3.40%) and noisy far-field speech (CHiME-4, 12.69% to 10.46%). The memory transfers across corrector families and adds zero parameters to the inference path. A demo and example code are provided for future studies.
- Abstract(参考訳): 本稿では,エージェント音声認識のための推論専用スキームであるVoice Memoryについて述べる。ストリーム時には,フリーズした修正者が1つのドメイン単位のメモリ.mdを読み,その仮説に作用するか,あるいは1-bestを維持するべきかを発話毎に決定する。
同期的に、スコアゲートオプティマイザは境界編集を通じてファイルを修正し、ホールドアウトスコアを厳密に改善した場合のみ編集を受け付ける。
従来のASR-LMフレームワークから拡張して、この2つの役割はメモリを通してのみ結合されるため、重みは変更されず、学習スキルは監査可能でポータブルである。
制約のない生成エラー訂正(GER)は過度に修正され、財務ニュースの64%の編集で正しいトークンを壊し、Voice Memoryは、このレートを35%まで下げる。
オープンな修正器であるVoice Memoryを持つ10のHyPoradiseドメインは、1-bestベースライン以下のデータセットを回帰することなく、重み付き単語エラー率を8.36%から7.52%(3つの追加のインコンテキストの例で7.47%)に下げ、エアトラベルコマンド(8.40%から3.40%)やノイズの多い遠距離音声(CHiME-4, 12.69%から10.46%)を含む、回復可能なヘッドルームが最大となる場所に集中する。
メモリは、リフレクタファミリ間で転送され、推論パスにゼロパラメータを追加します。
将来の研究のためにデモとサンプルコードが提供されている。
関連論文リスト
- X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation [34.99298958122614]
X-AuTは、短い振る舞いプローブを通して層の組み合わせを選択するプログレッシブフレームワークである。
表現アライメント、クロススケール蒸留、スケジュールされた学生政治監督、LoRAファインタニングを通じて、プルーニングモデルを復元する。
18から16のオーディオエンコーダ層からQwen3-ASR-0.6Bを圧縮した10の公開英語ベンチマークでは、マクロ平均誤差が5.61%から5.27%に減少する。
論文 参考訳(メタデータ) (2026-09-10T11:43:17Z) - From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection [12.159476982130286]
音声のディープフェイクは、聞き手や自動化されたシステムを騙すのに十分な説得力のある話者の声を模倣することができる。
ほとんどの検出器は発話ごとに1点のスコアで終わるが、なぜ境界線アイテムが信頼されるべきなのか、延期されたのか、あるいはレビューされるべきなのかは、ほとんど語っていない。
この疑問に答えるには、4つの整列した手がかりを後期校正ステップに伝達する監査可能な決定記録がある。
論文 参考訳(メタデータ) (2026-09-08T15:38:57Z) - Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings [0.0]
シードライフスクリプトサンプリング器は、テキストが存在する前に、有効間隔のボラティリティクラスとソースチャネルの事実を出力する。
検証者は、すべての植えられた事実を確認し、質問はスクリプトから機械的にインスタンス化される。
人工的でフィクション化されたコーパスは、私たちが調査したベンチマークから欠落している特徴を埋め込んでいる。
論文 参考訳(メタデータ) (2026-07-24T04:19:45Z) - Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One [0.0]
言語モデルのメモリは、メモリを全く持たないよりも悪い場合がある。
間違った結論を維持しながら、その背後にある作業を捨てるメモリは、確実な答えとして古い値を出力する。
論文 参考訳(メタデータ) (2026-06-24T06:24:53Z) - Same Ranking, Different Winner: How Scoring Targets Shape LLM Memory Benchmarks [2.9089118242427627]
会話記憶システムは対話履歴を事実、要約、タイムライン、および他のソースリンクされた子孫に変換する。
どのストアドフォームが検索クレジットを受け取るべきか?
このスコアリング対象の選択は、しばしば暗黙的に残され、ベンチマークの結論を実質的に変更できることを示す。
論文 参考訳(メタデータ) (2026-05-22T02:53:07Z) - Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba [5.055749974859193]
MAVEは、テキスト条件付き音声編集と高忠実な音声合成のための新しい自動回帰アーキテクチャである。
MAVEは、音声編集における最先端のパフォーマンスと、ゼロショットTSにおける非常に競合的な結果を達成する。
MAVEは、RealEditデータベースからの発話を推測する際に、VoiceCraftよりも6倍少ないメモリを必要とする。
論文 参考訳(メタデータ) (2025-10-06T12:11:31Z) - High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning [84.52940628494879]
大規模言語モデル(LLM)は現在、すべてのプロンプトに応答する。
LLMは、知識や能力の欠如によって、誤った答えを生み出すことができる。
本稿では,その正確性に自信を持った場合にのみコンテンツを生成するためのLCMのポストトレーニングを提案する。
論文 参考訳(メタデータ) (2025-06-04T15:16:21Z) - HEMA : A Hippocampus-Inspired Extended Memory Architecture for Long-Context AI Conversations [0.0]
大規模言語モデル(LLM)は、数百回に及ぶ会話におけるコヒーレンスを維持するのに苦労する。
本稿では,人間の認知プロセスにインスパイアされたデュアルメモリシステムであるHEMAを紹介する。
10Kインデックスのチャンクでは、ベクトルメモリはP@5 >= 0.80 と R@50 >= 0.74 を達成し、精度-リコール曲線の下で領域を2倍にする。
論文 参考訳(メタデータ) (2025-04-23T14:27:12Z) - Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition [52.624909026294105]
本稿では,非自己回帰型音声誤り訂正法を提案する。
信頼モジュールは、N-best ASR仮説の各単語の不確実性を測定する。
提案方式は,ASRモデルと比較して誤差率を21%削減する。
論文 参考訳(メタデータ) (2024-06-29T17:56:28Z) - OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality
Alignment [57.15449072423539]
オープンモダリティ音声認識(textbfOpenSR)の学習システムを提案する。
OpenSRは、3つの異なる設定で1から1へのモダリティ転送を可能にする。
既存の数ショットとフルショットのリップリード方式と比較して、非常に競争力のあるゼロショット性能を実現している。
論文 参考訳(メタデータ) (2023-06-10T11:04:10Z) - Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs
for Robust Speech Recognition [52.71604809100364]
音声の文脈化表現に雑音のロバスト性をエンコードするwav2vec-Switchを提案する。
具体的には、オリジナルノイズの多い音声ペアを同時にwav2vec 2.0ネットワークに供給する。
既存のコントラスト学習タスクに加えて、原音声と雑音音声の量子化表現を追加の予測対象に切り替える。
論文 参考訳(メタデータ) (2021-10-11T00:08:48Z) - Unsupervised Speech Recognition [55.864459085947345]
wav2vec-Uは、ラベル付きデータなしで音声認識モデルを訓練する方法である。
我々は、自己教師付き音声表現を活用して、ラベルなし音声をセグメント化し、これらの表現から相手の訓練を通して音素へのマッピングを学習する。
より大きな英語のLibrispeechベンチマークでは、wav2vec-Uは、わずか2年前の960時間のラベル付きデータに基づいてトレーニングされた最も優れたシステムに匹敵する、他のテストで5.9の単語エラー率を達成した。
論文 参考訳(メタデータ) (2021-05-24T04:10:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。