論文の概要: YazSes: An Offline, Privacy-First, Cross-Platform Hold-to-Talk Voice-Dictation System
- arxiv url: http://arxiv.org/abs/2607.28878v1
- Date: Thu, 30 Jul 2026 22:43:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.51182
- Title: YazSes: An Offline, Privacy-First, Cross-Platform Hold-to-Talk Voice-Dictation System
- Title(参考訳): YazSes: オフライン、プライバシファースト、クロスプラットフォームのホールド・ツー・トーク音声ディクテーションシステム
- Abstract要約: クラウド音声予測サービスは、高い精度を提供するが、ユーザのスピーチをリモートプロバイダにストリーミングする必要がある。
私たちはYazSesを紹介します。YazSesは、完全にデバイス上で実行されるオープンソースのホルドツートーク宣言デーモンです。
YazSesは、高速なWhisper(CPU、int8)で音声をローカルに書き起こし、フォーカスされたアプリケーションに結果を注入する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cloud voice-dictation services deliver strong accuracy but require streaming a user's speech to a remote provider, an unacceptable trade-off in privacy-sensitive professions and offline or air-gapped settings; the leading on-device alternatives are either platform-locked or aimed at expert scripting rather than plug-and-play dictation. We present YazSes, an open-source (Apache-2.0) hold-to-talk voice dictation daemon that runs entirely on-device, with a single codebase targeting Linux, macOS, and Windows through a protocol-based platform abstraction. YazSes transcribes speech locally with faster-whisper (CPU, int8) and injects the result into the focused application; a fast regex command grammar, backed by an optional small-language-model router, maps utterances to editor and terminal actions. Nothing leaves the machine: recording is push-to-talk rather than always-listening, there is no telemetry, and an opt-in personalization loop keeps its corpus encrypted on-device and proposes configuration changes instead of shipping data out. We describe the system architecture -- a staged pipeline behind a protocol-based platform abstraction with a JSON-RPC control plane -- and its privacy and threat model. We evaluate the shipping Python implementation on a single commodity Linux laptop; the macOS and Windows backends are implemented and unit-tested but not end-to-end evaluated here. On 200 LibriSpeech test-clean utterances spanning 40 speakers, word error rate ranges from 4.82% (tiny.en) to 2.59% (small.en) at a real-time factor of 0.520 for small.en, decoding faster than real time on CPU with no GPU. The command grammar reaches 100% action accuracy with a 0.0% false-positive rate on plain dictation at 0.021 ms per call, and the non-decode pipeline adds 0.289 ms of overhead. The system and the reproducible benchmark harness behind every number in this paper are public.
- Abstract(参考訳): クラウド音声予測サービスは、高い精度を提供するが、リモートプロバイダへのユーザのスピーチのストリーミング、プライバシに敏感な専門職の受け入れ難いトレードオフ、オフラインまたは空調設定を必要とする。
私たちが紹介するYazSesはオープンソース(Apache-2.0)で、完全にデバイス上で動作し、プロトコルベースのプラットフォーム抽象化を通じて、Linux、macOS、Windowsをターゲットとした単一のコードベースである。
YazSesは、高速ワイスパー(CPU, int8)で音声をローカルに書き起こし、結果を集中したアプリケーションに注入する。
記録は常に検索されるのではなく、プッシュ・トゥ・トークであり、テレメトリはなく、オプトインのパーソナライズ・ループがそのコーパスをオンデバイスで暗号化し、データを出荷する代わりに設定の変更を提案する。
我々は、JSON-RPCコントロールプレーンを備えたプロトコルベースのプラットフォーム抽象化の背後にあるステージドパイプラインであるシステムアーキテクチャと、そのプライバシと脅威モデルについて説明する。
macOSとWindowsのバックエンドは実装され、単体テストされているが、ここではエンドツーエンドに評価されていない。
40人の話者にまたがる200のLibriSpeechテストクリーンな発話では、ワードエラー率は4.82%(tiny.en)から2.59%(small.en)まで、小さな.enで0.520のリアルタイム係数で、GPUなしでCPU上でリアルタイムよりも高速に復号できる。
コマンド文法は100%の動作精度に達し、プレインディクテーションでは0.0%の偽陽性率で1コール当たり0.021ms、非デコードパイプラインでは0.289msのオーバーヘッドが加算される。
本論文のすべての数値の背後にあるシステムと再現可能なベンチマークハーネスは一般に公開されている。
関連論文リスト
- Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - PRiSM: Benchmarking Phone Realization in Speech Models [70.82595415252682]
音声認識(PR)は言語に依存しない言語間音声処理と音声解析のためのアトミックインタフェースとして機能する。
PRiSMは、音声知覚における盲点を明らかにするために設計された、最初のオープンソースベンチマークである。
論文 参考訳(メタデータ) (2026-01-20T15:00:36Z) - Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and Large Language Models [0.0]
ASTAは、エッジとクラウドの推論の間で音声コマンドを動的にルーティングする適応型音声対話ソリューションである。
NVIDIA Jetsonベースのエッジプラットフォームにソリューションを実装し、80の音声コマンドの多様なデータセットを使用して評価した。
論文 参考訳(メタデータ) (2025-12-14T17:07:23Z) - SwiftF0: Fast and Accurate Monophonic Pitch Detection [2.8766374696553823]
単声ピッチ推定のための新しい最先端技術を設定する,新しい軽量ニューラルモデルであるemphSwiftF0を提案する。
SwiftF0は、計算効率を維持しながら、アコースティックドメイン全体の堅牢な一般化を実現する。
論文 参考訳(メタデータ) (2025-08-25T19:39:20Z) - Spontaneous Informal Speech Dataset for Punctuation Restoration [0.8517406772939293]
SponSpeechは、非公式な音声ソースから派生した句読点復元データセットである。
フィルタリングパイプラインは,音声と文字起こしの双方の品質について検討する。
我々はまた、他の文法的に曖昧な句読点を予測するために、音声情報を活用するモデルの能力を評価することを目的とした、挑戦的なテストセットを慎重に構築する。
論文 参考訳(メタデータ) (2024-09-17T14:43:14Z) - Toward Interactive Dictation [27.67813195022947]
本研究では,オープンエンド自然言語における音声編集コマンドを用いて,ユーザの判断を中断できる可能性について検討する。
この柔軟性をリアルタイムでサポートするには、システムは音声のスパンをディクテーションまたはコマンドとして段階的に分類し、コマンドであるスパンを解釈する必要がある。
より小さなモデルは1.3秒のレイテンシで30%のエンドステート精度を達成し、大きなモデルは55%のエンドステート精度を7秒のレイテンシで達成する。
論文 参考訳(メタデータ) (2023-07-08T16:30:13Z) - SpeechLM: Enhanced Speech Pre-Training with Unpaired Textual Data [100.46303484627045]
本稿では,事前定義した統一表現と音声とテキストの事前学習を協調させるクロスモーダル音声言語モデル(SpeechLM)を提案する。
具体的には、音声とテキストのモダリティをブリッジするために、2つの別の離散トークン化器を導入する。
音声認識, 音声翻訳, ユニバーサル表現評価フレームワーク SUPERB など, 様々な音声言語処理タスクにおける音声LM の評価を行った。
論文 参考訳(メタデータ) (2022-09-30T09:12:10Z) - STOP: A dataset for Spoken Task Oriented Semantic Parsing [66.14615249745448]
エンドツーエンド音声言語理解(SLU)は単一モデルを用いて音声から直接意図を予測する。
Spoken Task-Oriented semantic Parsing (STOP) データセットをリリースします。
人間が録音した音声に加えて、我々はTS生成バージョンをリリースし、エンド・ツー・エンドのSLUシステムの低リソース領域適応の性能をベンチマークする。
論文 参考訳(メタデータ) (2022-06-29T00:36:34Z) - Zero-Shot Text-to-Speech for Text-Based Insertion in Audio Narration [62.75234183218897]
話者の訓練データなしで自然かつ一貫性のあるターゲット音声を生成する一段階の文脈認識フレームワークを提案する。
変換器をベースとしたデコーダを用いて,編集音声のメルスペクトルを生成する。
これは最近のゼロショット TTS エンジンを大きなマージンで上回っている。
論文 参考訳(メタデータ) (2021-09-12T04:17:53Z) - Dynamic Acoustic Unit Augmentation With BPE-Dropout for Low-Resource
End-to-End Speech Recognition [62.94773371761236]
我々は、OOVレートの高い低リソースセットアップで効果的なエンドツーエンドASRシステムを構築することを検討します。
本稿では,BPE-dropout法に基づく動的音響ユニット拡張法を提案する。
我々の単言語トルココンフォーマーは22.2%の文字誤り率(CER)と38.9%の単語誤り率(WER)の競争結果を確立した。
論文 参考訳(メタデータ) (2021-03-12T10:10:13Z) - A.I. based Embedded Speech to Text Using Deepspeech [3.2221306786493065]
本稿では,ローエンド計算装置における音声認識の実装プロセスについて述べる。
Deepspeechはオープンソースの音声認識で、ニューラルネットワークを使って音声スペクトログラムをテキストの書き起こしに変換する。
本稿では,Deepspeechバージョン0.1.0,0.1.1,0.6.0を用いて実験を行った。
論文 参考訳(メタデータ) (2020-02-25T08:27:41Z) - Continuous speech separation: dataset and analysis [52.10378896407332]
自然な会話では、音声信号は連続的であり、重複成分と重複成分の両方を含む。
本稿では,連続音声分離アルゴリズムを評価するためのデータセットとプロトコルについて述べる。
論文 参考訳(メタデータ) (2020-01-30T18:01:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。