論文の概要: Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research
- arxiv url: http://arxiv.org/abs/2609.03320v1
- Date: Thu, 03 Sep 2026 03:15:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.900657
- Title: Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research
- Title(参考訳): Beyond .WAV: VocalCapの設計とソフトウェア検証 - 音声バイオマーカー研究のためのトレース可能なブラウザベースのオーディオキャプチャシステム
- Abstract要約: VocalCap(ボーカルキャップ)は、音声と関連する音響信号を自己誘導でキャプチャするための、ブラウザベースの機関制御システムである。
各レコードは、ブラウザネイティブなオブジェクト、同じMediaStreamから派生したクライアントロスレスのFloat32 WAV、サーバカノニカルなモノPCM16 WAVを保持する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote voice studies often retain a final audio file with limited evidence about how it was captured, transferred, processed, and accepted. This paper presents VocalCap, an institution-controlled, browser-based system for self-guided capture of voice and related acoustic signals by participants without technical training. A versioned protocol drives the workflow. Each accepted recording retains a browser-native object, a client-lossless Float32 WAV derived from the same MediaStream, and a server-canonical mono PCM16 WAV, linked to evidence of capture execution, technical quality, byte-level integrity, recovery, and transformation provenance. IndexedDB preserves accepted browser artifacts until server confirmation, while session completion requires successful verification of every task and artifact. Software tests challenged the acquisition contracts with malformed or altered objects, exact-zero interruptions, channel-topology variants, and interrupted or repeated operations. A post hoc technical audit of 39 consented pilot recordings found 25 sample-identical stereo files and 14 files with signal confined to the left channel. Topology-aware active-channel selection limited the canonical root-mean-square level difference to less than 0.001 dB in all 14 affected files; equal-weight stereo averaging would have introduced approximately 6.02 dB of attenuation. Production end-to-end verification completed two five-task profiles in Chromium and WebKit, yielding 10 accepted recordings and 30 retained artifacts that passed server-side integrity and format checks. The results verify VocalCap's software behavior under the tested browser-engine conditions. Device-level acoustic agreement, target-population usability, clinical validity, and biomarker performance remain subjects for separate studies.
- Abstract(参考訳): リモート音声研究は、それがどのようにキャプチャされ、転送され、処理され、受け入れられたかという限られた証拠で、最終的な音声ファイルを保持することが多い。
本稿では,VocalCapについて紹介する。VocalCapは,技術訓練を受けない参加者による自己誘導による音声および関連音響信号の捕捉システムである。
バージョン管理されたプロトコルがワークフローを駆動する。
各録音は、ブラウザネイティブなオブジェクト、同じMediaStreamから派生したクライアントロスレスのFloat32 WAV、サーバカノニカルなモノPCM16 WAVを保持しており、キャプチャの実行、技術的品質、バイトレベルの完全性、リカバリ、変換の証明に結びついている。
IndexedDBは、サーバが確認するまでブラウザのアーティファクトを保存するが、セッションの完了にはすべてのタスクとアーティファクトの検証を成功させる必要がある。
ソフトウェアテストでは、不正または変更されたオブジェクト、正確なゼロの割り込み、チャネルトポロジーの変種、中断または繰り返し操作による買収契約に異議を唱えた。
39件の同意を得たパイロット録音のホック後の技術監査では、サンプル識別ステレオファイル25件と、左チャネルに信号が制限された14件のファイルが見つかった。
トポロジーを意識したアクティブチャネル選択は、全14ファイルにおいて標準ルート平均二乗差を0.001dB未満に制限し、等重量ステレオ平均化はおよそ6.02dBの減衰を導入した。
プロダクションエンドツーエンドの検証では、ChromiumとWebKitで2つの5タスクプロファイルが完了し、10つの録音が受け入れられ、30のアーティファクトがサーバ側の整合性とフォーマットチェックに合格した。
テストしたブラウザエンジン条件下でのVocalCapのソフトウェア動作を検証する。
デバイスレベルアコースティック・アコースティック・アコースティック・アコースティック・アコースティック・アコースティック・アコーディオン、ターゲット・ポピュレーション・ユーザビリティ、臨床的妥当性、バイオマーカー・パフォーマンスは別個の研究対象である。
関連論文リスト
- PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit [8.665845754660458]
AI生成ビデオ検出のGenVidBenchとAIGVDBenchが事実上のリーダーボードだ。
ほとんどの評価プロトコルは、報告された一般化を拡大できる制御されていない欠点を残している。
20紙の調査では、これをキャッチする標準的な6つのコントロールをすべて適用していない。
それらを監査プロトコルに組み合わせて、6つの代表的な特徴源に適用する。
論文 参考訳(メタデータ) (2026-06-30T00:29:53Z) - Asymmetric Phase Coding Audio Watermarking [7.627186551029829]
Deepfakeオーディオは音声ベースの認証システムに挑戦する。
トレーニング不要なオーディオ用暗号署名層である非対称位相符号化を提案する。
我々は、平均Q.02および数ミリ秒のレイテンシにおける全ての条件で、97.5%から98.3%の暗号検証率を達成する。
論文 参考訳(メタデータ) (2026-05-08T04:54:59Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan [64.09595490689874]
ACMマルチメディア2026におけるオールタイプオーディオディープフェイク検出(AT-ADD)グランドチャレンジを提案する。
AT-ADDは、堅牢で一般化可能なオーディオ法医学技術の開発を加速することを目的としている。
論文 参考訳(メタデータ) (2026-04-09T12:38:19Z) - Authenticated Contradictions from Desynchronized Provenance and Watermarking [48.47756819432157]
この研究は、$textitIntegrity Clash$を形式化し、実証的に実証している。
本稿では,3500枚のテスト画像に対して100%の分類精度を達成し,証明メタデータと透かし検出ステータスを共同評価する層間監査プロトコルを提案する。
論文 参考訳(メタデータ) (2026-03-02T20:42:12Z) - Multi-bit Audio Watermarking [38.40457780873775]
我々は,組込み型検出器モデルを訓練することなく,最先端のロバスト性と非受容性トレードオフを実現する,ポストホック音声透かしモデルTimbruを提案する。
提案手法は,知覚品質を保ちながら,最高の平均ビット誤り率を達成し,認識不能な音声透かしへの効率的なデータセットフリーパスを示す。
論文 参考訳(メタデータ) (2025-10-02T12:41:01Z) - AdVerb: Visually Guided Audio Dereverberation [49.958724234969445]
本稿では,新しいオーディオ・ビジュアル・デバーベレーション・フレームワークであるAdVerbを紹介する。
残響音に加えて視覚的手がかりを用いてクリーンオーディオを推定する。
論文 参考訳(メタデータ) (2023-08-23T18:20:59Z) - Spotting adversarial samples for speaker verification by neural vocoders [102.1486475058963]
我々は、自動話者検証(ASV)のための敵対サンプルを見つけるために、ニューラルボコーダを採用する。
元の音声と再合成音声のASVスコアの違いは、真正と逆正のサンプルの識別に良い指標であることがわかった。
私たちのコードは、将来的な比較作業のためにオープンソースにされます。
論文 参考訳(メタデータ) (2021-07-01T08:58:16Z) - Active Voice Authentication [16.300144775820243]
本稿では,従来の短い音声検査信号を用いて,信頼性の高い話者検証を可能にする手法について述べる。
このシステムを開発するために25人の話者のデータベースが記録されている。
リアルタイムのデモシステムはMicrosoft Surface Proで実装されている。
論文 参考訳(メタデータ) (2020-04-25T07:08:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。