論文の概要: What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio
- arxiv url: http://arxiv.org/abs/2607.18704v1
- Date: Tue, 21 Jul 2026 04:56:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.310597
- Title: What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio
- Title(参考訳): トランスペアレントファーストの音声と音声のインテリジェンスとキャプションスタジオ
- Abstract要約: Caption Studioは透明性第一の音声および音声インテリジェンスプラットフォームである。
音声とビデオは、自動書き起こし、話者ダイアリゼーション、音声分析、信号レベルオーディオ分析、字幕生成を通じて構造化され検索可能なコンテンツに変換される。
- 参考スコア(独自算出の注目度): 4.021733299734901
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Caption Studio is a transparency-first speech and audio intelligence platform that transforms spoken audio and video into structured, searchable content through automated transcription, speaker diarization, speech analytics, signal-level audio analysis, and subtitle generation. The system is built on a FastAPI backend with a real-time dashboard and adopts a three-layer architecture comprising (i) a transcription and diarization core based on Whisper-class automatic speech recognition and pyannote speaker diarization, (ii) an audio intelligence layer that extracts acoustic and linguistic features, including waveforms, spectrograms, pitch, speaking rate, silence, filler-word frequency, and sentiment, directly from the audio signal, and (iii) an integration layer that supports data export and downstream workflow integration. A principal contribution of this work is the transparency-first framework, in which every reported metric is explicitly identified as measured, derived, or unavailable, thereby improving the traceability, interpretability, and reliability of speech analytics. The paper presents the system architecture, benchmarking methodology, explainability and uncertainty framework, and key considerations for enterprise-scale deployment.
- Abstract(参考訳): Caption Studioは透明ファーストの音声と音声のインテリジェンスプラットフォームで、音声と映像を自動書き起こし、話者ダイアリゼーション、音声分析、信号レベルオーディオ分析、字幕生成を通じて構造化され検索可能なコンテンツに変換する。
このシステムはリアルタイムダッシュボードを備えたFastAPIバックエンド上に構築されており、3層アーキテクチャを採用している。
i)ウィスパー級自動音声認識とピアンノート話者ダイアリゼーションに基づく転写・ダイアリゼーションコア
二 音声信号から直接波形、スペクトル、ピッチ、発話率、サイレント、フィラーワード周波数及び感情を含む音響的・言語的特徴を抽出する音声インテリジェンス層
(iii) データエクスポートと下流ワークフローの統合をサポートする統合レイヤ。
この研究の主な貢献は透明性第一のフレームワークであり、報告されたすべてのメトリクスは、測定、導出、あるいは利用できないものとして明示的に識別され、それによって、音声分析のトレーサビリティ、解釈可能性、信頼性が向上する。
本稿では,システムアーキテクチャ,ベンチマーク手法,説明可能性と不確実性に関するフレームワーク,および企業規模の展開について考察する。
関連論文リスト
- Unified Audio Intelligence Without Regressing on Text Intelligence [86.55418188552768]
我々は,統一音声テキストLLMであるNemotron-Labs-Audex-30B-A3B(Audex)を紹介する。
Audexは単一のTransformerデコーダで単純な統一設計を採用する。
Audexは最先端の音声理解、音声認識と翻訳、テキスト音声合成、音声生成、音声音声生成を提供する。
論文 参考訳(メタデータ) (2026-07-06T15:11:57Z) - Beyond Transcripts: A Renewed Perspective on Audio Chaptering [66.61445564139052]
音声のみのアーキテクチャ(AudioSeg)は,長文音声をコヒーレントなセクションに分割するためのテキストベースのアプローチよりも優れていることを示す。
YTSegの実験では、AudioSegはテキストベースのアプローチを著しく上回り、停止は最大の音響的利得をもたらし、MLLMは文脈長と弱命令によって制限される。
論文 参考訳(メタデータ) (2026-02-09T18:28:10Z) - Pisets: A Robust Speech Recognition System for Lectures and Interviews [2.0524609401792397]
本研究は、科学者やジャーナリストのための音声テキストシステム「Pisets」について述べる。
アーキテクチャは、Wav2Vec2を用いた一次認識、Audio Spectrogram Transformer(AST)による偽陽性フィルタリング、Whisperによる最終音声認識を含む。
提案手法は、WhisperXや通常のWhisperモデルと比較して、様々な音響条件における長い音声データのロバストな書き起こしを保証する。
論文 参考訳(メタデータ) (2026-01-26T12:14:51Z) - Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations [18.74784108693223]
トランスフォーマーに基づく言語モデル(SLM)は、音声認識と理解を大幅に改善した。
SLMが如何に構文的・概念的特徴をエンコードするかはいまだ不明である。
本研究は,SLMにおける文脈的構文的特徴と意味的特徴の存在を体系的に評価した最初のものである。
論文 参考訳(メタデータ) (2025-09-19T06:29:33Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - Text-Queried Audio Source Separation via Hierarchical Modeling [53.94434504259829]
本研究では,HSM-TSSという階層的分解フレームワークを提案し,そのタスクをグローバルな意味誘導特徴分離と構造保存音響再構成に分解する。
Q-Audioアーキテクチャは、事前訓練されたグローバルセマンティックエンコーダとして機能するオーディオとテキストのモダリティを調整するために使用される。
本手法は,複雑な聴覚シーンにおけるクエリとのセマンティック一貫性を保ちながら,データ効率のトレーニングによる最先端の分離性能を実現する。
論文 参考訳(メタデータ) (2025-05-27T11:00:38Z) - From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data [55.2480439325792]
音声対応の大規模言語モデル(ALLM)は近年,音声入力の理解と処理において大きな進歩を遂げている。
これらのモデルは典型的にはテキストベースの大規模言語モデル(LLM)に適応し、音声関連タスクのさらなるトレーニングを行う。
本研究では、現在と欠落した音を区別するALLMの能力を高めるために、コントラッシブな訓練データを生成するデータ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:08:41Z) - A Cascaded Architecture for Extractive Summarization of Multimedia Content via Audio-to-Text Alignment [0.0]
本研究は,音声-テキストアライメントによるマルチメディアコンテンツの抽出要約のためのカスケードアーキテクチャを提案する。
Microsoft Azure Speechを使った音声からテキストへの変換と、Whisper、Pegasus、Facebook BART XSumといった高度な抽出要約モデルを統合する。
ROUGEとF1スコアを用いた評価は,従来の要約手法よりも優れた性能を示した。
論文 参考訳(メタデータ) (2025-03-06T13:59:14Z) - Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction [9.101978573666546]
Baichuan-Audioは、音声理解と生成をシームレスに統合するエンドツーエンドのオーディオ大言語モデルである。
テキスト誘導されたアライメントされた音声生成機構を備え、理解能力と生成能力の両方でリアルタイムな音声対話を可能にする。
論文 参考訳(メタデータ) (2025-02-24T15:16:34Z) - An Overview of Deep-Learning-Based Audio-Visual Speech Enhancement and
Separation [57.68765353264689]
音声強調と音声分離は関連する2つの課題である。
伝統的に、これらのタスクは信号処理と機械学習技術を使って取り組まれてきた。
ディープラーニングは強力なパフォーマンスを達成するために利用されています。
論文 参考訳(メタデータ) (2020-08-21T17:24:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。