論文の概要: AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation
- arxiv url: http://arxiv.org/abs/2608.04479v1
- Date: Wed, 05 Aug 2026 06:06:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.735131
- Title: AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation
- Title(参考訳): AudioScape-TTA:微細テキスト・ツー・オーディオ評価のための構造化サウンドスケープベンチマーク
- Authors: Jinting Wang, Yuguang Yang, Shengyu Li, Yan Rong, Shan Yang, Xiaoda Yang, Li Liu,
- Abstract要約: 微粒なTTA評価のための構造化および複雑性を考慮したベンチマークである textbfAudioScape-TTA を紹介する。
ベンチマークには2,258のオーディオテキストペアと25,707のバイナリQAルーブリックが含まれており、スケーラブルで解釈可能な分析を可能にする。
13種類のオープンソースTTAモデルに対する実験により, 微粒化特性制御, 音声コンテンツ保存, 構成生成の持続的制限が明らかになった。
- 参考スコア(独自算出の注目度): 22.231614260086754
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Text-to-audio (TTA) generation has recently achieved remarkable progress in synthesizing realistic audio from natural language descriptions. However, determining whether generated audio faithfully satisfies complex textual instructions remains challenging. Existing benchmarks mainly rely on global similarity metrics, providing limited insight into fine-grained semantic failures. To address this limitation, we introduce \textbf{AudioScape-TTA}, a structured and complexity-aware benchmark for fine-grained TTA evaluation. AudioScape-TTA represents realistic soundscapes through modality-aware semantic structures and characterizes generation complexity using event density and structural complexity. Based on these annotations, we propose a rubric-based audio-grounded evaluation framework that verifies event realization, acoustic attributes, and speech content through fine-grained semantic criteria. The benchmark contains 2,258 audio-text pairs with 25,707 binary QA rubrics, enabling scalable and interpretable analysis of TTA systems. Experiments on 13 representative open-source TTA models reveal persistent limitations in fine-grained attribute control, speech-content preservation, and compositional soundscape generation. Human validation further demonstrates that our rubric-based evaluation achieves stronger alignment with human semantic judgments than conventional global similarity metrics.
- Abstract(参考訳): テキスト・トゥ・オーディオ(TTA)生成は近年,自然言語記述からのリアル音声の合成において顕著な進歩を遂げている。
しかし、生成した音声が複雑なテキスト命令を忠実に満たすかどうかを判断することは依然として困難である。
既存のベンチマークは主にグローバルな類似度メトリクスに依存しており、きめ細かいセマンティック障害に関する限られた洞察を提供する。
この制限に対処するために、微細なTTA評価のための構造化および複雑性を考慮したベンチマークである \textbf{AudioScape-TTA} を導入する。
AudioScape-TTAは、モダリティを意識したセマンティック構造を通して現実的なサウンドスケープを表現し、イベント密度と構造複雑性を用いて生成複雑性を特徴付ける。
これらのアノテーションに基づき,詳細なセマンティック基準を用いて,事象の認識,音響特性,音声内容の検証を行う,ルーブリックに基づく音声グラウンド評価フレームワークを提案する。
ベンチマークには2,258のオーディオテキストペアと25,707のバイナリQAルーブリックが含まれており、TTAシステムのスケーラブルで解釈可能な分析を可能にする。
13種類のオープンソースTTAモデルに対する実験により, 微粒化特性制御, 音声コンテンツ保存, 構成音素生成の持続的制限が明らかになった。
人間の検証は,従来のグローバルな類似度指標よりも,人間の意味判断との整合性が強いことを示す。
関連論文リスト
- Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study [1.224954637705144]
本稿では,現代のTSシステムのシステム評価のための再現可能なマルチメトリックベンチマークフレームワークを提案する。
Indic-Parler-TTS, MMS-TTS, Microsoft Edge TTS, Google Gemini TTSの4つの最先端TSシステムを評価した。
その結果、音声領域間でのTTS性能のかなりの変動が明らかとなり、感情的な音声は、常に最大の合成課題を提示する。
論文 参考訳(メタデータ) (2026-08-03T13:49:11Z) - An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations [16.51678229294975]
構造化音声記述に適した多軸評価フレームワークを提案する。
タグセット,説明,論理的推論,数値計測,スペクトルプロファイルの5つの軸の出力を評価する。
本研究により,本枠組みは意味保存パラフレーズを意味論的・音響的腐敗と区別することに成功した。
論文 参考訳(メタデータ) (2026-07-23T15:26:52Z) - AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following [17.52339026461815]
本稿では,複雑な音声キャプションを可変個の独立した検証可能なバイナリルーブリックアイテムに適応的に分解する動的ルーブリック評価パラダイムを提案する。
我々はこの能力をAnyAudio-Judge Benchでベンチマークする。
実験により、AnyAudio-Judgeは、最先端のベースラインに比べて、ゼロショットアライメントの検出を著しく向上する。
論文 参考訳(メタデータ) (2026-06-02T04:00:32Z) - UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions [55.622295453533475]
音声,音楽,音響効果を合成できる統合フローマッチングフレームワークUniSonateを紹介する。
本研究では,非構造環境音を時間潜在空間に投影する動的トークン注入機構を提案する。
実験により、UniSonateは、命令ベースのTSとTTMで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-04-24T04:26:04Z) - Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs [53.41256816230278]
最近のオーディオ大言語モデル(AudioLLMs)は、顕著な性能逆転を示す。
複雑な推論タスクには優れるが、音の微妙な知覚では一貫して性能が劣る。
音声情報を3つの明示的な構成要素に整理する総合的かつ構造化された監視フレームワークであるUnified Audio (UAS)を提案する。
論文 参考訳(メタデータ) (2026-04-14T09:30:12Z) - Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations [2.2870073664564115]
小さな言語的変化は、生成された音声にかなりの変化をもたらし、実用的な使用における信頼性への懸念を引き起こす可能性がある。
制御された即時摂動下でのテキスト・音声システムの意味的不安定性を評価する。
論文 参考訳(メタデータ) (2026-03-14T08:12:40Z) - AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [97.52852990265136]
音声対応大規模言語モデルの推論機能を活用するバックボーン非依存評価フレームワークであるAQAScoreを紹介する。
AQAScoreは人格関連性、ペア比較、構成推論タスクを含む複数のベンチマークで評価する。
論文 参考訳(メタデータ) (2026-01-21T07:35:36Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing [47.14083940177122]
ThinkSoundは、ビデオの段階的にインタラクティブなオーディオ生成と編集を可能にする新しいフレームワークである。
提案手法は,3つの相補的な段階 – セマンティック・コヒーレント,インタラクティブなオブジェクト中心の改良,ターゲット編集 – に分解する。
実験により、ThinkSoundはオーディオメトリクスとCoTメトリクスの両方で、ビデオからオーディオ生成における最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-06-26T16:32:06Z) - Text-Queried Audio Source Separation via Hierarchical Modeling [53.94434504259829]
本研究では,HSM-TSSという階層的分解フレームワークを提案し,そのタスクをグローバルな意味誘導特徴分離と構造保存音響再構成に分解する。
Q-Audioアーキテクチャは、事前訓練されたグローバルセマンティックエンコーダとして機能するオーディオとテキストのモダリティを調整するために使用される。
本手法は,複雑な聴覚シーンにおけるクエリとのセマンティック一貫性を保ちながら,データ効率のトレーニングによる最先端の分離性能を実現する。
論文 参考訳(メタデータ) (2025-05-27T11:00:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。