論文の概要: An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations
- arxiv url: http://arxiv.org/abs/2607.21424v1
- Date: Thu, 23 Jul 2026 15:26:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.455118
- Title: An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations
- Title(参考訳): 制御された摂動によって検証された構造化オーディオキャプションの評価フレームワーク
- Authors: Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright, Magdalena Fuentes,
- Abstract要約: 構造化音声記述に適した多軸評価フレームワークを提案する。
タグセット,説明,論理的推論,数値計測,スペクトルプロファイルの5つの軸の出力を評価する。
本研究により,本枠組みは意味保存パラフレーズを意味論的・音響的腐敗と区別することに成功した。
- 参考スコア(独自算出の注目度): 16.51678229294975
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent advancements in automated audio captioning (AAC) have shifted from monolithic sentence generation toward structured formats that explicitly disentangle distinct acoustic and semantic properties. However, evaluating this heterogeneous data remains a significant challenge. Existing caption metrics focus on flat textual outputs and fail to reliably assess multimodal attributes. To bridge this gap, we propose a multi-axis evaluation framework tailored for structured audio descriptions. Building on the AudioCards dataset, we evaluate outputs across five orthogonal axes: tag-sets, descriptions, logical reasoning, numeric measurements, and spectral profiles. Our approach combines Large Language Model (LLM) judges to capture semantic nuance with deterministic computational metrics to precisely measure acoustic deviations. To rigorously validate the reliability of this framework, we introduce a controlled perturbation testing protocol that injects typed, graded errors into groundtruth annotations. Our results demonstrate that this framework successfully distinguishes meaning-preserving paraphrases from genuine semantic and acoustic corruptions.
- Abstract(参考訳): 近年の音声の自動字幕化 (AAC) は, モノリシックな文生成から, 明瞭な音響的・意味的特性を阻害する構造化形式へと変化している。
しかし、この異種データを評価することは依然として大きな課題である。
既存のキャプションメトリクスは平らなテキスト出力に重点を置いており、マルチモーダル属性を確実に評価できない。
このギャップを埋めるために,構造化音声記述に適した多軸評価フレームワークを提案する。
AudioCardsデータセットに基づいて、タグセット、記述、論理的推論、数値測定、スペクトルプロファイルの5つの直交軸の出力を評価する。
提案手法では,Large Language Model (LLM) 判定器を用いて意味的ニュアンスと決定論的計算量を組み合わせて音響偏差を正確に測定する。
本フレームワークの信頼性を厳格に検証するために,型付きグレードエラーを基底アノテーションに注入する制御摂動試験プロトコルを導入する。
本研究により,本枠組みは意味保存パラフレーズを意味論的・音響的腐敗と区別することに成功した。
関連論文リスト
- An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures [5.593982292458519]
本稿では,コンバウンド駆動のショートカット依存を識別するための介入に基づく診断フレームワークを提案する。
非音声構造、スペクトル含量、信号エネルギーを対象とする制御音響摂動によりこれを操作する。
その結果、非音声介入は最大のパフォーマンスシフトをもたらし、非音声区間が支配的なショートカットであることを確認した。
論文 参考訳(メタデータ) (2026-07-03T09:42:31Z) - Membership Inference Attacks against Large Audio Language Models [50.84901010528239]
大規模音声言語モデル(LALM)のMIA評価について述べる。
テキスト,スペクトル,韻律的特徴に基づくマルチモーダルブラインドベースラインを用いて,一般的な音声データセットがほぼ完璧な列車/テスト分離性を示すことを示す。
以上の結果から, LALM検査の基準基準が確立された。
論文 参考訳(メタデータ) (2026-03-30T12:45:28Z) - AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [97.52852990265136]
音声対応大規模言語モデルの推論機能を活用するバックボーン非依存評価フレームワークであるAQAScoreを紹介する。
AQAScoreは人格関連性、ペア比較、構成推論タスクを含む複数のベンチマークで評価する。
論文 参考訳(メタデータ) (2026-01-21T07:35:36Z) - Provable Speech Attributes Conversion via Latent Independence [22.02196595272211]
本稿では,理論的解析と妥当な仮定の下での保証を伴って,音声属性変換のための一般的な枠組みを提案する。
本フレームワークは,予測潜在変数と対象可制御変数との独立性制約を持つ非確率的オートエンコーダアーキテクチャ上に構築する。
この設計は、観測されたスタイル変数に条件付きで一貫した信号変換を保証し、元のコンテンツを保持し、所望の属性を変更する。
論文 参考訳(メタデータ) (2025-10-06T12:08:27Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - STAB: Speech Tokenizer Assessment Benchmark [57.45234921100835]
音声を離散トークンとして表現することは、音声をテキストによく似たフォーマットに変換するためのフレームワークを提供する。
Speech Tokenizer Assessment Benchmark(STAB)は,音声トークンを包括的に評価するシステム評価フレームワークである。
我々はSTABのメトリクスを評価し、これを音声タスクやトークン化ツールの選択の範囲でダウンストリームタスクのパフォーマンスと相関付けする。
論文 参考訳(メタデータ) (2024-09-04T02:20:59Z) - Learning Disentangled Speech Representations [0.412484724941528]
SynSpeechは、非絡み合った音声表現の研究を可能にするために設計された、新しい大規模合成音声データセットである。
本稿では, 線形探索と教師付きアンタングル化指標を併用して, アンタングル化表現学習手法を評価する枠組みを提案する。
SynSpeechは、さまざまな要因のベンチマークを促進し、ジェンダーや話し方のようなより単純な機能の切り離しを期待できると同時に、話者アイデンティティのような複雑な属性を分離する際の課題を強調します。
論文 参考訳(メタデータ) (2023-11-04T04:54:17Z) - Exploiting Sample Uncertainty for Domain Adaptive Person
Re-Identification [137.9939571408506]
各サンプルに割り当てられた擬似ラベルの信頼性を推定・活用し,ノイズラベルの影響を緩和する。
不確実性に基づく最適化は大幅な改善をもたらし、ベンチマークデータセットにおける最先端のパフォーマンスを達成します。
論文 参考訳(メタデータ) (2020-12-16T04:09:04Z) - Continuous speech separation: dataset and analysis [52.10378896407332]
自然な会話では、音声信号は連続的であり、重複成分と重複成分の両方を含む。
本稿では,連続音声分離アルゴリズムを評価するためのデータセットとプロトコルについて述べる。
論文 参考訳(メタデータ) (2020-01-30T18:01:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。