論文の概要: TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models
- arxiv url: http://arxiv.org/abs/2607.28896v1
- Date: Thu, 30 Jul 2026 23:28:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.532967
- Title: TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models
- Title(参考訳): TORUS:統一音響モデルのためのレンダリング非一貫性テスト
- Abstract要約: 音声理解、音声生成、そしてますます、オーディオ編集が可能な統一オーディオモデルが増えている。
現在のプラクティスでは、特別なベンチマークで各機能を独立して評価しています。
本稿では、オーディオネイティブ統一モデルのための最初の自己整合性テストであるTORUSを紹介する。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unified audio models capable of audio understanding, audio generation and, increasingly, audio editing are proliferating rapidly. Yet a basic question about them remains unanswered: do the two heads of a unified model agree about the same audio? Current practice evaluates each capability in isolation on specialized benchmarks, and never asks whether a model can make sense of its own generations. We present TORUS, the first self-coherence test for audio-native unified models. TORUS comprises 48 three-stage self-coherence tests carrying 432 six-option questions spanning speech, sound and music across five task families. We holistically evaluate five open unified models alongside a Cascaded Baseline that combines state-of-the-art specialized generation, editing and understanding models. The best unified model answers 50.5% of questions against the Cascaded Baseline's 63.2% and a 16.7% chance floor. Models struggle on audio editing. Among the evaluated audio models (specialized and unified), we observe limited self-coherence, and thus position self-coherence as an essential test for future audio systems.
- Abstract(参考訳): 音声理解,音声生成,音声編集が可能な統一オーディオモデルは急速に普及している。
しかし、それらに関する基本的な疑問は答えられていない。統一モデルの2つの頭は、同じオーディオについて合意するのだろうか?
現在のプラクティスでは、特別なベンチマークで各機能を独立して評価しており、モデルが自身の世代を理解することができるかどうかを問うことはありません。
本稿では、オーディオネイティブ統一モデルのための最初の自己整合性テストであるTORUSを紹介する。
TORUSは5つのタスクファミリーにまたがる音声、音声、音楽にまたがる432の6つの質問を含む48の3段階の自己整合テストで構成されている。
私たちは、最先端の特殊生成、編集、理解モデルを組み合わせたCascaded Baselineとともに、5つのオープン統一モデルを評価します。
最高の統一モデルでは、カスケードベースラインの63.2%と16.7%の確率フロアに対する質問の50.5%が答えている。
モデルはオーディオ編集に苦労します。
評価された音声モデル(特殊化・統一化)のうち、限定的な自己整合性を観察し、将来のオーディオシステムにとって不可欠なテストとして自己整合性を置く。
関連論文リスト
- HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding [54.365959989048406]
音声言語モデル(SLM)は、ますますマルチスピーカー環境にデプロイされている。
しかし、音声を正しい話者とみなし、話者の身元を判断する能力は、いまだに不明である。
本稿では,話者対応推論の基礎的能力を診断するベンチマークHEARを紹介する。
A2Rは、話者レベルのハードな負を持つ非現実的オーディオに最適化された30Bモデルである。
論文 参考訳(メタデータ) (2026-08-29T08:01:20Z) - Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing [63.573256490583724]
Audio-Omniは、一般的な音、音楽、音声ドメイン間で生成と編集を統合する最初のエンドツーエンドフレームワークである。
高次推論のための凍結型マルチモーダル大言語モデルと高忠実度合成のためのトレーニング可能な拡散変換器を併用する。
AudioEditは100万以上の精巧にキュレートされた編集ペアからなる大規模なデータセットである。
論文 参考訳(メタデータ) (2026-04-12T16:08:20Z) - Woosh: A Sound Effects Foundation Model [58.759449707459474]
ソニーAIが公開しているサウンドエフェクト基礎モデルであるWooshを紹介します。
音響効果に最適化されているため,(1)高品質なオーディオエンコーダ/デコーダモデル,(2)コンディショニングのためのテキスト・オーディオアライメントモデルを提供する。
拡張されたテキスト・トゥ・オーディオモデルやビデオ・トゥ・オーディオモデルもこのリリースに含まれており、低リソースの操作と高速な推論が可能になっている。
論文 参考訳(メタデータ) (2026-04-02T11:49:00Z) - Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens [62.56027815951259]
現在のオーディオ言語モデルは、主にテキストファーストであり、事前訓練されたテキストLLMバックボーンを拡張するか、意味のみのオーディオトークンに依存する。
本稿では,大規模音声に次トーケン予測を適用したネイティブオーディオ基礎モデルの系統的研究を行った。
論文 参考訳(メタデータ) (2026-02-18T18:32:46Z) - Adaptive vector steering: A training-free, layer-wise intervention for hallucination mitigation in large audio and multimodal models [45.88028371034407]
本稿では,適応ベクトルステアリングによる音声コンテンツのより良い生成を提案する。
実験では、2つのモデルと2つのベンチマークで一貫したパフォーマンス向上を示している。
我々の知る限りでは、オーディオにおける幻覚を軽減するためにベクトルステアリングを適用した最初の研究である。
論文 参考訳(メタデータ) (2025-10-14T08:52:18Z) - MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation [34.79792511587843]
MMAudioSepは,ビデオ/テキスト検索音声分離のための生成モデルである。
事前訓練された音声生成モデルを用いて学習した映像・テキストと音声の関係について知識を利用することで、より効率的にモデルを訓練することができる。
論文 参考訳(メタデータ) (2025-10-10T07:13:06Z) - Multi-Domain Audio Question Answering Toward Acoustic Content Reasoning in The DCASE 2025 Challenge [102.84031769492708]
本課題は,多様な音響シーンに対する対話型質問応答における音声モデルをテストするための3つのQAサブセットを定義する。
開発セットの予備的な結果を比較し、モデルとサブセット間で強い変動を示す。
この課題は、音声モデルの音声理解と推論能力を人間レベルに向上することを目的としている。
論文 参考訳(メタデータ) (2025-05-12T09:04:16Z) - Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling? [40.3708221702947]
本研究の目的は,学習データとして使用することの有効性を検証し,音質を評価することである。
具体的には,音声認識における合成音声の利用について検討する。
また、音声関連モデリングにおいて、合成音声がデータ拡張の資源となるかどうかについても検討する。
論文 参考訳(メタデータ) (2024-06-13T04:33:05Z) - AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining [46.22290575167155]
本稿では, 音声, 音楽, 音響効果生成のための同じ学習手法を用いた枠組みを提案する。
私たちのフレームワークでは、LOA(Language of Audio)と呼ばれる音声の一般的な表現を導入しています。
論文 参考訳(メタデータ) (2023-08-10T17:55:13Z) - Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data [9.072124914105325]
本稿では、弱いラベル付きビデオ記録から音を認識することを学習するオーディオ視覚融合モデルを提案する。
大規模音響イベントデータセットであるAudioSetの実験は,提案モデルの有効性を実証する。
論文 参考訳(メタデータ) (2020-05-29T01:30:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。