論文の概要: Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning
- arxiv url: http://arxiv.org/abs/2607.20166v1
- Date: Wed, 22 Jul 2026 14:03:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.100164
- Title: Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning
- Title(参考訳): オーディオゼロ:音の微粒化のためのラベルなしセルフエボリューション
- Abstract要約: 大型オーディオ言語モデル(LALM)は、音響理解を急速に進歩させてきたが、それでも細粒度のオーディオ推論に苦慮している。
本稿では,LALMにおけるラベルフリーな自己進化フレームワークであるAudio-Zeroを紹介する。
広義の音声理解を保ちながら,音の微妙な推論を改善したAudio-Zeroについて述べる。
- 参考スコア(独自算出の注目度): 44.01898427480094
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Audio Language models (LALMs) have made rapid progress on acoustic understanding, yet they still struggle with fine-grained audio reasoning (e.g., recognizing event order, repetitions and duration). Existing post-training methods heavily rely on expensive external labels or provide only coarse semantic signals. To bridge this gap, we introduce Audio-Zero, the first label-free self-evolution framework in the field of LALMs that improves fine-grained auditory perception and reasoning. Audio-Zero constructs an auditory self-play game from unlabeled audio contrast pairs: most players hear a reference audio, while one odd listener hears a subtle variant. The model first generates clues describing what it hears and then identifies the odd listener by reasoning over inconsistencies among clues. Since the odd listener is known by construction, the game provides verifiable rewards without any annotated answers. Experiments with Qwen2-Audio-7B-Instruct and Qwen2.5-Omni-7B on TREA, MMAU Test-mini and MMAR show that Audio-Zero improves fine-grained audio reasoning while preserving broad audio understanding. Evolutionary and diagnostic analyses further reveal that increasingly fine-grained auditory descriptions emerge naturally from game pressure.
- Abstract(参考訳): 大規模オーディオ言語モデル(LALM)は、音響的理解を急速に進歩させてきたが、細粒度のオーディオ推論(例えば、イベントの順序、繰り返し、持続時間を認識する)に苦慮している。
既存のポストトレーニング手法は、高価な外部ラベルに大きく依存するか、粗いセマンティック信号のみを提供する。
このギャップを埋めるために、LALMの分野における初のラベルなし自己進化フレームワークであるAudio-Zeroを導入し、よりきめ細かい聴覚知覚と推論を改善する。
Audio-Zeroは、未ラベルのオーディオコントラストペアから聴覚的なセルフプレイゲームを構築する:ほとんどのプレイヤーはリファレンスオーディオを聴き、一方の奇妙なリスナーは微妙な変奏を聴く。
モデルはまず、それが何を聴くかを記述する手がかりを生成し、その後、手がかり間の矛盾を推論して奇妙なリスナーを識別する。
奇妙なリスナーは構成によって知られているため、ゲームは注釈付き回答なしで検証可能な報酬を提供する。
Qwen2-Audio-7B-InstructとQwen2.5-Omni-7BによるTREA、MMAU Test-mini、MMARによる実験では、広義の音声理解を保ちながら、Audio-Zeroがきめ細かい音声推論を改善することが示されている。
進化的および診断的分析により、より微細な聴覚記述がゲーム圧力から自然に現れることが明らかとなった。
関連論文リスト
- TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models [9.497925590553857]
大型オーディオ言語モデル(LALM)は、音響オブジェクトを幻覚させ、音のイベントに「はい」と答える。
本研究では,幻覚緩和のための学習自由戦略であるToken-Adaptive Decoding (TAD)を提案する。
論文 参考訳(メタデータ) (2026-09-07T09:54:52Z) - Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning [57.5472764796581]
本稿では,自己進化型報酬で音声推論を監督する強化学習フレームワークであるAudioRubricsを紹介する。
AudioRubricsは、サンプルごとのルーブリックを生波形から合成し、モデル自身のロールアウト、再生、グループごとのリウェイト基準で条件付けする。
解析の結果,ジェネレータと判定器の能力でゲインがスケールし,AudioRubricsは安定な推論長に収束し,縮退と成長の両面を回避できることがわかった。
論文 参考訳(メタデータ) (2026-08-03T19:46:13Z) - HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models [30.18524844766061]
HalluAudioは、音声、環境音、音楽の幻覚を評価するための最初の大規模ベンチマークである。
HalluAudioは、5万以上の人間による検証されたQAペアで構成され、バイナリ判断、複数選択推論、属性検証、オープンエンドQAなど、さまざまなタスクタイプにまたがる。
以上の結果から, 音場, 時間的推論, 音楽属性の理解において, 信頼性とロバスト性を考慮したLALMの必要性が示唆された。
論文 参考訳(メタデータ) (2026-04-21T10:05:28Z) - Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning [39.264735719707154]
現在の取り組みは、ワンタイムエンコーディングを通じて音声コンテンツを文脈化することで、テキストベースの推論を再現している。
本稿では,このボトルネックを突破するための音声インターリーブ推論を提案する。
本稿では,要求時に音声に動的に再登録できるLALMのEchoについて述べる。
論文 参考訳(メタデータ) (2026-02-12T13:06:34Z) - Step-Audio-R1 Technical Report [70.37077572409319]
本稿では,音声領域における推論能力の解放に成功した最初の音声推論モデルであるStep-Audio-R1を紹介する。
私たちのモデルは、Gemini 2.5 Proを抜いて、最先端のGemini 3 Proに匹敵するパフォーマンスを実現した、強力なオーディオ推論能力を示しています。
論文 参考訳(メタデータ) (2025-11-19T20:12:50Z) - WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations [67.6147632074449]
海洋哺乳動物の発声を用いた低レベルの聴覚知覚と認知を評価するために,WoW-Benchベンチマーク(World-of-Whale benchmark)を導入した。
WoW-Benchは、新しい音を分類するための知覚ベンチマークと、ブルームの分類学にインスパイアされた認知ベンチマークで構成され、音の出来事を記憶、理解、応用、分析する能力を評価する。
最先端のLALMを用いた実験は、人間のレベルよりもはるかに低い性能を示し、LALMのより強力な聴覚的接地の必要性を示している。
論文 参考訳(メタデータ) (2025-08-28T16:29:46Z) - Multi-Domain Audio Question Answering Toward Acoustic Content Reasoning in The DCASE 2025 Challenge [102.84031769492708]
本課題は,多様な音響シーンに対する対話型質問応答における音声モデルをテストするための3つのQAサブセットを定義する。
開発セットの予備的な結果を比較し、モデルとサブセット間で強い変動を示す。
この課題は、音声モデルの音声理解と推論能力を人間レベルに向上することを目的としている。
論文 参考訳(メタデータ) (2025-05-12T09:04:16Z) - Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models [91.11904427660043]
本稿では,音声タスクの深い推論のための大規模音声言語モデルであるAudio-Reasonerを紹介する。
我々は、CoTA上でAudio-Reasonerを訓練し、オーディオ推論において優れた論理的機能を実現する。
以上の結果から,音声推論における構造化CoTトレーニングのコアが強調された。
論文 参考訳(メタデータ) (2025-03-04T06:18:34Z) - AAD-LLM: Neural Attention-Driven Auditory Scene Understanding [9.596626274863832]
本稿では,聴取者の注意を喚起するために脳信号を統合するプロトタイプシステムAAD-LLMについて述べる。
AAD-LLMは、参加話者を神経活動から予測し、この推定された注意状態に対して応答生成を条件付ける。
話者記述, 音声の書き起こし, 抽出, 質問応答について, マルチストーカーのシナリオでAAD-LLMを評価する。
論文 参考訳(メタデータ) (2025-02-24T03:06:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。