論文の概要: Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs
- arxiv url: http://arxiv.org/abs/2609.22851v2
- Date: Tue, 22 Sep 2026 02:40:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.910011
- Title: Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs
- Title(参考訳): 離散対連続性:LALMにおける統一音声理解の総合的研究
- Abstract要約: 音声・音声・音楽の連続的・離散的な表現を体系的に評価する。
音声理解のためのトークン化における意味的制約の重要性を明らかにする。
これらの知見は,将来のLALMにおける意味密度,忠実度,効率のバランスをとるための実践的ガイダンスを提供する。
- 参考スコア(独自算出の注目度): 11.605897876925672
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large Audio Language Models (LALMs) utilize either continuous features or discrete tokens, yet the optimal representation paradigm for general audio understanding remains debated. Existing benchmarks often focus on narrow domains or evaluate encoders outside LALM contexts. To address these gaps, we systematically evaluate continuous and discrete representations across speech, sound and music. Utilizing our UniARC framework with dual evaluation strategies across model scales from SmolLM2-135M to Llama-3-8B, we analyze the dynamic relationships of data volume, model capacity, and computational efficiency. Our results reveal the pivotal role of semantic constraints in tokenization for audio understanding and demonstrate that scaling backbones fail to compensate for information loss in audio representation, especially in data-limited tasks. These findings offer practical guidance for balancing semantic density, fidelity, and efficiency in future LALMs.
- Abstract(参考訳): 大規模音声言語モデル(LALM)は、連続的な特徴または離散トークンのいずれかを用いるが、一般的な音声理解のための最適な表現パラダイムは議論されている。
既存のベンチマークでは、狭いドメインに焦点を当てたり、LALMコンテキスト以外のエンコーダを評価したりすることが多い。
これらのギャップに対処するために、音声、音、音楽の連続的および離散的な表現を体系的に評価する。
我々のUniARCフレームワークをSmolLM2-135MからLlama-3-8Bまでのモデルスケールの二重評価戦略で利用し、データボリューム、モデルキャパシティ、計算効率の動的関係を解析する。
音声理解のためのトークン化において意味制約が果たす重要な役割を明らかにし,特にデータ限定タスクにおいて,バックボーンのスケーリングが音声表現における情報損失を補うことができないことを示す。
これらの知見は,将来のLALMにおける意味密度,忠実度,効率のバランスをとるための実践的ガイダンスを提供する。
関連論文リスト
- LLM-Based Synthetic Ground Truth Generation for Audio-Based Emotion Classification via In-Context Learning [9.928781897312971]
本稿では,VR環境におけるストリーミング音声データから感情関連合成地上真実を生成するための大規模言語モデル(LLM)に基づくエージェント推論ワークフローを提案する。
In-Context Learning (ICL) を用いて、ペア音声ベースのサンプルとその対応する転写のデモを行い、情報的かつ堅牢なインコンテキストプロンプトを構築する。
論文 参考訳(メタデータ) (2026-06-10T11:08:21Z) - ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability [35.45844102229014]
LALM(Large Audio-Language Models)は、劣化した命令追従能力を示す。
音声条件下でのLALMのインコンテキスト学習能力を評価するために,テキスト指導を段階的に削減するフレームワークであるALICEを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:03:29Z) - Causal Tracing of Audio-Text Fusion in Large Audio Language Models [48.849764961130795]
我々は、音声理解におけるLALMの内部情報の流れを調べるために因果追跡を適用した。
DeSTA,Qwen,Voxtralを横断的に層状およびトークン的に解析することにより,個々の隠れ状態の因果効果を評価する。
論文 参考訳(メタデータ) (2026-03-14T05:40:59Z) - Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration [28.470758433815423]
本稿では,音声感情認識(SER)のための離散トークンの包括的検討を行う。
異なる層構成とk平均量子化粒度での性能劣化を定量化する。
本稿では,(1)異なるレイヤから補完情報を取得するための注意ベースの多層融合,(2)パラ言語的手がかりを明示的に再導入するためのopenSMILE機能の統合,の2つの主要な戦略を提案する。
論文 参考訳(メタデータ) (2026-01-23T07:57:05Z) - SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models [49.313324100819955]
信号埋め込みエネルギー (Signal Embedding Energy, SEE) は、LALM入力に対する雑音強度の影響を定量化する手法である。
SEEはLALM性能と強い相関を示し,0.98。
本稿では,LALMにおけるノイズ定量化のための新しい指標を提案し,実環境におけるロバスト性向上のためのガイダンスを提供する。
論文 参考訳(メタデータ) (2026-01-12T08:57:55Z) - Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs [59.230858581944425]
音声処理には、離散トークンと連続的な特徴の2つの主要なアプローチが出現している。
自己教師付き学習(SSL)に基づく離散的かつ連続的な特徴を、同じ実験環境下で比較する。
その結果, 連続的な特徴は, 様々なタスクにおいて, 離散トークンよりも優れていた。
論文 参考訳(メタデータ) (2025-08-25T10:16:07Z) - Implicit Counterfactual Learning for Audio-Visual Segmentation [50.69377287012591]
我々は,非バイアスの相互理解を実現するために,暗黙の対実的枠組み(ICF)を提案する。
意味論の欠如により、異種表現は誤った一致につながる可能性がある。
モダリティ共有空間を確立するために,ビデオ,セグメント,フレームレベルを含む多粒性暗黙テキスト(MIT)をブリッジとして導入する。
論文 参考訳(メタデータ) (2025-07-28T11:46:35Z) - From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data [55.2480439325792]
音声対応の大規模言語モデル(ALLM)は近年,音声入力の理解と処理において大きな進歩を遂げている。
これらのモデルは典型的にはテキストベースの大規模言語モデル(LLM)に適応し、音声関連タスクのさらなるトレーニングを行う。
本研究では、現在と欠落した音を区別するALLMの能力を高めるために、コントラッシブな訓練データを生成するデータ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:08:41Z) - Sparsity-Guided Holistic Explanation for LLMs with Interpretable
Inference-Time Intervention [53.896974148579346]
大規模言語モデル(LLM)は、様々な自然言語処理領域において前例のないブレークスルーを達成した。
LLMの謎的なブラックボックスの性質は、透過的で説明可能なアプリケーションを妨げる、解釈可能性にとって重要な課題である。
本稿では,LLMの全体的解釈を提供することを目的として,スポーシティ誘導技術に係わる新しい方法論を提案する。
論文 参考訳(メタデータ) (2023-12-22T19:55:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。