論文の概要: Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
- arxiv url: http://arxiv.org/abs/2608.16539v1
- Date: Mon, 17 Aug 2026 13:14:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.708079
- Title: Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
- Title(参考訳): 聴覚・推論・セグメンテーション:メディアの章化のための編集判断によるLALMの調整
- Abstract要約: LALM(Large Audio Language Models)は、標準化されたベンチマークを急速に進歩させたが、実際的なメディア、キュレーション、アーカイブインデックス、コンテンツ配信への展開は、ほとんど実現されていない。
連続的な音声ストリームを主題的に一貫性のあるチャプタに分割するタスクである自動音声チャプタライゼーションを同定する。
このタスクのために、エンドツーエンドのLALMを調整するためのフレームワークであるAudioChapsを紹介します。
- 参考スコア(独自算出の注目度): 58.34381853842135
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Audio Language Models (LALMs) have made rapid progress on standardized benchmarks, yet their deployment in practical media workflows, curation, archival indexing, and content distribution remains largely unrealized. We identify automated audio chapterization, the task of segmenting continuous audio streams into thematically coherent chapters, as a demanding and commercially consequential setting that exposes this gap. Chapterization is challenging because boundaries are defined less by objective acoustic events than by subjective editorial judgment, requiring models to reason sequentially over long acoustic contexts and approximate creator-authored boundary decisions. We present AudioChaps, a post-training framework for aligning end-to-end LALMs for this task via Group Relative Policy Optimization (GRPO) guided by Chain-of-Thought (CoT) reasoning. To support training and evaluation, we curate three datasets: AudioChaps-Alignment, derived from creator-annotated chapter boundaries on YouTube; AudioChaps-CoT, which provides structured supervision for well-formatted, high-quality, and evidence-grounded boundary reasoning; and AudioChaps-Eval, a held-out benchmark for audio chapterization. Applying GRPO directly without a Supervised Fine-Tuning (SFT) cold start, AudioChaps-R1-Zero already improves average F1 by 33 points over the state-of-the-art LALM Audio-Flamingo-3-Think. The AudioChaps framework produces our final aligned LALM, AudioChaps-R1, which improves average F1 by 49 points. These results demonstrate that GRPO-trained LALMs can reliably transform unstructured auditory streams into navigable, structured media. Our code, models, and dataset resources will be released upon acceptance at https://github.com/ta012/AudioChaps.
- Abstract(参考訳): LALM(Large Audio Language Models)は、標準化されたベンチマークを急速に進歩させたが、実践的なメディアワークフロー、キュレーション、アーカイブインデックス、コンテンツ配信への展開は、ほとんど実現されていない。
連続的な音声ストリームを主題的に一貫性のあるチャプタに分割するタスクである自動音声チャプタ化を,このギャップを露呈する要求的かつ商業的なセッティングとして同定する。
なぜなら、境界は主観的な編集判断よりも客観的な音響事象によって定義され、長い音響的文脈とほぼ作者が承認した境界決定に対して連続的にモデルを必要とするからである。
我々は、Chain-of-Thought(CoT)推論によって導かれるグループ相対ポリシー最適化(GRPO)を介して、このタスクのためにエンドツーエンドのLALMを調整するための後トレーニングフレームワークであるAudioChapsを紹介する。
トレーニングと評価をサポートするために、YouTubeのクリエータが注釈付けした章境界から派生したAudioChaps-Alignment、十分に構造化された高品質でエビデンスに基づくバウンダリ推論のための構造化された監視を提供するAudioChaps-CoT、オーディオ章化のためのホールドアウトベンチマークAudioChaps-Evalの3つのデータセットをキュレートする。
GRPOをSFT(Supervised Fine-Tuning)コールドスタートなしで直接適用することで、AudioChaps-R1-Zeroは最先端のLALM Audio-Flamingo-3-Thinkよりも平均F1を33ポイント改善する。
AudioChapsフレームワークは、最終的なLALMであるAudioChaps-R1を生成し、平均F1を49ポイント改善します。
これらの結果から,GRPOを学習したLALMは,非構造的な聴覚ストリームをナビゲート可能な構造化メディアに確実に変換できることが示唆された。
私たちのコード、モデル、データセットリソースは、https://github.com/ta012/AudioChaps.comで受け入れられる。
関連論文リスト
- TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models [58.80225070159013]
大型オーディオ言語モデル(LALM)は、クリップレベルで音声を記述するが、イベント、スピーカー、音声にタイムスタンプを割り当てることはできない。
我々は、音声、音声、音楽のタイムスタンプタスクを処理する最初の統合モデルであるTEMPOを提案する。
論文 参考訳(メタデータ) (2026-08-30T19:49:21Z) - Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence [35.123477091633866]
LAMBは、オーディオ埋め込みとテキスト埋め込み空間の間のモダリティギャップを橋渡しするオーディオキャプションフレームワークである。
クロスモーダルアリグナーは、相互情報を最大化しながら、コーシー=シュワルツの発散を最小限にする。
セマンティックにリッチなオーディオ埋め込みを抽出するTwo-Stream Adapterは、よりリッチな情報をCross-Modal Alignerに提供する。
論文 参考訳(メタデータ) (2026-01-08T07:05:35Z) - SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models [18.802543558300044]
より強力なLVLM教師から弱いLALM学生に高度な推論を伝達するクロスモーダル蒸留フレームワークであるSightSound-R1を提案する。
その結果、SightSound-R1は、ドメイン内AVQAテストセットと見えない聴覚シーンと疑問の両方においてLALM推論性能を改善した。
論文 参考訳(メタデータ) (2025-09-19T06:39:39Z) - Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries [18.147981850263708]
マルチモーダルクエリによってガイドされるオープン語彙SEDのための問合せベースのフレームワークを提案する。
DASMはSEDをフレームレベルの検索タスクとして定式化し、音声機能はテキストやオーディオプロンプトからのクエリベクトルと一致している。
DASMは、局所化精度と新しいクラスへの一般化のバランスを効果的に保ち、オープン語彙設定においてCLAPベースの手法より優れている。
論文 参考訳(メタデータ) (2025-07-22T08:24:01Z) - PAL: Probing Audio Encoders via LLMs - Audio Information Transfer into LLMs [29.049167884343998]
大規模言語モデル(LLM)への音声認識の統合は、機械聴取アプリケーションを実現するための新たな研究分野である。
軽量オーディオLLM統合(LAL)の効率的な代替案を提案する。
LALは、LLMの異なるブロックに統合するために、リッチな音声セマンティクスを適切な抽象化レベルでエンコードする。
論文 参考訳(メタデータ) (2025-06-12T07:23:07Z) - From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data [55.2480439325792]
音声対応の大規模言語モデル(ALLM)は近年,音声入力の理解と処理において大きな進歩を遂げている。
これらのモデルは典型的にはテキストベースの大規模言語モデル(LLM)に適応し、音声関連タスクのさらなるトレーニングを行う。
本研究では、現在と欠落した音を区別するALLMの能力を高めるために、コントラッシブな訓練データを生成するデータ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:08:41Z) - CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment [76.32508013503653]
CAV-MAE Sync は,自己教師型音声視覚学習のためのオリジナルの CAV-MAE フレームワークの簡易かつ効果的な拡張として提案する。
音声をグローバルな表現ではなく,映像フレームに整合した時間的シーケンスとして扱うことで,モダリティ間のミスマッチに対処する。
パッチトークンのセマンティック負荷を低減するための学習可能なレジスタトークンを導入することにより,空間的ローカライゼーションを改善する。
論文 参考訳(メタデータ) (2025-05-02T12:59:58Z) - C3LLM: Conditional Multimodal Content Generation Using Large Language Models [66.11184017840688]
C3LLMは,ビデオ・トゥ・オーディオ,音声・テキスト,テキスト・トゥ・オーディオの3つのタスクを組み合わせた新しいフレームワークである。
C3LLMはLarge Language Model (LLM) 構造を異なるモダリティを整列するためのブリッジとして適合させる。
本手法は,従来の音声理解,ビデオ音声生成,テキスト音声生成のタスクを1つの統一モデルに統合する。
論文 参考訳(メタデータ) (2024-05-25T09:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。