論文の概要: Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception
- arxiv url: http://arxiv.org/abs/2609.15215v1
- Date: Mon, 14 Sep 2026 08:35:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.190385
- Title: Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception
- Title(参考訳): ファイングラインド時間知覚のためのフレームレベルグラウンドディングによる大規模オーディオ言語モデルの拡張
- Abstract要約: LALM(Large Audio-Language Models)は、かなり高度な一般的な音声理解を持つが、微粒な時間知覚では限定的である。
イベントクエリを表現するためのセマンティックモデリング機能を活用しながら、専用のフレームレベルグラウンドモデルでLALMを拡張する。
多様な時間的グラウンドベンチマークによる実験は、既存の方法よりも強力で一貫した改善を示している。
- 参考スコア(独自算出の注目度): 26.919697203335343
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Audio-Language Models (LALMs) have substantially advanced general audio understanding, yet they remain limited in fine-grained temporal perception, particularly in precise event localization. Existing approaches primarily post-train LALMs to predict event boundaries as timestamp tokens. However, this generative formulation lacks explicit correspondence between the timestamp predictions and fine-grained acoustic evidence, limiting the precision and reliability of temporal localization. To address this issue, we augment the LALM with a dedicated frame-level grounding model while leveraging its semantic modeling capability to represent the event query. Specifically, the frozen LALM encodes the event query with audio as context, and the grounding model combines these query representations with fine-grained audio features to localize the target event at the frame level. Extensive experiments across diverse temporal grounding benchmarks demonstrate strong and consistent improvements over existing methods. Further evaluation shows that the grounding model can provide temporal evidence to support downstream reasoning.
- Abstract(参考訳): LALM(Large Audio-Language Models)は、かなり高度な一般的な音声理解を持つが、微粒な時間的知覚、特に正確な事象の局所化に限られる。
既存のアプローチは主に、イベント境界をタイムスタンプトークンとして予測するための訓練後のLALMである。
しかし、この生成的定式化は、タイムスタンプ予測ときめ細かい音響的証拠との明確な対応を欠き、時間的局所化の精度と信頼性を制限している。
この問題に対処するために、イベントクエリを表現するセマンティックモデリング機能を活用しながら、LALMを専用のフレームレベルグラウンドモデルで拡張する。
具体的には、凍結したLALMは、イベントクエリをコンテキストとしてオーディオにエンコードし、グラウンド化モデルは、これらのクエリ表現ときめ細かいオーディオ特徴を組み合わせて、ターゲットイベントをフレームレベルでローカライズする。
多様な時間的グラウンドベンチマークに対する大規模な実験は、既存の方法よりも強力で一貫した改善を示している。
さらなる評価により、下流の推論を支援するための時間的証拠をグラウンドモデルが提供できることが示されている。
関連論文リスト
- Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding [36.43390300751778]
本稿では,自動データ構築とモデル微調整によるオープンボキャブラリオンセット/オフセット管理を構築する,スケーラブルなパイプラインであるAutoAEGを紹介する。
その結果,自動構築したデータと区間認識型報酬関数の設計は,LALMの時間的局所化能力を拡張するための有効なデータ側経路であることが示唆された。
論文 参考訳(メタデータ) (2026-07-05T16:22:14Z) - Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt [26.402383197553778]
本稿では,時空間知覚の微粒化のためのTimePro-RLフレームワークを開発するために,音声側時間プロンプトを提案し,強化学習を活用する。
具体的には、タイムスタンプを埋め込みとしてエンコードし、時間座標として音声特徴系列にインターリーブし、モデルを刺激する。
実験により、TimePro-RLは、オーディオグラウンド、音声イベント検出、高密度オーディオキャプションなど、様々な時間的タスクにおいて、大きなパフォーマンス向上を達成することが示された。
論文 参考訳(メタデータ) (2026-04-15T10:50:29Z) - In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions [51.236148875603185]
我々は既存の音声認識言語モデルを拡張して、文字起こしと直接タイムスタンプを予測する。
認識品質を維持しつつアライメントの堅牢性を向上する,新しい軽量なトレーニング戦略を導入する。
論文 参考訳(メタデータ) (2026-04-14T20:56:24Z) - LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio [6.935416517354558]
LongAudio Generation (LARAG) は、Large Language Model (LLM) が取得した、タイムスタンプ付き音響イベント検出において出力する基盤となるフレームワークである。
ハイブリッドエッジクラウド環境にデプロイすることで,このアプローチの実践性を実証する。
イベントレベルの構造的検索は,バニラ検索よりも精度が向上することが示された。
論文 参考訳(メタデータ) (2026-02-16T10:15:22Z) - Frame-Level Internal Tool Use for Temporal Grounding in Audio LMs [48.50855715191533]
大規模な音声言語モデルは、複雑な音声理解タスクにますます使われている。
彼らは、単語アライメントや話者ダイアリゼーションのような正確な時間的根拠を必要とする時間的タスクに苦労する。
本稿では,フレームレベルの内部ツール使用法を提案する。これは,内部の音声表現を用いて時間的グラウンドを直接行うように音声LMを訓練する手法である。
論文 参考訳(メタデータ) (2026-02-10T19:19:52Z) - Not in Sync: Unveiling Temporal Bias in Audio Chat Models [59.146710538620816]
大規模音声言語モデル(LALM)は、音声理解やマルチモーダル推論にますます応用されている。
LALMにおける時間バイアスに関する最初の体系的研究を行い,その時間スタンプ予測における重要な限界を明らかにした。
論文 参考訳(メタデータ) (2025-10-14T06:29:40Z) - TimeRefine: Temporal Grounding with Time Refining Video LLM [75.99665302872901]
ビデオの時間的接地は、テキストのプロンプトが与えられたビデオの中で、関連する時間的境界をローカライズすることを目的としている。
我々は時間的接地タスクを時間的精錬タスクとして再構成する。
我々は、予測セグメントが基底真理からさらに逸脱した場合、モデルをよりペナルティ化する補助予測ヘッドを組み込む。
論文 参考訳(メタデータ) (2024-12-12T18:59:11Z) - Leveraging Language Model Capabilities for Sound Event Detection [10.792576135806623]
本稿では,音声イベントとその時間的位置を同時に生成しながら,音声特徴を理解するためのエンドツーエンドフレームワークを提案する。
具体的には、事前学習された音響モデルを用いて、異なるカテゴリーにわたる識別的特徴を捉え、自動回帰テキスト生成のための言語モデルを用いる。
論文 参考訳(メタデータ) (2023-08-22T15:59:06Z) - DiffSED: Sound Event Detection with Denoising Diffusion [70.18051526555512]
生成学習の観点からSED問題を再構築する。
具体的には,騒音拡散過程において,雑音のある提案から音の時間境界を生成することを目的としている。
トレーニング中は,ノイズの多い遅延クエリを基本バージョンに変換することで,ノイズ発生過程の逆転を学習する。
論文 参考訳(メタデータ) (2023-08-14T17:29:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。