論文の概要: AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning
- arxiv url: http://arxiv.org/abs/2607.12820v1
- Date: Tue, 14 Jul 2026 14:34:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.171429
- Title: AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning
- Title(参考訳): AVSCap:Omni-Modal Video Captioningのためのオーディオ・ビジュアル・シナジーのオーケストレーション
- Abstract要約: 本稿では,明示的なクロスモーダルイベントバインディングを中心とした音声・視覚キャプションのためのフレームワークであるAVSCapを紹介する。
まず, 3モーダルトレーニングコーパスであるAVSCap-130Kを構築し, グラウンドドオムニモーダルキャプションを構成する前に, 視覚的, 音響的証拠をアンロックする。
次に、2段階戦略を持つ7BキャプタであるAVSCap-7Bをトレーニングする。
第3に、字幕を視覚、音声、シナジーイベントに分解し、きめ細かいイベントリコールで評価するベンチマークであるAVSCapBenchを紹介する。
- 参考スコア(独自算出の注目度): 45.239264840517585
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Omni-modal video captioning is not merely combining visual captioning with audio transcription: a useful caption must describe how visual actions, speech, music, and sound effects co-evolve. Existing large multimodal models often fail at this relational step, treating audio and visual streams as loosely coupled observations, relying on automatic speech recognition, and under-specifying non-speech sounds and their links to visual events. We present AVSCap, a framework for audio-visual captioning centered on explicit cross-modal event binding. First, we construct AVSCap-130K, a tri-modal training corpus generated by a decoupled-then-fused pipeline that anchors visual and acoustic evidence before composing grounded omni-modal captions. Second, we train AVSCap-7B, a 7B captioner with a two-stage strategy: supervised fine-tuning establishes baseline capabilities, while sample-efficient reinforcement learning uses hybrid rewards to optimize acoustic completeness and audio-visual synergy. Our scaling analysis shows that reinforcement learning brings larger gains than increasing SFT data. Third, we introduce AVSCapBench, a benchmark that decomposes captions into visual, audio, and synergy events and evaluates them with fine-grained event recall. Experiments on AVSCapBench and external benchmarks show that AVSCap-7B improves non-speech audio coverage and cross-modal binding, delivering the best overall performance among evaluated open-source models.
- Abstract(参考訳): オムニモーダルなビデオキャプションは、単に視覚的なキャプションと音声の書き起こしを組み合わせているだけではない。
既存の大規模なマルチモーダルモデルは、しばしばこのリレーショナルステップで失敗し、オーディオと視覚ストリームを疎結合な観測として扱い、自動音声認識に頼り、非音声音とその視覚イベントへのリンクを規定しない。
本稿では,明示的なクロスモーダルイベントバインディングを中心とした音声・視覚キャプションのためのフレームワークであるAVSCapを紹介する。
まず,AVSCap-130Kを構築した。AVSCap-130Kは,接地したOmni-modalキャプションを構成する前に,視覚的および音響的証拠をアンロックする分離したパイプラインによって生成された3モーダルトレーニングコーパスである。
次に,2段階戦略を持つ7BキャプタであるAVSCap-7Bを訓練する: 教師付き微調整はベースライン能力を確立するが,サンプル効率の強化学習は,音響完全性とオーディオ視覚の相乗効果を最適化するためにハイブリッド報酬を使用する。
我々のスケーリング分析は、強化学習がSFTデータの増加よりも大きなゲインをもたらすことを示している。
第3に,字幕を視覚,音声,シナジーイベントに分解し,微細なイベントリコールで評価するベンチマークであるAVSCapBenchを紹介する。
AVSCapBenchと外部ベンチマークの実験は、AVSCap-7Bが非音声オーディオカバレッジとクロスモーダルバインディングを改善し、評価されたオープンソースモデルの中で最高の全体的なパフォーマンスを提供することを示している。
関連論文リスト
- Listening without Looking: Modality Bias in Audio-Visual Captioning [26.155364752676167]
我々は,現在最先端の音声映像キャプションモデルであるLAVCapのモダリティテストを実施している。
この分析は、LAVCapのオーディオストリームに対する顕著なバイアスを明らかにする。
オーディオとビジュアルストリームを共同で記述するテキストアノテーションでAudioCapsを拡張する。
その結果、AudioVisualCapsでトレーニングされたLAVCapは、AudioCapsでトレーニングされた場合よりもモダリティバイアスが少ないことが示唆された。
論文 参考訳(メタデータ) (2025-10-28T03:06:28Z) - LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport [16.108957027494604]
LAVCapは大型言語モデル(LLM)ベースの音声視覚キャプションフレームワークである。
視覚情報とオーディオを統合し、音声キャプション性能を向上させる。
既存のAudioCapsデータセットの最先端メソッドよりも優れています。
論文 参考訳(メタデータ) (2025-01-16T04:53:29Z) - From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation [17.95017332858846]
本稿では,視覚表現学習と視覚音声生成のギャップを埋める新しいフレームワークであるVision to Audio and Beyond(VAB)を紹介する。
VABは、事前訓練されたオーディオトークンライザと画像エンコーダを使用して、それぞれ音声トークンと視覚的特徴を取得する。
実験では,ビデオから高品質な音声を生成するためのVABの効率と,セマンティック・オーディオ・視覚的特徴を習得する能力について紹介した。
論文 参考訳(メタデータ) (2024-09-27T20:26:34Z) - AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning [24.608569008975497]
AVCap(Audio-Visual Captioning framework)を提案する。
AVCapは音声視覚機能をテキストトークンとして利用する。
提案手法は,既存の音声・視覚のキャプション手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2024-07-10T16:17:49Z) - Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues [75.73217916395386]
双方向ブリッジを用いた双方向オーディオ・ビジュアルデコーダ(BAVD)を提案する。
この相互作用はモダリティの不均衡を狭め、統合されたオーディオ視覚表現のより効果的な学習を促進する。
また,BAVDの微粒化誘導として,音声・視覚的フレームワイド同期のための戦略を提案する。
論文 参考訳(メタデータ) (2024-02-04T03:02:35Z) - Exploring the Role of Audio in Video Captioning [59.679122191706426]
本稿では,キャプションの音響モダリティの可能性をフル活用することを目的とした音声視覚フレームワークを提案する。
本稿では,音声とビデオ間の情報交換を改善するため,新たなローカル・グローバル融合機構を提案する。
論文 参考訳(メタデータ) (2023-06-21T20:54:52Z) - WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research [82.42802570171096]
約400kの音声クリップとペアキャプションを組み合わせた,大規模な音声キャプションデータセットであるWavCapsを紹介した。
オンラインハーベストな生の記述は非常にうるさいし、自動音声キャプションなどのタスクで直接使うには適さない。
本稿では,大規模な言語モデルであるChatGPTを用いて,ノイズの多いデータをフィルタリングし,高品質なキャプションを生成するための3段階処理パイプラインを提案する。
論文 参考訳(メタデータ) (2023-03-30T14:07:47Z) - Visually-Aware Audio Captioning With Adaptive Audio-Visual Attention [54.4258176885084]
曖昧な音を正確に認識する方法は、音声キャプションにとって大きな課題である。
本稿では,視覚情報を利用して不明瞭な音の物体の記述を支援する視覚認識型音声キャプションを提案する。
提案手法は,機械翻訳メトリクスの最先端結果を実現する。
論文 参考訳(メタデータ) (2022-10-28T22:45:41Z) - Learning Speech Representations from Raw Audio by Joint Audiovisual
Self-Supervision [63.564385139097624]
生音声波形から自己教師付き音声表現を学習する手法を提案する。
音声のみの自己スーパービジョン(情報的音響属性の予測)と視覚的自己スーパービジョン(音声から発話顔を生成する)を組み合わせることで生音声エンコーダを訓練する。
本研究は,音声表現学習におけるマルチモーダル・セルフ・スーパービジョンの可能性を示すものである。
論文 参考訳(メタデータ) (2020-07-08T14:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。