論文の概要: Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning
- arxiv url: http://arxiv.org/abs/2607.01667v1
- Date: Thu, 02 Jul 2026 03:47:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.654753
- Title: Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning
- Title(参考訳): 視聴覚映像の時間的・横断的なアライメント
- Authors: Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai,
- Abstract要約: TCA-Captionerは、音声映像キャプションのためのテンポラルアライメントとクロスモーダルアライメントを強化するために特別に設計されたフレームワークである。
キュレートされた高密度のヒューマンインタラクションデータセットを活用して、TCA-Captionerは洗練されたオーディオ視覚インタラクションをモデル化するように最適化されている。
広汎な実験により、TCA-Captionerは時間的コヒーレントで同期化されたオーディオ視覚的物語の新しい標準を定めている。
- 参考スコア(独自算出の注目度): 46.57717326362359
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Multimodal Large Language Models (MLLMs) have advanced video understanding, achieving precise temporal and cross-modal alignment in audiovisual video captioning remains a formidable challenge. Most existing approaches suffer from modality detachment and temporal incoherence, failing to accurately bind auditory events to visual entities or capture complex causal dynamics. To address these deficiencies, we propose TCA-Captioner, a framework specifically engineered to enhance Temporal and Cross-Modal Alignment for audiovisual video captioning. We first introduce the Observer-Checker-Corrector (OCC) framework, an iterative refinement strategy that generates high-fidelity, meticulously grounded training data. Leveraging a curated high-density human interaction dataset, TCA-Captioner is optimized to model sophisticated audiovisual interactions. Furthermore, we present TCA-Bench, a diagnostic benchmark utilizing a Decoupled Evaluation Protocol to isolate and quantify model proficiency in audiovisual binding and temporal relational reasoning. Extensive experiments demonstrate that TCA-Captioner sets a new standard for temporally-coherent and synchronized audiovisual narratives.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)はビデオ理解の高度化を図っているが,映像キャプションの正確な時間的・横断的なアライメントを実現することは,依然として困難な課題である。
既存のアプローチの多くは、モーダリティの分離と時間的不整合に悩まされており、聴覚イベントを視覚的実体に正確に結合したり、複雑な因果ダイナミクスを捉えることに失敗した。
音声映像キャプションのためのテンポラルアライメントとクロスモーダルアライメントを強化するためのフレームワークであるTCA-Captionerを提案する。
我々はまず,高忠実かつ厳密なトレーニングデータを生成する反復的洗練戦略であるObserver-Checker-Corrector (OCC) フレームワークを紹介する。
キュレートされた高密度のヒューマンインタラクションデータセットを活用して、TCA-Captionerは洗練されたオーディオ視覚インタラクションをモデル化するように最適化されている。
さらに,Decoupled Evaluation Protocol を利用した診断ベンチマーク TCA-Bench を用いて,聴覚的結合および時間的関係推論におけるモデル習熟度を抽出・定量化する。
広汎な実験により、TCA-Captionerは時間的コヒーレントで同期化されたオーディオ視覚的物語の新しい標準を定めている。
関連論文リスト
- Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models [22.554751069064906]
最近のビデオ大言語モデル(ビデオ-LLM)は、ビデオ理解において強力な能力を示しているが、幻覚に悩まされている。
モデルが時間的に不均衡な濃度パターンを示すデコーダ側現象について検討する。
そこで本稿では,Decoder-side Temporal Rebalancing (DTR)を提案する。
論文 参考訳(メタデータ) (2026-04-14T11:05:42Z) - GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining [64.72014392166625]
GMS-CAVPは、マルチスケールビデオ・オーディオアライメントとマルチスケール空間時間拡散に基づく事前学習目的を組み合わせた、新しいフレームワークである。
まず、GMS-CAVPは、様々な粒度にわたる意味的および時間的関係をキャプチャするマルチスケールのコントラスト学習戦略を導入する。
第2に、拡散に基づく生成目的を組み込むことにより、従来のコントラスト学習を超越し、ビデオとオーディオ間のモダリティ変換と合成を可能にする。
論文 参考訳(メタデータ) (2026-01-27T13:43:32Z) - TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph [28.536724593429398]
TEn-CATGは、セマンティックキャリブレーションとカテゴリー対応の時間的推論を組み合わせたテキスト強化AVVPフレームワークである。
弱教師付きAVVPタスクにおいて,TEn-CATGは複雑な時間的および意味的依存関係を捕捉する堅牢性と優れた能力を実現する。
論文 参考訳(メタデータ) (2025-09-04T10:32:40Z) - Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation [62.218932509432314]
従来,隣接する音声クリップの時間的関係は,対応する映像フレームの時間的関係と強く相関している。
音声と視覚の相関関係を学習し,その相関関係を統合し,特徴表現の強化と最終生成の正規化を支援する。
論文 参考訳(メタデータ) (2025-04-08T07:23:28Z) - AVadCLIP: Audio-Visual Collaboration for Robust Video Anomaly Detection [57.649223695021114]
本稿では,ロバストなビデオ異常検出に音声と視覚の協調を利用する,弱教師付きフレームワークを提案する。
本フレームワークは,複数のベンチマークにおいて優れた性能を示し,オーディオ統合により異常検出精度が大幅に向上する。
論文 参考訳(メタデータ) (2025-04-06T13:59:16Z) - With a Little Help from my Temporal Context: Multimodal Egocentric
Action Recognition [95.99542238790038]
認識性能を向上させるため,周辺行動への参加を学習する手法を提案する。
時間的文脈を組み込むために,ビデオや音声を入力モダリティとして取り込み,変換器をベースとしたマルチモーダルモデルを提案する。
我々は,EPIC-KITCHENSとEGTEAデータセットを用いて,最先端の性能を報告する。
論文 参考訳(メタデータ) (2021-11-01T15:27:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。