論文の概要: AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward
- arxiv url: http://arxiv.org/abs/2608.06930v1
- Date: Fri, 07 Aug 2026 08:03:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.40765
- Title: AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward
- Title(参考訳): AVCap:ディテール・アウェア・リワードでオーディオとビデオのジョイント・キャプションを強化
- Abstract要約: AVCap-100Kは、時間的に整列された、詳細に富んだオーディオビデオキャプションの高品質なデータセットである。
AVCap-Scoreは、音響視覚キャプションにおける原子レベルの詳細を評価するための特別なベンチマークとメトリクスである。
- 参考スコア(独自算出の注目度): 22.045270667618933
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Detailed audio-video joint captioning is essential for multimodal video understanding and generation. However, prior works are constrained by three main limitations: (1) the scarcity of high-quality public datasets with fine-grained audio-visual joint captions; (2) reinforcement-learning methods that rely on coarse reward signals; and (3) the lack of a benchmark and metric for evaluating detailed audiovisual captions at the atomic level. To address these challenges, we propose: (1) AVCap-100K, a high-quality dataset of 100K temporally aligned, detail-rich audio-video captions; (2) AVCap, a model optimized via Detail-Aware GRPO (Da-GRPO) that achieves state-of-the-art performance among open-source models and matches or surpasses proprietary models on several evaluations; and (3) AVCap-Bench and AVCap-Score, a specialized benchmark and metric for evaluating atomic-level details in audiovisual captions. Our code, models, and datasets are available at https://huggingface.co/collections/Apryle/avcap.
- Abstract(参考訳): マルチモーダル映像の理解と生成には,詳細な音声・ビデオ共同キャプションが不可欠である。
しかし, 先行研究は, 1) 微粒な音声・視覚共同キャプションを持つ高品質な公開データセットの不足, (2) 粗い報酬信号に依存する強化学習方法, (3) 原子レベルでの詳細なオーディオ・ヴィジュアル・キャプションを評価するためのベンチマークとメトリクスの欠如, の3つの制約によって制約されている。
これらの課題に対処するため,(1)100Kの高品質データセットであるAVCap-100K,(2)Detail-Aware GRPO (Da-GRPO) によって最適化されたモデルであるAVCap-100K,(3)AVCap-BenchとAVCap-Score,(3)オーディオビジュアルキャプションの原子レベル詳細を評価するための特別なベンチマークとメトリクスであるAVCap-100Kを提案する。
私たちのコード、モデル、データセットはhttps://huggingface.co/collections/Apryle/avcap.orgから入手可能です。
関連論文リスト
- AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech [56.08149157180447]
本稿では,大規模マルチモーダルモデルの音声キャプション機能を評価するベンチマークであるAudioCapBenchを紹介する。
我々は、参照ベースのメトリクス(METEOR、BLEU、ROUGE-L)とLLM-as-Judgeフレームワークを使用して、2つのプロバイダ(OpenAI、Google Gemini)にわたる13のモデルを評価する。
論文 参考訳(メタデータ) (2026-02-27T03:33:37Z) - Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions [74.27249614046309]
ASID-1Mは100万の構造化された微細なオーディオ視覚的指示アノテーションのオープンソースコレクションである。
ASID-Verifyは、アノテーションのためのスケーラブルなデータキュレーションパイプラインである。
ASID-CaptionerはSupervised Fine-Tuningを通じてトレーニングされたビデオ理解モデルである。
論文 参考訳(メタデータ) (2026-02-13T15:20:54Z) - AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration [41.31057204656161]
AVoCaDOは、音声と視覚の時間的オーケストレーションによって駆動される強力な映像キャプタである。
実験の結果,AVoCaDOは4つの音声映像キャプションベンチマークにおいて,既存のオープンソースモデルよりも有意に優れていた。
論文 参考訳(メタデータ) (2025-10-12T01:20:22Z) - UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks [13.205921806688147]
現実世界のユーザー生成ビデオ、特にTikTokのようなプラットフォームでは、リッチでインターツウィンドなオーディオビジュアルコンテンツがしばしば表示される。
既存のビデオキャプションベンチマークとモデルは、シーンダイナミクス、話者意図、物語コンテキストを伝達する際のオーディオの重要な役割を見越して、主に視覚中心のままである。
これらの課題に対処するために,ショートフォームのユーザ生成ビデオの完全なキャプションに特化して設計された,新しいベンチマークおよびモデルフレームワークである-VideoCapを紹介した。
論文 参考訳(メタデータ) (2025-07-15T14:08:29Z) - Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model [16.22530358172138]
このフレームワークは、整列したトレーニングデータセグメントを選択するためのスコアリング機構を実装している。
音声ベースの基礎モデルであるWhisperと、デュアルエンコーダ構造におけるビデオ解析のためのDINOv2を統合している。
AudioCaps、VALOR、VGGSoundの評価は、提案したモデルアーキテクチャの有効性を示す。
論文 参考訳(メタデータ) (2025-03-12T09:48:38Z) - Taming Data and Transformers for Audio Generation [31.815960560115176]
AutoReCap-XLは、4700万回以上のクリップを持つ、最大の環境オーディオテキストデータセットである。
AutoCapは高品質のオーディオキャプションモデルである。
GenAuはスケーラブルなトランスフォーマーベースのオーディオ生成アーキテクチャである。
論文 参考訳(メタデータ) (2024-06-27T17:58:54Z) - AV-data2vec: Self-supervised Learning of Audio-Visual Speech
Representations with Contextualized Target Representations [88.30635799280923]
AV-data2vecを導入し、文脈化表現の予測に基づいて音声・視覚表現を構築する。
LRS3の結果は、AV-data2vecが、同じ量のデータとモデルサイズで既存のメソッドを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2023-02-10T02:55:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。