論文の概要: RefCaptioner: Multi-Reference Image-Grounded Video Captioning
- arxiv url: http://arxiv.org/abs/2607.28509v1
- Date: Thu, 30 Jul 2026 16:48:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.679626
- Title: RefCaptioner: Multi-Reference Image-Grounded Video Captioning
- Title(参考訳): RefCaptioner:マルチレファレンス画像付きビデオキャプション
- Abstract要約: 語句レベルの参照グラウンド化を伴う実写映像記述を必要とする新しいタスクである,マルチ参照画像グラウンドドビデオキャプションを導入する。
このタスクのための2段階のポストトレーニングフレームワークであるRefCaptionerを提案する。
トレーニングを支援するために,2万ドルのビデオと171,354枚の参照画像を含むコーパスを構築した。
- 参考スコア(独自算出の注目度): 28.6759562327919
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing video captioning models generate natural descriptions of video content but cannot explicitly ground local visual elements to multiple reference images. We introduce multi-reference image-grounded video captioning, a new task requiring factual video descriptions with phrase-level reference grounding, and propose RefCaptioner, a two-stage post-training framework for this task. RefCaptioner combines mixed-data SFT with Hierarchical Coverage-Discounted GRPO to jointly improve reference selection, phrase-level binding, distractor rejection, and cross-reference consistency while preserving general video-captioning ability. To support training, we construct a corpus containing $20,000$ videos and 171,354 reference images. We further introduce MRVBench, a benchmark for evaluating caption factuality and multi-reference grounding on both real-world and AI-generated videos. Experiments show that RefCaptioner achieves the best overall performance among the open-source models while remaining competitive on standard video captioning benchmarks. Human evaluation further confirms that its captions are preferred by annotators and enable more source-faithful video reconstruction with both open-source and proprietary video generators.
- Abstract(参考訳): 既存のビデオキャプションモデルでは、ビデオコンテンツの自然な記述を生成するが、局所的な視覚要素を複数の参照画像に明示的にグラウンドすることはできない。
本稿では,複数参照画像のキャプション,フレーズレベルの参照グラウンドディングによる実写映像記述を必要とする新しいタスクを導入し,このタスクのための2段階のポストトレーニングフレームワークであるRefCaptionerを提案する。
RefCaptionerは、混合データSFTと階層被覆分散GRPOを組み合わせることで、一般的なビデオキャプション能力を保ちながら、参照選択、フレーズレベルのバインディング、イントラクタ拒否、相互参照一貫性を共同で改善する。
トレーニングを支援するために,2万ドルのビデオと171,354枚の参照画像を含むコーパスを構築した。
MRVBenchは実世界のビデオとAI生成ビデオの両方に基づいて、キャプションの事実性を評価するためのベンチマークである。
実験によると、RefCaptionerは、標準のビデオキャプションベンチマークで競争力を維持しながら、オープンソースモデルの中で最高の全体的なパフォーマンスを達成する。
人間の評価はさらに、そのキャプションがアノテーションによって好まれていることを確認し、オープンソースのビデオジェネレータとプロプライエタリなビデオジェネレータの両方で、よりソースに忠実なビデオ再構成を可能にする。
関連論文リスト
- CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning [86.9494763617273]
本稿では,Captioning Reinforcement Learning++ (CapRL++)を紹介した。
本稿では,CapRL++が高密度キャプション品質を向上し,空間的・時間的理解などのタスクにおけるキャプションベースの事前訓練を強化していることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:09:20Z) - Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization [30.445325065182868]
補助キャプションは、しばしばビデオ理解を強化するために使われ、モダリティ間のギャップを埋める。
本稿では,検索関連スコアを用いた字幕生成を直接最適化する検索フレームワークである$textbfCaRe-DPOを提案する。
本研究では,CaRe-DPOが補助知識を効果的に活用して検索のためのきめ細かいキャプションを生成することにより,検索性能を著しく向上することを示す。
論文 参考訳(メタデータ) (2025-09-20T07:36:53Z) - CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval [24.203328970223527]
本稿では,詳細な動画キャプションと検索のためのベンチマークであるCaReBenchを紹介する。
同様に、ビデオごとに手動で分離された空間アノテーションと時間アノテーションを提供する。
この設計に基づいて、ビデオ検索とビデオキャプションタスクに特化して、ReBiasとCapSTという2つの評価指標を導入する。
論文 参考訳(メタデータ) (2024-12-31T15:53:50Z) - AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark [89.73538448786405]
大規模なマルチモーダルモデルに基づくビデオキャプタであるAuroraCapを提案する。
トークンマージ戦略を実装し、入力されたビジュアルトークンの数を減らす。
AuroraCapは、様々なビデオおよび画像キャプションベンチマークで優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-10-04T00:13:54Z) - Learning text-to-video retrieval from image captioning [59.81537951811595]
本稿では,未収録ビデオを用いたテキスト・ビデオ検索訓練のプロトコルについて述べる。
i) ビデオのラベルにアクセスできず、(ii) テキスト形式でラベル付き画像にアクセスすると仮定する。
画像キャプションによるビデオフレームの自動ラベル付けにより,テキスト対ビデオ検索のトレーニングが可能になることを示す。
論文 参考訳(メタデータ) (2024-04-26T15:56:08Z) - HierVL: Learning Hierarchical Video-Language Embeddings [108.77600799637172]
HierVLは階層的なビデオ言語埋め込みであり、長期および短期の関連を同時に扱う。
クリップレベルとビデオレベルの両方でテキストと視覚のアライメントを促進する階層的なコントラストトレーニングの目標を導入する。
我々の階層的スキームは、SotAを達成した長期的なビデオ表現と同様に、その単一レベルよりも優れたクリップ表現をもたらす。
論文 参考訳(メタデータ) (2023-01-05T21:53:19Z) - Fine-grained Image Captioning with CLIP Reward [104.71533106301598]
ウェブから大量の画像テキストペアをトレーニングしたマルチモーダルエンコーダであるCLIPを用いて、マルチモーダル類似性を計算し、報酬関数として利用する。
また、追加のテキストアノテーションを必要としない文法を改善するために、CLIPテキストエンコーダの簡単な微調整戦略を提案する。
テキスト・ツー・イメージ検索とFineCapEvalの実験において、提案したCLIP誘導モデルは、CIDEr最適化モデルよりも顕著なキャプションを生成する。
論文 参考訳(メタデータ) (2022-05-26T02:46:09Z) - End-to-end Generative Pretraining for Multimodal Video Captioning [82.79187814057313]
本稿では,未学習ビデオから学習するための新しい事前学習フレームワークであるMV-GPTを提案する。
最近のビデオ言語事前学習フレームワークとは異なり、我々のフレームワークはマルチモーダルビデオエンコーダと文デコーダを共同で訓練する。
本モデルは,4つの標準ベンチマークによるマルチモーダルビデオキャプションの最先端性能を実現する。
論文 参考訳(メタデータ) (2022-01-20T16:16:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。