論文の概要: CAPEval: A Decoupled Caption Evaluation across Understanding and Generation
- arxiv url: http://arxiv.org/abs/2608.02589v1
- Date: Mon, 03 Aug 2026 17:57:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.749434
- Title: CAPEval: A Decoupled Caption Evaluation across Understanding and Generation
- Title(参考訳): CAPEval: 理解と生成をまたいだ分離されたキャプション評価
- Abstract要約: そこで我々は,人間による接頭辞文と人間による検証済みの原子チェックリスト項目を用いた,分離された字幕評価ベンチマークCAPEvalを設計した。
カバレッジは、パフォーマンスを理解するための強い相関関係として機能し、Precisionは、生成パフォーマンスの主要な予測器として機能します。
- 参考スコア(独自算出の注目度): 29.355541032573285
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Captions serve as a primary supervision signal for both multimodal understanding and text-to-image generation. However, previous evaluations treat the caption quality as a single scalar objective, which conflates two distinct properties: (1) how much visual information a caption covers and (2) how reliably the image supports its stated claims. To this end, we design a decoupled caption evaluation benchmark, CAPEval (Coverage And Precision Evaluation), with human-written ground-truth captions and human-verified atomic checklist items. Specifically, CAPEval decomposes caption quality into Coverage and Precision. The former quantifies how thoroughly a caption covers ground-truth factual content, while the latter reflects the factual correctness rate of all claims expressed in the caption. We select 10 captioners and further conduct controlled downstream end-to-end experiments with them from four model families, where the caption source is the only variable. Empirically, we find a consistent task-dependent dissociation: Coverage serves as the stronger correlate for understanding performance, whereas Precision acts as the dominant predictor for generation performance. This decoupled evaluation paradigm not only delivers a more fine-grained diagnosis of caption quality, but also offers actionable guidance for selecting and optimizing captioners tailored to different downstream tasks.
- Abstract(参考訳): キャプションはマルチモーダル理解とテキスト・ツー・イメージ生成の両方のための主要な監視信号として機能する。
しかし,従来の評価ではキャプションの品質は,(1)キャプションがカバーする視覚情報量,(2)画像が主張するクレームを確実に支持する程度という2つの特徴を混在させる単一スカラー目標として扱われていた。
この目的のために、我々は、人間記述の接頭辞と人間検証された原子チェックリスト項目を備えた、分離されたキャプション評価ベンチマークCAPEval(Coverage and Precision Evaluation)を設計した。
具体的には、CAPEvalはキャプションの品質をカバレッジと精度に分解する。
前者は、キャプションが根本的事実内容を完全にカバーしているかを定量化し、後者は、キャプションで表現されたすべてのクレームの事実的正しさ率を反映する。
キャプションソースが唯一の変数である4つのモデルファミリーから10個のキャプションを選択、さらに制御された下流のエンド・ツー・エンドの実験を行う。
カバレッジはパフォーマンスを理解するための強い相関関係として機能し、Precisionはジェネレーションパフォーマンスの主要な予測器として機能します。
この分離された評価パラダイムは、キャプション品質のよりきめ細かい診断を提供するだけでなく、異なる下流タスクに適したキャプションを選択、最適化するための実用的なガイダンスを提供する。
関連論文リスト
- Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering [18.82625951944924]
CapQuizは、人間によって検証され、きめ細かな複数の質問に答えるときに、その有用性に基づいてキャプションを評価する、新しい参照不要のベンチマークである。
CapQuizは既存の指標よりも人間の判断と非常によく相関しており、モデル性能に関する解釈可能な洞察を提供する。
論文 参考訳(メタデータ) (2026-09-09T10:00:43Z) - Controllable Image Captioning with Prompt-Conditioned Scene Rewards [13.154350707762179]
FoCUS(FoCUS)は、ユーザーが特定のセマンティック・エムフェイズに向けてキャプションを操作できる制御可能な画像キャプション方式である。
FoCUSは、一般的なキャプション性能を劣化させることなく、制御性ときめ細かいキャプション品質を一貫して改善する。
論文 参考訳(メタデータ) (2026-09-01T04:36:23Z) - VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning [57.588999592609646]
本稿では,参照キャプション(証人)と視覚信号(代弁者)とをペアにする,証人-代弁者報酬であるVCapを提案する。
VCapは、キャプションの品質検証のための超幾何分布レベルの精度を持つ報酬信号を提供する。
実験では,VCapでトレーニングした8Bモデルは,複数の画像およびビデオキャプションベンチマーク上で,オープンソースおよびクローズドソースSOTAモデルより優れていた。
論文 参考訳(メタデータ) (2026-05-27T06:27:04Z) - CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning [23.289413412387223]
CCCaption: 専用微調整コーパスを備えた双方向逆強化学習フレームワークについて紹介する。
完全性のために、私たちは多様なLVLMを使用して、画像を一連のビジュアルクエリに切り離し、これらのクエリにもっと答えるキャプションに報いる。
正当性については,サブキャプションクエリの正当性を検証することによって,幻覚を含む字幕を罰する。
論文 参考訳(メタデータ) (2026-02-25T07:34:26Z) - ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing [128.8346376825612]
高品質画像キャプションの主な課題は、LVLMの固有のバイアスにある。
本稿では,キャプションを継続的に強化・校正し,推論予算を増大させる,スケーラブルなデバイアス付きキャプション戦略を提案する。
450KイメージにScaleCapをアノテートし、LVLMプレトレーニングに使用することで、11の広く使用されているベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-06-24T17:59:55Z) - CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness [30.44039177018447]
CAPabilityは、6つの重要なビューにまたがる12次元にわたる視覚的キャプションを評価するための総合的なベンチマークである。
我々は、生成したキャプションを評価するために、視覚要素アノテーションで1万1千近い人注画像や動画をキュレートした。
論文 参考訳(メタデータ) (2025-02-19T07:55:51Z) - What Makes for Good Image Captions? [50.48589893443939]
我々のフレームワークは、優れた画像キャプションは、情報的に十分であり、最小限の冗長であり、人間によって容易に理解できるという3つの重要な側面のバランスをとるべきであると仮定している。
本稿では,局所的な視覚情報とグローバルな視覚情報を統合することで,豊かなキャプションを生成するParamid of Captions(PoCa)手法を提案する。
論文 参考訳(メタデータ) (2024-05-01T12:49:57Z) - Simple Token-Level Confidence Improves Caption Correctness [117.33497608933169]
Token-Level Confidence(TLC)は、字幕の正確さを評価するシンプルな方法であるが、驚くほど効果的である。
画像キャプションに関する視覚言語モデルを微調整し、画像と提案されたキャプションをモデルに入力し、単語やシーケンスに対するトークンの信頼度を集計し、画像キャプションの一貫性を推定する。
論文 参考訳(メタデータ) (2023-05-11T17:58:17Z) - Transparent Human Evaluation for Image Captioning [70.03979566548823]
画像キャプションモデルのためのルーリックに基づく人間評価プロトコルを開発した。
人為的キャプションは機械的キャプションよりも著しく高品質であることを示す。
この研究は、画像キャプションのためのより透明な評価プロトコルを促進することを願っている。
論文 参考訳(メタデータ) (2021-11-17T07:09:59Z) - Intrinsic Image Captioning Evaluation [53.51379676690971]
I2CE(Intrinsic Image Captioning Evaluation)と呼ばれる画像キャプションのための学習ベースメトリクスを提案する。
実験の結果,提案手法は頑健な性能を維持し,意味的類似表現やアライメントの少ない意味論に遭遇した場合,候補キャプションに対してより柔軟なスコアを与えることができた。
論文 参考訳(メタデータ) (2020-12-14T08:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。