論文の概要: CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering
- arxiv url: http://arxiv.org/abs/2608.11074v1
- Date: Tue, 11 Aug 2026 15:36:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.106751
- Title: CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering
- Title(参考訳): CapProbe: フルシーンのDense Question Answeringによる詳細な画像キャプチャの評価
- Authors: Mouxiao Huang, Qiangyu Yan, Borui Jiang, Han Shu,
- Abstract要約: CapProbeは、詳細なキャプション評価を地域ごとの事実チェックに変換する、フルシーンの高密度QAベンチマークである。
346のイメージ、1,868のリージョン、25,650の質問からなる。
言語判断者はキャプションだけで答える; 不確実なオプションと有効精度は、未回答のプローブと不正に解決されたプローブを区別するための判断依存のプロキシを提供する。
- 参考スコア(独自算出の注目度): 6.875316321208349
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating detailed image captions from Vision-Language Models (VLMs) requires going beyond surface-level semantic similarity. Reference-based metrics (e.g., CIDEr and SPICE) and LLM-as-scorer protocols struggle to verify dense factual claims, while existing QA-based alternatives generally offer lower probe density, narrower domain coverage, or no explicit alignment between individual questions and segmented image regions. We introduce CapProbe, a full-scene dense QA benchmark that turns detailed caption evaluation into region-aligned factual checking. Each image is decomposed into coarse semantic regions covering both foreground and background elements; for every retained region, we generate multiple-choice questions spanning 10 semantic categories, forming a dense checklist of probed visual facts. Guided by a two-tier taxonomy of 37 L1 domains and 219 L2 sub-domains, CapProbe comprises 346 images, 1,868 regions, and 25,650 questions, averaging 74 QA pairs per image. A language judge answers from the caption alone; an Uncertain option and Effective Accuracy provide a judge-dependent proxy for distinguishing unanswered probes from incorrectly resolved ones, while density-based metrics penalize verbose yet uninformative captions. The protocol is cost-effective: by converting unconstrained scalar scoring into structured MCQ reading, it reduces open-ended scoring bias while remaining judge-conditioned and yields relatively stable model rankings under a fixed reader. Experiments on 13 VLMs show large Coverage gaps across models, a clear competency-efficiency trade-off, and failure modes that sparse or overlap-based evaluation often misses. The benchmark data, annotations, and evaluation code will be released soon.
- Abstract(参考訳): VLM(Vision-Language Models)から詳細な画像キャプションを評価するには、表面レベルのセマンティックな類似性を超える必要がある。
参照ベースのメトリクス(例えば、CIDEr と SPICE)と LLM-as-scorer プロトコルは、密集した事実のクレームを検証するのに苦労するが、既存の QA ベースの代替プロトコルでは、プローブ密度が低く、ドメインカバレッジが狭く、個別の質問とセグメント化された画像領域との明確な一致がないのが一般的である。
本稿では,詳細なキャプション評価を地域ごとのファクトチェックに変換する,フルシーンの高密度QAベンチマークであるCapProbeを紹介する。
各画像は、前景と背景要素の両方をカバーする粗いセマンティック領域に分解され、各保持領域に対して、10のセマンティックカテゴリにまたがる複数の選択質問を生成し、探索された視覚事実の密集したチェックリストを形成する。
37のL1ドメインと219のL2サブドメインの2階層の分類によってガイドされ、CapProbeは346の画像、1,868の領域、25,650の質問からなる。
言語判断者はキャプションのみから回答する; 不確実なオプションと有効精度は、未回答のプローブと不正に解決されたプローブを区別するための判断依存のプロキシを提供する。
このプロトコルは費用対効果があり、制約のないスカラースコアを構造化MCQ読取に変換することにより、判定条件を維持しながらオープンエンドスコアのバイアスを低減し、固定読取機の下で比較的安定したモデルランキングを得る。
13のVLMの実験では、モデル間に大きなカバレッジギャップ、明確な能力と効率のトレードオフ、スパースやオーバーラップベースの評価がしばしば見逃される障害モードが示されています。
ベンチマークデータ、アノテーション、評価コードも近くリリースされる予定だ。
関連論文リスト
- CAPEval: A Decoupled Caption Evaluation across Understanding and Generation [29.355541032573285]
そこで我々は,人間による接頭辞文と人間による検証済みの原子チェックリスト項目を用いた,分離された字幕評価ベンチマークCAPEvalを設計した。
カバレッジは、パフォーマンスを理解するための強い相関関係として機能し、Precisionは、生成パフォーマンスの主要な予測器として機能します。
論文 参考訳(メタデータ) (2026-08-03T17:57:03Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - CaptionQA: Is Your Caption as Useful as the Image Itself? [39.852352842429376]
画像キャプションは、検索、レコメンデーション、マルチステップエージェント推論パイプラインなどのシステムにおける視覚的コンテンツの効率的なサロゲートとして機能する。
モデル生成キャプションを評価するためのユーティリティベースのベンチマークであるCaptionQAを提案する。
新しいドメインに拡張するためのオープンソースのパイプラインとともに、CaptionQAをリリースします。
論文 参考訳(メタデータ) (2025-11-26T03:43:32Z) - BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues [47.213906345208315]
本稿では,新たな学習可能かつ参照不要な画像キャプション指標BRIDGEを提案する。
提案手法は,既存の基準フリー評価スコアと比較して,最先端の結果が得られる。
論文 参考訳(メタデータ) (2024-07-29T18:00:17Z) - CLAIR: Evaluating Image Captions with Large Language Models [69.46906537973518]
本稿では,機械生成画像のキャプション評価手法であるCLAIRを提案する。
本評価では, CLAIRは, 従来の指標と比較して, キャプション品質の人的判断と強い相関性を示した。
Clairは、言語モデルが割り当てられたスコアの背後にある根底にある推論を識別できるようにすることで、ノイズに解釈可能な結果を提供する。
論文 参考訳(メタデータ) (2023-10-19T17:59:01Z) - CapDet: Unifying Dense Captioning and Open-World Detection Pretraining [68.8382821890089]
本稿では,所定のカテゴリリストに基づいて予測するか,あるいは予測された境界ボックスのカテゴリを直接生成する,CapDetという新しいオープンワールド検出器を提案する。
具体的には,オープンワールド検出と高密度キャプションタスクを,付加的な高密度キャプションヘッドを導入することで,単一の効果的なフレームワークに統合する。
論文 参考訳(メタデータ) (2023-03-04T19:53:00Z) - Intrinsic Image Captioning Evaluation [53.51379676690971]
I2CE(Intrinsic Image Captioning Evaluation)と呼ばれる画像キャプションのための学習ベースメトリクスを提案する。
実験の結果,提案手法は頑健な性能を維持し,意味的類似表現やアライメントの少ない意味論に遭遇した場合,候補キャプションに対してより柔軟なスコアを与えることができた。
論文 参考訳(メタデータ) (2020-12-14T08:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。