論文の概要: A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions
- arxiv url: http://arxiv.org/abs/2607.23235v1
- Date: Sat, 25 Jul 2026 14:41:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.034365
- Title: A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions
- Title(参考訳): 参照キャプションを超えたキャプション評価のための再構成型フレームワーク
- Abstract要約: 本研究では,キャプション評価のためのリコンストラクションに基づく原理について検討する。
キャプションはオリジナルの画像の復元を可能にする能力に匹敵する。
我々は、下流の視覚課題にまたがる元の画像と再構成が一致するかどうかを検証した。
- 参考スコア(独自算出の注目度): 20.3003920492096
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Image captioning is a primary task in vision--language research, yet assessing how faithfully a caption preserves image semantics without relying on reference captions remains unsettled. Prevailing evaluations rely on human-annotated references, whose content reflects annotator intent and captioning proficiency. In this paper, we study a reconstruction-based principle for caption evaluation: a caption is as good as its capacity to enable reconstruction of the original image. However, because captioning inherently compresses visual information, it is impossible to recover all details, and pixel-wise comparison between reconstructed and source images is neither feasible nor meaningful. Through our in-depth analysis of the nature of captions, whose fundamental purpose is to transmit the semantic content of an image, we propose a revised principle: a caption is as good as its capacity to enable a reconstruction that is semantically equivalent to the original. To assess semantic equivalence, we test whether the reconstruction matches the original image across a suite of downstream vision--language tasks, yielding a reference-free, task-conditioned caption score. We characterize component-dependent limitations and introduce the lower-cost Captioning Turing Test Dataset (CTTD) surrogate.
- Abstract(参考訳): イメージキャプションは視覚言語研究の主要な課題であるが、参照キャプションに頼ることなく、キャプションが画像セマンティクスを忠実に保存するかどうかを評価する。
一般的な評価は、アノテータの意図とキャプションの習熟度を反映した人間の注釈付き参照に依存する。
本稿では,キャプション評価のためのリコンストラクションに基づく原理について検討し,キャプションはオリジナル画像のリコンストラクションを可能にする能力に匹敵するものであることを示す。
しかし、キャプションは本質的に視覚情報を圧縮するので、すべての詳細を復元することは不可能であり、再構成された画像とソース画像の画素単位での比較は、実現可能でも有意義でもない。
画像のセマンティックな内容の伝達を基本とするキャプションの性質の詳細な分析を通じて, キャプションは, オリジナルとセマンティックに等価な再構築を可能にする能力に匹敵する, 改訂された原理を提案する。
セマンティックな等価性を評価するために、下流の視覚言語タスクのスイート間で、再構成が元の画像と一致するかどうかを検証し、参照なしのタスク条件付きキャプションスコアを得る。
コンポーネントに依存した制限を特徴付け、低コストのCaptioning Turing Test Dataset (CTTD)サロゲートを導入する。
関連論文リスト
- Beyond Fidelity: Semantic Similarity Assessment in Low-Level Image Processing [53.27421114481586]
低レベル画像処理のための新しい評価タスクとしてtextitSemantic similarity を定式化する。
本稿では,意味的実体とその関係に基づく画像意味論の構造的定式化について述べる。
本稿では,前景のエンティティ,背景のエンティティ,関係性を通じて画像意味をモデル化するTripletベースのセマンティック類似スコア(T3S)を提案する。
論文 参考訳(メタデータ) (2026-04-28T09:21:05Z) - CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning [23.289413412387223]
CCCaption: 専用微調整コーパスを備えた双方向逆強化学習フレームワークについて紹介する。
完全性のために、私たちは多様なLVLMを使用して、画像を一連のビジュアルクエリに切り離し、これらのクエリにもっと答えるキャプションに報いる。
正当性については,サブキャプションクエリの正当性を検証することによって,幻覚を含む字幕を罰する。
論文 参考訳(メタデータ) (2026-02-25T07:34:26Z) - Semantic Leakage from Image Embeddings [33.36179164881091]
意味リークは,元の画像の正確な再構築を必要としないことを示す。
本稿では,スタンドアロンの圧縮画像埋め込みからの意味情報を明らかにする軽量な推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-30T12:46:41Z) - What Makes for Good Image Captions? [50.48589893443939]
我々のフレームワークは、優れた画像キャプションは、情報的に十分であり、最小限の冗長であり、人間によって容易に理解できるという3つの重要な側面のバランスをとるべきであると仮定している。
本稿では,局所的な視覚情報とグローバルな視覚情報を統合することで,豊かなキャプションを生成するParamid of Captions(PoCa)手法を提案する。
論文 参考訳(メタデータ) (2024-05-01T12:49:57Z) - Rewrite Caption Semantics: Bridging Semantic Gaps for
Language-Supervised Semantic Segmentation [100.81837601210597]
本研究では,事前学習データにおける視覚的意味論とテキスト的意味論のギャップを埋めるための概念キュレーション(CoCu)を提案する。
CoCuは、最高にゼロショット転送性能を達成し、言語教師ありセグメンテーションベースラインを大きなマージンで大幅に向上させる。
論文 参考訳(メタデータ) (2023-09-24T00:05:39Z) - Cross-Domain Image Captioning with Discriminative Finetuning [20.585138136033905]
自己監督的な識別的コミュニケーションの目的を持ったアウト・オブ・ザ・ボックスのニューラルキャプタを微調整することは、プレーンで視覚的に記述された言語を回復するのに役立ちます。
画像識別タスクを担っているヒトのアノテータに対して,Vanilla ClipCapのキャプションや接地木キャプションよりも,識別的に微調整されたキャプションの方が有用であることを示す。
論文 参考訳(メタデータ) (2023-04-04T09:33:16Z) - Belief Revision based Caption Re-ranker with Visual Semantic Information [31.20692237930281]
本稿では,視覚的セマンティックな手法を用いて理想的なキャプションを識別する手法を提案する。
実験では,提案手法の有効性を実証し,一般的な画像キャプチャシステムの性能向上を図る。
論文 参考訳(メタデータ) (2022-09-16T20:36:41Z) - Intrinsic Image Captioning Evaluation [53.51379676690971]
I2CE(Intrinsic Image Captioning Evaluation)と呼ばれる画像キャプションのための学習ベースメトリクスを提案する。
実験の結果,提案手法は頑健な性能を維持し,意味的類似表現やアライメントの少ない意味論に遭遇した場合,候補キャプションに対してより柔軟なスコアを与えることができた。
論文 参考訳(メタデータ) (2020-12-14T08:36:05Z) - Egoshots, an ego-vision life-logging dataset and semantic fidelity
metric to evaluate diversity in image captioning models [63.11766263832545]
我々は,字幕のない実生活画像978枚からなる新しい画像キャプションデータセット,Egoshotsを提案する。
生成されたキャプションの品質を評価するために,新しい画像キャプション指標,オブジェクトベースセマンティックフィデリティ(SF)を提案する。
論文 参考訳(メタデータ) (2020-03-26T04:43:30Z) - Grounded and Controllable Image Completion by Incorporating Lexical
Semantics [111.47374576372813]
Lexical Semantic Image Completion (LSIC)は、芸術、デザイン、遺産保護に潜在的な応用をもたらす可能性がある。
視覚的文脈と語彙的文脈の両方に忠実な結果を生成することを提唱する。
LSICの大きな課題の1つは、ビジュアル・セマンティック・コンテキストの構造をモデル化し整合させることである。
論文 参考訳(メタデータ) (2020-02-29T16:54:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。