論文の概要: DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
- arxiv url: http://arxiv.org/abs/2605.04503v1
- Date: Wed, 06 May 2026 05:12:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.655481
- Title: DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
- Title(参考訳): DiffCap-Bench:画像差分キャプションのための包括的で、複雑で、ロバストなベンチマーク
- Abstract要約: 画像差分キャプション(IDC)は、2つの画像の違いを正確に識別する言語記述を生成する。
DiffCap-Benchは10の異なるカテゴリをカバーする総合的なIDCベンチマークである。
また,人間の有意差分リストに基づくLCM-as-a-Judge評価プロトコルを提案する。
- 参考スコア(独自算出の注目度): 26.88130913151649
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Image Difference Captioning (IDC) generates natural language descriptions that precisely identify differences between two images, serving as a key benchmark for fine-grained change perception, cross-modal reasoning, and image editing data construction. However, existing benchmarks lack diversity and compositional complexity, and standard lexical-overlap metrics (e.g., BLEU, METEOR) fail to capture semantic consistency or penalize hallucinations, which together prevent a comprehensive and robust evaluation of multimodal large language models (MLLMs) on IDC. To address these gaps, we introduce DiffCap-Bench, a comprehensive IDC benchmark covering ten distinct difference categories to ensure diversity and compositional complexity. Furthermore, we propose an LLM-as-a-Judge evaluation protocol grounded in human-validated Difference Lists, enabling a robust assessment of models' ability to both capture and describe visual changes. Through extensive evaluation of state-of-the-art MLLMs, we reveal significant performance gaps between proprietary and open-source models, highlight the critical importance of reasoning capability, and identify clear limitations in model scaling. Our framework also demonstrates strong alignment with human expert judgments and strong correlation with downstream image editing data construction quality. These findings establish DiffCap-Bench as both a reliable IDC evaluation framework and a practical predictor of downstream utility. The benchmark and code will be made publicly available to support further research.
- Abstract(参考訳): 画像差分キャプション(IDC)は、2つの画像の違いを正確に識別する自然言語記述を生成する。
しかし、既存のベンチマークは多様性と構成の複雑さに欠けており、標準的な語彙オーバーラップのメトリクス(例えばBLEU、METEOR)は意味的一貫性を捉えたり、幻覚を罰したりすることができず、IDC上でのマルチモーダルな大規模言語モデル(MLLM)の包括的かつ堅牢な評価を妨げている。
これらのギャップに対処するために、DiffCap-Benchという総合的なIDCベンチマークを紹介します。
さらに,人間の検証した差分リストに基づくLCM-as-a-Judge評価プロトコルを提案する。
最先端MLLMの広範な評価を通じて、プロプライエタリモデルとオープンソースモデルの間に大きなパフォーマンスギャップを明らかにし、推論能力の重要な重要性を強調し、モデルのスケーリングにおける明確な制限を明らかにする。
また,本フレームワークは,人間の専門家による判断と,下流画像編集データ構築品質との強い相関性を示す。
これらの結果は、DiffCap-Benchを信頼性のあるIDC評価フレームワークと、下流ユーティリティの実用的な予測ツールとして確立している。
ベンチマークとコードは公開され、さらなる研究をサポートする。
関連論文リスト
- DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues [54.31138496553705]
DiCoBenchは、きめ細かい知覚のための包括的でマルチイメージの高解像度のベンチマークである。
評価の結果,人的精度 (98.3%) と比較して顕著な性能差がみられた。
DiCoBenchは、自律的で高解像度のマルチイメージ知覚における将来の研究を促進するための、挑戦的なテストベッドとして機能すると考えています。
論文 参考訳(メタデータ) (2026-06-25T05:02:38Z) - Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks [11.064940886724257]
本稿では,視覚言語モデル(VLM)の自然なシナリオ下での体系的評価フレームワークを提案する。
ゼロショット画像分類,セマンティックセグメンテーション,視覚的質問応答において,選択したVLMの自然な対向性能を測定した。
解析の結果,頑健なCLIPモデルでは自然の敵対的脆弱性が増幅され,CLIPモデルでは自然言語による敵対的事例のパフォーマンスが著しく低下することが判明した。
論文 参考訳(メタデータ) (2026-04-06T06:48:32Z) - Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis [95.89328387635176]
画像編集のための細粒度マルチモーダル大言語モデル (MLLM)-as-a-Judge フレームワークを提案する。
本稿では,人間の判断,MLLMに基づく評価,モデル出力,従来のメトリクスを統合した人為的評価ベンチマークを提案する。
論文 参考訳(メタデータ) (2026-02-13T15:34:32Z) - How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing [56.60465182650588]
我々は,3段階の相互作用階層を導入し,決定的接地,形態的操作,因果推論を捉える。
本稿では,スケーラブルできめ細かい評価を実現するために,タスク固有のメトリクスを備えた堅牢なLMM-as-a-judge評価フレームワークを提案する。
プロプライエタリなモデルは早期の視覚指示追従能力を示し、一貫してオープンソースモデルを上回っていることがわかった。
論文 参考訳(メタデータ) (2026-02-02T09:24:45Z) - What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models [88.398085358514]
DICEは、原画像と編集画像の局所的な差異を検出するために設計されたモデルである。
自己監督、塗布ネットワークからの蒸留、全監督を利用する戦略を用いて訓練されている。
DICEは一貫性のある編集を効果的に識別し、異なる編集モデルによって生成された画像を人間の判断と強く相関して効果的に評価する。
論文 参考訳(メタデータ) (2025-05-26T18:00:10Z) - HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing [54.970275599061594]
我々は階層的・多階層的不整合評価(HMGIE)と呼ばれる適応的評価フレームワークを設計する。
HMGIEは、様々な画像キャプチャー対の精度と完全性の両方をカバーする多粒度評価を提供する。
提案手法の有効性と柔軟性を検証するため,様々なタイプの画像キャプチャー・データセットであるMVTIDを構築した。
論文 参考訳(メタデータ) (2024-12-07T15:47:49Z) - Multi-Modal Prompt Learning on Blind Image Quality Assessment [65.0676908930946]
画像品質評価(IQA)モデルは意味情報から大きな恩恵を受け、異なる種類のオブジェクトを明瞭に扱うことができる。
十分な注釈付きデータが不足している従来の手法では、セマンティックな認識を得るために、CLIPイメージテキスト事前学習モデルをバックボーンとして使用していた。
近年のアプローチでは、このミスマッチに即時技術を使って対処する試みがあるが、これらの解決策には欠点がある。
本稿では、IQAのための革新的なマルチモーダルプロンプトベースの手法を提案する。
論文 参考訳(メタデータ) (2024-04-23T11:45:32Z) - Learning Efficient Coding of Natural Images with Maximum Manifold
Capacity Representations [4.666056064419346]
効率的な符号化仮説は、感覚系の応答特性が入力の統計に適応していることを提案する。
エレガントではあるものの、情報理論の特性は実際的な設定や最適化の目的関数として使うのが難しいことで知られている。
ここでは、多様体の容量を直接最適化し、最大多様体容量表現(MMCR)が得られるという仮定を概説する。
論文 参考訳(メタデータ) (2023-03-06T17:26:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。