論文の概要: C3-Bench: A Context-Aware Change Captioning Benchmark
- arxiv url: http://arxiv.org/abs/2606.25445v1
- Date: Wed, 24 Jun 2026 06:15:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.241991
- Title: C3-Bench: A Context-Aware Change Captioning Benchmark
- Title(参考訳): C3-Bench: コンテキスト対応の変更キャプションベンチマーク
- Abstract要約: C3-Benchは、コンテキスト対応のChange Captioningを評価するための包括的なベンチマークである。
従来の変更キャプションモデル、LMM(Large Multimodal Models)、2B-90BオープンソースLMMを含む32モデルをベンチマークする。
これらの隠れ障害モードを明確かつ測定可能にすることで、一般化可能で信頼性の高い変更キャプションシステムを構築するための次のフロンティアを明確にする。
- 参考スコア(独自算出の注目度): 6.071490877668865
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: While Change Captioning systems have garnered substantial attention to respond to our evolving world, their true performance on diverse real-world change contexts remains largely unexplored due to the lack of comprehensive evaluation frameworks. To fill this gap, we propose C3-Bench, a comprehensive benchmark for evaluating Context-aware Change Captioning. C3-Bench features: (1) 4,996 human-labeled image pairs of 51 real-world change contexts across four domains (e.g., natural scenes, remote sensing imagery, image editing, and anomalies), each with diverse, carefully curated scenarios derived from multiple change-centric communities; and (2) the first LLM-as-Judge evaluation framework in the change captioning task that measure fine-grained dimensions (e.g., correctness, specificity, fluency, and relevance), along with a novel reversibility metric exploring whether models understand changes with symmetric consistency. Based on C3-Bench, we benchmark 32 models -- including conventional change captioning models, proprietary Large Multimodal Models (LMMs), and 2B-90B open-source LMMs. We reveal a fundamental blind spot in the prevailing change captioning paradigm: Once the change context departs from training-style regimes, conventional models collapse, and even state-of-the-art LMMs such as GPT-5.2 exhibit systematic domain- and position-dependent errors that distort reliable change understanding. By making these hidden failure modes explicit and measurable, we delineate the next frontier for building generalizable and trustworthy change captioning systems. All codes and datasets are publicly available on the project page.
- Abstract(参考訳): 変革キャプションシステムは、我々の進化する世界に対応するためにかなりの注意を払っているが、様々な実世界の変革コンテキストにおける真のパフォーマンスは、包括的な評価フレームワークが欠如していることから、明らかにされていない。
このギャップを埋めるために、コンテキスト対応のチェンジキャプションを評価するための包括的なベンチマークであるC3-Benchを提案する。
C3-Bench の特徴は,(1) 自然シーン,リモートセンシング画像,画像編集,異常など4つの領域にわたる51個の実世界の変化コンテキストからなる4,996個の人間ラベル付き画像対,(2) 微粒な寸法(例えば,正しさ,特異性,流感,関係性)を計測する変化キャプションタスクにおける最初の LLM-as-Judge 評価フレームワーク,および,モデルが対称整合性のある変化を理解するかどうかの新たな可逆性尺度である。
C3-Benchに基づいて、従来の変更キャプションモデル、プロプライエタリなLMM(Large Multimodal Models)、2B-90BオープンソースLMMを含む32モデルをベンチマークする。
GPT-5.2のような最先端のLMMでさえも、信頼できる変更理解を歪めるような、系統的かつ位置依存的なエラーを示します。
これらの隠れ障害モードを明確かつ測定可能にすることで、一般化可能で信頼性の高い変更キャプションシステムを構築するための次のフロンティアを明確にする。
すべてのコードとデータセットはプロジェクトのページで公開されている。
関連論文リスト
- Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models [9.373908834130669]
本稿では,多時間リモートセンシングの解釈に適した新しいMLLMフレームワークであるDelta-LLaVAを提案する。
3つの中核的なイノベーションを通じて、ナイーブな機能結合の限界を克服します。
これは、複雑な変化の推論と高精度境界ローカライゼーションにおいて、先導的な一般MLLMと特別なセグメンテーションモデルより決定的に優れている。
論文 参考訳(メタデータ) (2026-04-15T16:23:05Z) - Scene Change Detection with Vision-Language Representation Learning [11.186360973626114]
LangSCDはシーン変化検出のための視覚言語フレームワークで、言語による意味論的推論を取り入れている。
我々は,ニューヨークで収集された8,122個の実世界のイメージペアの大規模データセットであるNYC-CDを紹介した。
論文 参考訳(メタデータ) (2026-04-13T12:43:35Z) - RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness [2.9979091009694088]
現実世界のデプロイメントは、しばしば、最新のオブジェクト認識モデルをドメインシフトに公開し、精度を著しく低下させる。
この劣化を軽減するため、我々はRT-VLM(Re-Thinking Vision Language Model)フレームワークを導入する。
論文 参考訳(メタデータ) (2025-09-01T02:13:00Z) - Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing [84.16442052968615]
RISEBenchはReasoning-Informed ViSual Editing (RISE)の最初のベンチマークである。
RISEBenchは、時間、因果、空間、論理的推論の4つの主要な推論カテゴリに焦点を当てている。
オープンソースモデルとプロプライエタリモデルの両方を含む,9つの目立った視覚編集モデルを評価する実験を行った。
論文 参考訳(メタデータ) (2025-04-03T17:59:56Z) - Detect Changes like Humans: Incorporating Semantic Priors for Improved Change Detection [52.62459671461816]
本稿では,視覚基盤モデルからのセマンティックな先入観を取り入れ,変化を検出する能力の向上について検討する。
人間の視覚パラダイムにインスパイアされた新しいデュアルストリーム特徴デコーダは、意味認識特徴と差認識特徴を組み合わせることで変化を区別するために導出される。
論文 参考訳(メタデータ) (2024-12-22T08:27:15Z) - Context-aware Difference Distilling for Multi-change Captioning [106.72151597074098]
マルチチェンジキャプションは、自然言語でイメージペア内の複雑で結合的な変化を記述することを目的としている。
そこで本稿では, 文収量に対する真の変化をすべて捉えるための, 文脈認識型差分蒸留ネットワークを提案する。
論文 参考訳(メタデータ) (2024-05-31T14:07:39Z) - Change-Agent: Towards Interactive Comprehensive Remote Sensing Change Interpretation and Analysis [28.3763053922823]
現在のRSICI技術は、変更検出と変更キャプションを包含しており、それぞれに包括的な解釈を提供する限界がある。
本稿では,ユーザ指示に従って包括的な変更解釈を実現するインタラクティブなChange-Agentを提案する。
Change-Agentは、マルチレベル変化解釈(MCI)モデルを目として、大きな言語モデル(LLM)を脳として統合する。
論文 参考訳(メタデータ) (2024-03-28T17:55:42Z) - The Change You Want to See [91.3755431537592]
同じシーンの2つのイメージが与えられた場合、その変更を自動的に検出できることは、様々な領域で実用的応用をもたらす。
画像対の「オブジェクトレベル」変化を、視点や照明の違いにかかわらず検出することを目的として、変化検出問題に取り組む。
論文 参考訳(メタデータ) (2022-09-28T18:10:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。