論文の概要: Beyond Pixel Diffs: Benchmarking Image Change Captioning for Web UI Visual Regression Testing
- arxiv url: http://arxiv.org/abs/2607.01728v1
- Date: Thu, 02 Jul 2026 05:33:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.683526
- Title: Beyond Pixel Diffs: Benchmarking Image Change Captioning for Web UI Visual Regression Testing
- Title(参考訳): Pixel Diffsを超えて: Web UIビジュアル回帰テストのためのイメージ変更キャプションのベンチマーク
- Authors: Licheng Zhang, Bach Le, Pengtao Zhao, Naveed Akhtar,
- Abstract要約: ビジュアル回帰テスト(VRT)は、現代のソフトウェアリリースパイプラインにおける標準的な品質保証ステップである。
ピクセルレベルの比較は意味的に盲目であり、レンダリングノイズと真の欠陥を同一に扱う。
UI変更の自然言語記述をサポートするデータセットやベンチマークは存在しない。
本稿では,VRT と画像差分キャプションの交差点に位置する WUICC (Web UI Image Change Captioning) を提案する。
- 参考スコア(独自算出の注目度): 31.52236297268213
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual regression testing (VRT) is a standard quality assurance step in modern software release pipelines. On every change, it re-renders user interface (UI) screenshots, compares each one against an approved baseline image, and routes any detected difference to a human reviewer who decides whether it is an intended update or an unintended regression. A widely used approach, especially in open-source and continuous-integration pipelines, is pixel-level comparison, which is semantically blind and treats rendering noise and genuine defects identically, producing large volumes of false positives that force developers and testers to spend substantial time and effort manually reviewing flagged differences at every release cycle. Industry tools apply machine learning to VRT, but lack public evaluation. More critically, no dataset or benchmark exists to support natural language descriptions of UI changes, a capability that tells testers what changed in words instead of leaving them to interpret a binary flag or a highlighted region. To address the gap, we propose a new task, Web UI Image Change Captioning (WUICC), which sits at the intersection of VRT and image difference captioning (IDC), and release WUICC-bench, its first dataset and benchmark for the task. We evaluate eleven representative IDC methods, together with two zero-shot general-purpose LLMs. We find that: (1) these methods tend to struggle in the Web UI domain due to its layout diversity, dense text, and fine-grained changes, and (2) yet the trained methods already suppress non-meaningful visual noise far more selectively than the pixel-level comparison VRT relies on, providing a solid foundation for future domain-specific research.
- Abstract(参考訳): ビジュアル回帰テスト(VRT)は、現代のソフトウェアリリースパイプラインにおける標準的な品質保証ステップである。
変更毎にユーザーインターフェース(UI)のスクリーンショットを再レンダリングし、承認されたベースラインイメージと比較し、検出された違いを人間レビュアーにルーティングする。
特にオープンソースと継続的インテグレーションのパイプラインで広く使われているアプローチは、ピクセルレベルの比較であり、セマンティック・ブラインドであり、レンダリングノイズと真の欠陥を同一に扱い、大量の偽陽性を発生させ、開発者とテスタはリリースサイクル毎にフラグ付きの違いを手作業でレビューしなければならない。
業界ツールは、機械学習をVRTに適用するが、公的評価は欠如している。
さらに重要なのは、UI変更の自然言語記述をサポートするデータセットやベンチマークが存在しないことだ。
このギャップに対処するために、VRTと画像差分キャプション(IDC)の交差点に位置するWeb UIイメージ変更キャプション(WUICC)という新しいタスクを提案し、そのタスクのための最初のデータセットとベンチマークであるWUICC-benchをリリースする。
ゼロショット汎用LLMを用いて,11種類の代表型IDC法の評価を行った。
これらの手法は, レイアウトの多様性, 高密度テキスト, きめ細かな変更などにより, Web UI ドメインで苦労する傾向にあり, 2) トレーニング済みの手法では, 画素レベルの比較VRT が依存するよりもはるかに選択的に非有意な視覚ノイズを抑えることができ, 将来的な領域特化研究の基礎となる。
関連論文リスト
- Referring Change Detection in Remote Sensing Imagery [49.841833753558575]
本稿では、自然言語のプロンプトを利用してリモートセンシング画像の変化の特定のクラスを検出するReferring Change Detection (RCD)を紹介する。
我々は, (I) textbfRCDNet, (II) textbfRCDGen, (II) 拡散型合成データ生成パイプラインからなる2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T16:57:12Z) - VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval [56.12310817934239]
クロスモーダルな埋め込みは概念の袋として振る舞うが、ポーズや視点のような構造的な視覚的関係が不足している。
この制限を緩和するT2I検索のための新しいパラダイムであるVisualize-then-Retrieve (VisRet)を提案する。
VisRetは、T2I検索をテキスト間類似性マッチングとして再キャストする、モーダル間の類似性マッチングとベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2025-05-26T17:59:33Z) - Detect Changes like Humans: Incorporating Semantic Priors for Improved Change Detection [52.62459671461816]
本稿では,視覚基盤モデルからのセマンティックな先入観を取り入れ,変化を検出する能力の向上について検討する。
人間の視覚パラダイムにインスパイアされた新しいデュアルストリーム特徴デコーダは、意味認識特徴と差認識特徴を組み合わせることで変化を区別するために導出される。
論文 参考訳(メタデータ) (2024-12-22T08:27:15Z) - Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning [71.14084801851381]
変更キャプションは、類似した画像間のセマンティックな変化を簡潔に記述することを目的としている。
既存のほとんどの手法は、それらの違いを直接キャプチャし、エラーを起こしやすい特徴を得るリスクを負う。
本稿では,2つの画像表現の対応するチャネルを関連づけるイントラクタ免疫表現学習ネットワークを提案する。
論文 参考訳(メタデータ) (2024-07-16T13:00:33Z) - Exploring Text-Guided Single Image Editing for Remote Sensing Images [30.66938568608091]
本稿では,テキストガイドによるRSI編集手法を提案する。
大規模なベンチマークのトレーニングを必要とせずに一貫性を維持するために、マルチスケールのトレーニングアプローチが採用されている。
提案手法は,既存の手法と比較して,CLIPスコアと主観評価の両方に有意な利点をもたらす。
論文 参考訳(メタデータ) (2024-05-09T13:45:04Z) - Learning from Mistakes: Iterative Prompt Relabeling for Text-to-Image Diffusion Model Training [33.51524424536508]
Iterative Prompt Relabeling (IPR) は、反復的な画像サンプリングを通じて画像をテキストにアライメントし、フィードバックでリテラブルを促す新しいアルゴリズムである。
我々はSDv2とSDXLについて徹底的な実験を行い、空間関係の指示に従う能力をテストする。
論文 参考訳(メタデータ) (2023-12-23T11:10:43Z) - TVTSv2: Learning Out-of-the-box Spatiotemporal Visual Representations at
Scale [59.01246141215051]
言語指導の観点から,その劣化要因を分析した。
本稿では,テキストエンコーダの一般化能力を維持するために,教師なし事前学習戦略を提案する。
最大10億のパラメータを持つTVTSv2と呼ばれる一連のモデルを作成します。
論文 参考訳(メタデータ) (2023-05-23T15:44:56Z) - Unsupervised Pretraining for Object Detection by Patch Reidentification [72.75287435882798]
教師なし表現学習は、オブジェクトディテクタの事前トレーニング表現で有望なパフォーマンスを実現します。
本研究では,オブジェクト検出のための簡易かつ効果的な表現学習手法であるパッチ再識別(Re-ID)を提案する。
私たちの方法は、トレーニングの反復やデータパーセンテージなど、すべての設定でCOCOの同等を大幅に上回ります。
論文 参考訳(メタデータ) (2021-03-08T15:13:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。