論文の概要: Panoptic Pairwise Distortion Graph
- arxiv url: http://arxiv.org/abs/2604.11004v1
- Date: Mon, 13 Apr 2026 05:12:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.337298
- Title: Panoptic Pairwise Distortion Graph
- Title(参考訳): Panoptic Pairwise Distortion Graph
- Authors: Muhammad Kamran Janjua, Abdul Wahab, Bahador Rashidi,
- Abstract要約: 画像ペアを領域の構造的構成として表現することで,比較画像評価の新しい視点を導入する。
本稿では,2つの画像を領域に接する構造的トポロジとして扱うDG(Distortion Graph)を提案する。
PandaSetのトレーニングやDGによるプロンプトにより、領域の歪みの理解が得られ、より微細で構造化されたペアワイズ画像評価のための新たな方向が開けられることを示す。
- 参考スコア(独自算出の注目度): 2.2001108575935597
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this work, we introduce a new perspective on comparative image assessment by representing an image pair as a structured composition of its regions. In contrast, existing methods focus on whole image analysis, while implicitly relying on region-level understanding. We extend the intra-image notion of a scene graph to inter-image, and propose a novel task of Distortion Graph (DG). DG treats paired images as a structured topology grounded in regions, and represents dense degradation information such as distortion type, severity, comparison and quality score in a compact interpretable graph structure. To realize the task of learning a distortion graph, we contribute (i) a region-level dataset, PandaSet, (ii) a benchmark suite, PandaBench, with varying region-level difficulty, and (iii) an efficient architecture, Panda, to generate distortion graphs. We demonstrate that PandaBench poses a significant challenge for state-of-the-art multimodal large language models (MLLMs) as they fail to understand region-level degradations even when fed with explicit region cues. We show that training on PandaSet or prompting with DG elicits region-wise distortion understanding, opening a new direction for fine-grained, structured pairwise image assessment.
- Abstract(参考訳): 本研究では、画像対を領域の構造的構成として表現することで、比較画像評価の新しい視点を導入する。
対照的に、既存の手法は、領域レベルの理解に暗黙的に依存しながら、画像解析全体に焦点を当てている。
シーングラフのイメージ内概念を画像間へ拡張し、歪みグラフ(DG)の新たなタスクを提案する。
DGは、対の画像を領域に接地した構造的トポロジーとして扱い、コンパクトな解釈可能なグラフ構造において、歪みタイプ、重大度、比較、品質スコアなどの高密度な劣化情報を表す。
歪みグラフ学習の課題を実現するために,我々は貢献する
(i)リージョンレベルのデータセットPandaSet
(ii)地域レベルでの難易度が異なるベンチマークスイートであるPandaBench
(三)歪みグラフを生成する効率的なアーキテクチャ、パンダ。
我々は,PandaBenchが地域レベルの劣化を理解するのに失敗し,最先端のマルチモーダル言語モデル(MLLM)に重大な課題をもたらすことを実証した。
PandaSetのトレーニングやDGによるプロンプトにより、領域の歪みの理解が得られ、より微細で構造化されたペアワイズ画像評価のための新たな方向が開けられることを示す。
関連論文リスト
- Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for
Improved Vision-Language Compositionality [50.48859793121308]
対照的に訓練された視覚言語モデルは、視覚と言語表現学習において顕著な進歩を遂げた。
近年の研究では、対象、属性、関係性に対して構成的推論を行う能力に厳しい制限が強調されている。
論文 参考訳(メタデータ) (2023-05-23T08:28:38Z) - BI-GCN: Boundary-Aware Input-Dependent Graph Convolution Network for
Biomedical Image Segmentation [21.912509900254364]
セグメント化タスクにグラフ畳み込みを適用し,改良されたtextitLaplacianを提案する。
本手法は,大腸内視鏡像におけるポリープの分画と光ディスク,光カップのカラーファンドス画像における画期的なアプローチよりも優れていた。
論文 参考訳(メタデータ) (2021-10-27T21:12:27Z) - Shape-Biased Domain Generalization via Shock Graph Embeddings [2.578242050187029]
本稿では,古典的コンピュータビジョンを用いた形状の明示的かつ完全な表現を提唱する。
結果として得られるグラフとその記述子は、輪郭内容の完全な表現であり、最近のグラフニューラルネットワーク(GNN)手法を用いて分類される。
論文 参考訳(メタデータ) (2021-09-13T02:10:40Z) - Disentangled Motif-aware Graph Learning for Phrase Grounding [48.64279161780489]
画像中のフレーズ接地のための新しいグラフ学習フレームワークを提案する。
モチーフを認識した文脈情報を表現に組み込むために,不連続グラフネットワークを考案する。
私たちのモデルはFlickr30K EntitiesとReferIt Gameベンチマークで最先端のパフォーマンスを実現します。
論文 参考訳(メタデータ) (2021-04-13T08:20:07Z) - Spatial-spectral Hyperspectral Image Classification via Multiple Random
Anchor Graphs Ensemble Learning [88.60285937702304]
本稿では,複数のランダムアンカーグラフアンサンブル学習(RAGE)を用いた空間スペクトルHSI分類手法を提案する。
まず、各選択されたバンドのより記述的な特徴を抽出し、局所的な構造と領域の微妙な変化を保存するローカルバイナリパターンを採用する。
次に,アンカーグラフの構成に適応隣接代入を導入し,計算複雑性を低減した。
論文 参考訳(メタデータ) (2021-03-25T09:31:41Z) - MAF: Multimodal Alignment Framework for Weakly-Supervised Phrase
Grounding [74.33171794972688]
本稿では,詳細な視覚表現と視覚認識言語表現を活用することで,句オブジェクトの関連性をモデル化するアルゴリズムを提案する。
広く採用されているFlickr30kデータセットで実施された実験は、既存の弱教師付き手法よりも大幅に改善されている。
論文 参考訳(メタデータ) (2020-10-12T00:43:52Z) - Multi-Level Graph Convolutional Network with Automatic Graph Learning
for Hyperspectral Image Classification [63.56018768401328]
HSI分類のための自動グラフ学習法(MGCN-AGL)を用いたマルチレベルグラフ畳み込みネットワーク(GCN)を提案する。
空間的に隣接する領域における重要度を特徴付けるために注意機構を利用することで、最も関連性の高い情報を適応的に組み込んで意思決定を行うことができる。
MGCN-AGLは局所的に生成した表現表現に基づいて画像領域間の長距離依存性を符号化する。
論文 参考訳(メタデータ) (2020-09-19T09:26:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。