論文の概要: On Preserving Geometrical Invariance for Superpixel Image Classification using Graph Transformer
- arxiv url: http://arxiv.org/abs/2607.04262v1
- Date: Sun, 05 Jul 2026 12:16:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.879193
- Title: On Preserving Geometrical Invariance for Superpixel Image Classification using Graph Transformer
- Title(参考訳): グラフ変換器を用いた超画素画像分類のための幾何学的不変性保存について
- Authors: Sarabeshwar Balaji, Shubham Mohanty, Akash Anil,
- Abstract要約: 画像分類のための畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)は、余分な情報を含むピクセルの高密度グリッドを利用する。
より大きなイメージデータセットでは、CNNとViTは高い計算複雑性のため、デプロイ可能性の問題に直面している。
本稿では,画像分類のためのグラフトランスフォーマーベースのフレームワークであるSuperGTを提案する。
- 参考スコア(独自算出の注目度): 0.19116784879310025
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Convolutional Neural Network (CNN) and Vision Transformer (ViT) for image classification exploit a dense grid of pixels containing redundant information. Consequently, for a larger image dataset, CNNs and ViTs face deployability challenges due to high computational complexity. Representing images as graphs of superpixels offers an efficient alternative that preserves key information while eliminating pixel-level redundancy. Graph Neural Networks (GNNs) have been utilized on such graphs to perform image classification. However, GNNs are known to struggle with capturing long-range dependencies which is important in the domain of image classification. Furthermore, a majority of these superpixel-based image classification approaches do not explicitly preserve translation/rotation invariance. Nevertheless, preserving translation/rotation invariance is important for robust image classification. Thus, this paper proposes SuperGT, a Graph Transformer-based framework for image classification, which captures the long range dependencies, along with a pre-processing scheme that preserves translation/rotation invariance. We evaluate SuperGT on CIFAR-10 dataset and observe that it performs significantly better than many baselines. Furthermore, we note that the overall performance of SuperGT is comparable to the previous state-of-the-art model, namely, ShapeGNN, without relying on coordinates of the boundary points of each superpixel required by ShapeGNN.
- Abstract(参考訳): 画像分類のための畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)は、余分な情報を含むピクセルの高密度グリッドを利用する。
その結果、より大きなイメージデータセットでは、CNNとViTは高い計算複雑性のため、デプロイ可能性の問題に直面している。
画像をスーパーピクセルのグラフとして表現することは、画素レベルの冗長性を排除しながらキー情報を保存する効率的な代替手段を提供する。
グラフニューラルネットワーク(GNN)は,このようなグラフを用いて画像分類を行っている。
しかし、GNNは画像分類の領域において重要な長距離依存関係の取得に苦労していることが知られている。
さらに、これらのスーパーピクセルベースの画像分類手法のほとんどは、翻訳/回転不変性を明示的に保存していない。
それでも、ロバストな画像分類には翻訳・回転不変性を保存することが重要である。
そこで本稿では,画像分類のためのグラフトランスフォーマーベースのフレームワークであるSuperGTと,翻訳・回転不変性を保存する前処理方式を提案する。
我々は,CIFAR-10データセット上でSuperGTを評価し,多くのベースラインよりも優れた性能を示すことを示した。
さらに、SuperGTの全体的な性能は、ShapeGNNが必要とする各スーパーピクセルの境界点の座標に依存することなく、従来の最先端モデルであるShapeGNNに匹敵するものであることに留意する。
関連論文リスト
- Is an Image Also Worth 16x16=256 Superpixels? A Framework for Attentional Image Classification [0.11470070927586014]
スーパーピクセルベースの画像分類と視覚変換を統一する新しいフレームワークであるSuperpixel Transformers (SPT)を提案する。
SPTは、任意のスーパーピクセルベースのチャンキング戦略、接続グラフ、位置エンコーディングをサポートするために、グラフ注意ネットワーク(SICGAT)モデルとViTでスーパーピクセル画像分類を一般化する。
我々は,SPTが従来のスーパーピクセルベースGNN法に比べて優れた性能を示し,ViTと競合し続けていることを示す。
論文 参考訳(メタデータ) (2026-05-26T15:09:46Z) - Superpixel Integrated Grids for Fast Image Segmentation [0.07639235704257864]
セグメンテーションタスクにおけるフル解像度画像の代替として,新しいスーパーピクセルベースデータ構造SIGRIDを導入する。
SIGRIDは、古典的な形状記述子を活用することにより、入力寸法を著しく減少させながら、スーパーピクセルの色情報と形状情報を符号化する。
論文 参考訳(メタデータ) (2025-10-07T22:02:48Z) - Structural-Spectral Graph Convolution with Evidential Edge Learning for Hyperspectral Image Clustering [73.01141916544103]
ハイパースペクトル画像(HSI)クラスタリングは、ラベル付きデータを持たないクラスタにピクセルをグループ化する。
ほとんどの手法はスーパーピクセルセグメンテーションに依存し、グラフニューラルネットワーク(GNN)に基づくスーパーピクセルレベルのクラスタリングを実行する。
グラフ構造化HSIスーパーピクセルに適した構造スペクトルグラフ畳み込み演算子(SSGCO)を提案する。
論文 参考訳(メタデータ) (2025-06-11T16:41:34Z) - Graph-Weighted Contrastive Learning for Semi-Supervised Hyperspectral Image Classification [9.640130509216629]
本稿では,超画素分割を回避し,ニューラルネットワークを用いてハイパースペクトル画像表現を学習するグラフ重み付きコントラスト学習手法を提案する。
提案手法は,ノードのサブセットのみを一度に処理することで,計算複雑性を低減し,未確認ノードへの一般化を改善することによるミニバッチトレーニングを支援する。
論文 参考訳(メタデータ) (2025-03-19T22:55:52Z) - SAG-ViT: A Scale-Aware, High-Fidelity Patching Approach with Graph Attention for Vision Transformers [0.0]
ビジョントランスフォーマー(ViT)は、イメージパッチ間の複雑なパターンと長距離依存関係をキャプチャするために自己アテンションを活用することで、イメージ分類を再定義している。
ViTsの重要な課題は、階層構造を通じて畳み込みニューラルネットワーク(CNN)に固有のマルチスケールの特徴表現を効率的に組み込むことである。
我々は、CNNのマルチスケール機能、ViTの表現力、グラフ付きパッチ機能を統合し、よりリッチなコンテキスト表現を可能にするスケールアウェアグラフ注意型ViTであるSAG-ViTを提案する。
論文 参考訳(メタデータ) (2024-11-14T13:15:27Z) - T-former: An Efficient Transformer for Image Inpainting [50.43302925662507]
トランスフォーマーと呼ばれる注目に基づくネットワークアーキテクチャのクラスは、自然言語処理の分野で大きなパフォーマンスを示している。
本稿では,Taylorの展開に応じて,解像度に線形に関連付けられた新たな注意を設計し,この注意に基づいて,画像インペイントのためのネットワークである$T$-formerを設計する。
いくつかのベンチマークデータセットの実験により,提案手法は比較的少ないパラメータ数と計算複雑性を維持しつつ,最先端の精度を達成できることが示されている。
論文 参考訳(メタデータ) (2023-05-12T04:10:42Z) - Scalable Visual Transformers with Hierarchical Pooling [61.05787583247392]
本稿では,視覚的トークンを徐々にプールしてシーケンス長を縮小する階層的ビジュアルトランスフォーマ(hvt)を提案する。
計算の複雑さを増すことなく、深さ/幅/解像度/パッチサイズの寸法をスケールすることで、大きなメリットをもたらします。
当社のHVTはImageNetとCIFAR-100データセットの競合ベースラインを上回っています。
論文 参考訳(メタデータ) (2021-03-19T03:55:58Z) - Superpixel Image Classification with Graph Attention Networks [4.714325419968082]
本稿では,グラフニューラルネットワーク(GNN)モデルを用いた画像分類手法を提案する。
入力画像を領域隣接グラフ (RAG) に変換する。
グラフ畳み込みと自己アテンション機構を組み合わせたグラフアテンションネットワーク(GAT)は、他のGNNモデルより優れていることを実験的に示唆している。
論文 参考訳(メタデータ) (2020-02-13T14:52:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。