論文の概要: Texture Representations in Deep Vision Models: Comparing CNNs, Vision Transformers, and Human Perception
- arxiv url: http://arxiv.org/abs/2607.08321v1
- Date: Thu, 09 Jul 2026 10:05:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.498724
- Title: Texture Representations in Deep Vision Models: Comparing CNNs, Vision Transformers, and Human Perception
- Title(参考訳): 深部視覚モデルにおけるテクスチャ表現:CNN, 視覚変換器, 人間の知覚の比較
- Authors: Ludovica de Paolis, Marco Baroni, Alessandro Laio, Eugenio Piasini,
- Abstract要約: 本研究は、視覚の別の側面であるテクスチャ知覚に焦点を当てる。
同じソース画像から3つの異なるアルゴリズムで生成される複雑さのテクスチャについて考察する。
テクスチャの表現は異なるViTで一致しているが、ViTとCNNでは一致しない。
- 参考スコア(独自算出の注目度): 45.62648262593701
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In computational vision science, Convolutional Neural Networks (CNNs) have emerged as a popular model of biological vision because of the alignment they can exhibit with neural and behavioral data in humans and animals. However, it remains unclear to what extent this alignment persists for visual tasks that extend beyond the canonical object recognition paradigm based on well defined semantic content. In this study, we diverge from the common object-centric view by focusing on another aspect of vision: texture perception. We consider textures of different complexity generated with three different algorithms from the same source images. Using a rank-based statistic, we quantify the information encoded in the internal representations of a CNN and three Vision Transformers (ViTs), and we compare the similarity of these representations to those inferred from human psychophysics data. We find that the representation of textures is aligned in different ViTs, but not between the ViTs and the CNN; that ViTs form similar representations for textures of different complexity; that human performance in recognizing textures can be better predicted from ViTs representations rather than CNN representations. Taken together, these results suggest that ViTs may capture more faithfully than CNNs how texture patterns are visually processed by humans, and that the representations of texture stimuli in computational models may be driven by the network architecture.
- Abstract(参考訳): コンピュータビジョン科学において、畳み込みニューラルネットワーク(CNN)は、人間や動物の神経的・行動的データとのアライメントによって、生物視覚の一般的なモデルとして登場した。
しかし、このアライメントが、明確に定義されたセマンティックコンテンツに基づいて、標準的なオブジェクト認識パラダイムを超えて拡張される視覚的タスクに対してどの程度持続するかは、まだ不明である。
本研究では,視覚の他の側面であるテクスチャ知覚に焦点をあてることで,共通の対象中心の視点から逸脱する。
同じソース画像から3つの異なるアルゴリズムで生成される複雑さのテクスチャについて考察する。
ランクに基づく統計データを用いて、CNNと3つの視覚変換器(ViT)の内部表現に符号化された情報を定量化し、これらの表現の類似性を人間の心理物理学データから推定した情報と比較する。
テクスチャの表現は、異なる ViT と CNN で一致しているが、ViT と CNN では一致しない。
これらの結果は, テクスチャパターンが人間によって視覚的に処理されるCNNよりも, ViTsの方が忠実に捉えられる可能性を示し, コンピュータモデルにおけるテクスチャ刺激の表現はネットワークアーキテクチャによって駆動される可能性があることを示唆している。
関連論文リスト
- Perceptual misalignment of texture representations in convolutional neural networks [3.68986335765876]
多様な畳み込みニューラルネットワーク(CNN)のために計算された特徴相関による知覚内容の比較を行う。
視覚システムのモデルとしての従来のCNN品質尺度と人間のテクスチャ知覚との関連性は見つからない。
我々は、テクスチャ認識は、物体認識に基づいて訓練されたCNNに基づいて、一般的にモデル化されるものと異なるメカニズムを伴っていると結論付けた。
論文 参考訳(メタデータ) (2026-04-01T19:51:45Z) - A Comparative Survey of Vision Transformers for Feature Extraction in Texture Analysis [9.687982148528187]
畳み込みニューラルネットワーク(CNN)は現在、最高のテクスチャ分析アプローチの1つである。
視覚変換器(ViT)は、物体認識などのタスクにおいてCNNの性能を上回っている。
この研究は、テクスチャに依存するタスクに移行する際に、事前訓練された様々なViTアーキテクチャを探索する。
論文 参考訳(メタデータ) (2024-06-10T09:48:13Z) - Connecting metrics for shape-texture knowledge in computer vision [1.7785095623975342]
深層ニューラルネットワークは、人間が画像の分類ミスを起こさないような、画像の多くの変化の影響を受けやすいままである。
この異なる振る舞いの一部は、視覚タスクで人間とディープニューラルネットワークが使用する機能の種類によって説明できるかもしれない。
論文 参考訳(メタデータ) (2023-01-25T14:37:42Z) - What do Vision Transformers Learn? A Visual Exploration [68.50771218442776]
視覚変換器(ViT)はコンピュータビジョンのデファクトアーキテクチャとして急速に普及しつつある。
本稿では、ViT上での可視化の障害に対処し、ViTとCNNの根本的な相違について検討する。
また、DeiT、CoaT、ConViT、PiT、Swin、Twinなど、さまざまなViT変種に対して大規模な可視化を行っています。
論文 参考訳(メタデータ) (2022-12-13T16:55:12Z) - Prune and distill: similar reformatting of image information along rat
visual cortex and deep neural networks [61.60177890353585]
深部畳み込み神経ネットワーク(CNN)は、脳の機能的類似、視覚野の腹側流の優れたモデルを提供することが示されている。
ここでは、CNNまたは視覚野の内部表現で知られているいくつかの顕著な統計的パターンについて考察する。
我々は、CNNと視覚野が、オブジェクト表現の次元展開/縮小と画像情報の再構成と、同様の密接な関係を持っていることを示す。
論文 参考訳(メタデータ) (2022-05-27T08:06:40Z) - Do Vision Transformers See Like Convolutional Neural Networks? [45.69780772718875]
近年の研究では、画像分類タスクにおいて、(Vision) Transformer Model (ViT) が同等またはそれ以上の性能を達成できることが示されている。
畳み込みネットワークのように振る舞うのか、それとも全く異なる視覚表現を学ぶのか?
例えば、ViTはすべての層にわたってより均一な表現を持つ。
論文 参考訳(メタデータ) (2021-08-19T17:27:03Z) - Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。
我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。
ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文 参考訳(メタデータ) (2021-05-21T17:59:18Z) - Neural Body: Implicit Neural Representations with Structured Latent
Codes for Novel View Synthesis of Dynamic Humans [56.63912568777483]
本稿では,人間の演奏者に対する新しい視点合成の課題について,カメラビューの少なさから考察する。
異なるフレームで学習されたニューラルネットワーク表現が、変形可能なメッシュにアンカーされた同じ遅延コードセットを共有することを前提とした新しい人体表現であるNeural Bodyを提案する。
ZJU-MoCapの実験により、我々の手法は、新規なビュー合成品質において、先行研究よりも優れた性能を示した。
論文 参考訳(メタデータ) (2020-12-31T18:55:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。