論文の概要: Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images
- arxiv url: http://arxiv.org/abs/2607.08932v1
- Date: Thu, 09 Jul 2026 21:00:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.738196
- Title: Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images
- Title(参考訳): 視覚変換器は自然画像からゲシュタルトのようなフィギュアグラウンドキュースを学習する
- Authors: Matthias Tangemann, Benjamin Lo, Zygmunt Pizlo, Kaleem Siddiqi, Dirk B. Walther, Sven Dickinson,
- Abstract要約: 視覚変換器(ViT)における形状に基づく図形構造の評価
ViTは囲いと凸性を符号化し、自然画像で訓練されたプローブはゼロショットを人工刺激に一般化する。
対称性について、我々は混合の結果を観察する: キューは均一に色付けされるが、テクスチャ化された領域には適用されない。
- 参考スコア(独自算出の注目度): 4.927738810841049
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Figure-ground organization in the human visual system relies on several shape-based cues, including surroundedness, convexity, and symmetry. While these cues have been extensively studied using abstract stimuli, little is known about how they operate under natural conditions or how they arise from the statistics of natural scenes. Deep neural networks offer a promising path forward: a model that relies on the same figure-ground cues as humans would provide tractable experimental access to the underlying mechanisms. In this study, we evaluate shape-based figure-ground organization in Vision Transformers (ViTs), for which prior work has demonstrated the emergence of object-based grouping. We test 25 ViTs spanning supervised and self-supervised training objectives, by fitting linear probes to predict figure-ground assignment from intermediate patch representations using both natural images and controlled artificial stimuli that isolate individual cues. Our results show that ViTs robustly encode surroundedness and convexity, and that probes trained on natural images generalize zero-shot to artificial stimuli across several models. For symmetry we observe mixed results: the cue is encoded for uniformly colored but not for textured regions. Taken together, our findings demonstrate that Gestalt-like figure-ground cues can be learned from natural scene statistics and position ViTs as a compelling model system for studying the computational mechanisms of perceptual organization. Code and data is available at https://github.com/mtangemann/mlvbench
- Abstract(参考訳): 人間の視覚系における図形の組織は、囲い、凸性、対称性を含むいくつかの形状に基づく手がかりに依存している。
これらの手がかりは抽象的な刺激を用いて広く研究されてきたが、自然条件下でどのように機能するか、あるいは自然の場面の統計からどのように発生するのかは分かっていない。
ディープ・ニューラル・ネットワークは、人間と同じフィギュア・グラウンド・キューに依存しているモデルが、基礎となるメカニズムへの牽引可能な実験的アクセスを提供するという、将来有望な道のりを提供する。
本研究では,視覚変換器(ViTs)における形状に基づく図形構造の評価を行い,それ以前の研究がオブジェクトベースグルーピングの出現を実証した。
自然画像と個別の手がかりを分離する制御された人工刺激の両方を用いて、中間的なパッチ表現から図形の割り当てを予測するために線形プローブを装着することにより、教師付きおよび自己教師型訓練目標にまたがる25個のViTをテストする。
以上の結果から,VTは囲いと凸性を強固にエンコードし,自然画像上で訓練されたプローブは,複数のモデルにおいてゼロショットから人工刺激への一般化を図っている。
対称性について、我々は混合結果を観察する: キューは均一に色付けされるが、テクスチャ化された領域には適用されない。
本研究は,自然景観の統計からゲシュタルト様図形的手がかりを学習できることを示すとともに,知覚組織の計算機構を研究するための説得力のあるモデルシステムとしてViTsを位置づけた。
コードとデータはhttps://github.com/mtangemann/mlvbenchで公開されている。
関連論文リスト
- Human-level 3D shape perception emerges from multi-view learning [63.048728487674815]
任意のオブジェクトに対する人間の3次元形状推論を予測するためのモデリングフレームワークを開発する。
我々は、自然主義的な知覚データよりも視覚空間的目的を用いて訓練された新しいニューラルネットワークのクラスでこれを達成した。
人間のレベル3D知覚は、自然主義的な視覚空間データよりもシンプルでスケーラブルな学習目標から生まれる可能性がある。
論文 参考訳(メタデータ) (2026-02-19T18:56:05Z) - A neuromorphic model of the insect visual system for natural image processing [0.8602553195689513]
昆虫の視覚は、連想学習、ナビゲーション、物体検出などの複雑な行動をサポートする。
本稿では,高密度な視覚入力をスパースな識別符号に変換するバイオインスパイアされた視覚モデルを提案する。
花認識タスクと自然画像ベンチマークにおける結果の表現性を評価する。
論文 参考訳(メタデータ) (2026-02-06T05:54:28Z) - Synthesis and Perceptual Scaling of High Resolution Naturalistic Images Using Stable Diffusion [0.43748379918040853]
段階的遷移を特徴とする光リアル画像の刺激セットを作成する。
各オブジェクトシーンに対して、知覚連続体に沿って順序付けられた10の変種を生成する。
この順序付けは、作業記憶実験における刺激の難解性も予測できる。
論文 参考訳(メタデータ) (2024-10-16T20:49:19Z) - Neural Rendering of Humans in Novel View and Pose from Monocular Video [68.37767099240236]
本稿では,新しい視点下で写真リアルな人間を生成し,モノクロ映像を入力として提示する新しい手法を提案する。
提案手法は,モノクラー映像を入力として,見知らぬポーズや新しい視点下での既存手法よりも優れていた。
論文 参考訳(メタデータ) (2022-04-04T03:09:20Z) - Scene Synthesis via Uncertainty-Driven Attribute Synchronization [52.31834816911887]
本稿では,3次元シーンの多様な特徴パターンを捉えるニューラルシーン合成手法を提案する。
提案手法は,ニューラルネットワークと従来のシーン合成手法の双方の長所を結合する。
論文 参考訳(メタデータ) (2021-08-30T19:45:07Z) - Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。
我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。
ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文 参考訳(メタデータ) (2021-05-21T17:59:18Z) - Appearance Consensus Driven Self-Supervised Human Mesh Recovery [67.20942777949793]
単眼画像から人間のポーズや形状を推定する自己教師付きメッシュ回復フレームワークを提案する。
標準モデルに基づく3次元ポーズ推定ベンチマークの最先端結果を得る。
その結果、色付きメッシュ予測により、ポーズや形状推定以外にも、さまざまな外観関連タスクにフレームワークの使用が開放される。
論文 参考訳(メタデータ) (2020-08-04T05:40:39Z) - Seeing eye-to-eye? A comparison of object recognition performance in
humans and deep convolutional neural networks under image manipulation [0.0]
本研究では,ヒトとフィードフォワードニューラルネットワークの視覚コア物体認識性能の行動比較を目的とした。
精度分析の結果、人間はDCNNを全ての条件で上回るだけでなく、形状や色の変化に対する強い堅牢性も示している。
論文 参考訳(メタデータ) (2020-07-13T10:26:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。