論文の概要: Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures
- arxiv url: http://arxiv.org/abs/2607.17138v1
- Date: Sun, 19 Jul 2026 08:50:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.37975
- Title: Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures
- Title(参考訳): ヒューマンライクな知覚的錯覚表現をアーキテクチャ全体で表現するモデル
- Abstract要約: 自然画像に基づいてトレーニングされたディープニューラルネットワークは、明るさの錯覚のために人間の観察者と一致した出力を生成する。
視覚モデルでは、特定の内部層において錯覚に敏感な表現が発達することを示す。
このような表現を知覚ファントム(perceptual phantoms)と呼び、内部処理においてアクティブでありながら、出力に基づく評価には見えない。
- 参考スコア(独自算出の注目度): 1.0742675209112622
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep neural networks trained on natural images are shown to produce outputs consistent with human observers for brightness illusions. While this phenomenon has been documented across architectures, all evidence, to date, is measured at the output level: restored pixels, decoded trajectories, or classification decisions. Whether these models actually represent illusions internally, and if so where and how, remains unknown. We show that denoising models develop illusion-sensitive representations at specific internal layers, across varied architectures. Specifically, we identify the layers and channels that discriminate illusory from physically matched control regions. We show that the denoising objective is a more important driver of the effect than the architecture. On domain-appropriate stimuli, these activations track a validated psychophysical model of human brightness perception (FLODOG; Spearman $ρ\geq 0.70$) and scale monotonically with parametric illusion strength. Leveraging these findings, we provide causal evidence via channel ablation showing that illusion-sensitive channels specifically and substantially affect the internal signal. Yet injecting these representations into the generation pipeline produces no measurable pixel shift across all tested architectures; we term such representations perceptual phantoms: active in internal processing yet invisible to any output-based evaluation. While related internal-output dissociations have been characterized in language models, this is the first such characterization for perceptual representations in denoising vision models.
- Abstract(参考訳): 自然画像に基づいてトレーニングされたディープニューラルネットワークは、明るさの錯覚のために人間の観察者と一致した出力を生成する。
この現象はアーキテクチャ全体で文書化されているが、これまでのすべての証拠は、復元されたピクセル、デコードされた軌跡、分類決定といった出力レベルで測定されている。
これらのモデルが実際に内部で錯覚を表現しているかどうか、そしてそれがどこでどのようにあるのかは、いまだに不明である。
視覚モデルでは、特定の内部層において、様々なアーキテクチャで錯覚に敏感な表現が発達していることが示される。
具体的には、物理的に一致した制御領域から照明を識別する層とチャネルを同定する。
アーキテクチャよりもデノベーションの目的が,その効果のより重要な要因であることを示す。
ドメイン固有刺激では、これらのアクティベーションは人間の明るさ知覚の検証された心理物理学モデル(FLODOG; Spearman $ρ\geq 0.70$)を追跡し、パラメトリックイリュージョン強度で単調にスケールする。
これらの知見を生かして、錯覚感受性チャネルが内部信号に特異的かつ実質的に影響を及ぼすことを示すチャンネルアブレーションによる因果的証拠を提供する。
しかし、これらの表現を生成パイプラインに注入すると、全てのテストされたアーキテクチャ間で測定可能なピクセルシフトは生じない。
関連する内部出力の解離は言語モデルで特徴づけられているが、視覚モデルに知覚的表現が現れるのはこれが初めてである。
関連論文リスト
- Self-supervised Hierarchical Visual Reasoning with World Model [82.64295546475257]
対戦相手を持つ3Dオープンワールド環境は、強化学習における中核的な課題である。
階層型世界モデルであるResDreamerを提案し、各上位層をトレーニングし、下層の残余を再構築する。
この設計は、ますます洗練された世界力学の進歩的な抽象化を可能にし、よりリッチな潜在表現の出現を促進する。
論文 参考訳(メタデータ) (2026-05-17T16:42:42Z) - Human-level 3D shape perception emerges from multi-view learning [63.048728487674815]
任意のオブジェクトに対する人間の3次元形状推論を予測するためのモデリングフレームワークを開発する。
我々は、自然主義的な知覚データよりも視覚空間的目的を用いて訓練された新しいニューラルネットワークのクラスでこれを達成した。
人間のレベル3D知覚は、自然主義的な視覚空間データよりもシンプルでスケーラブルな学習目標から生まれる可能性がある。
論文 参考訳(メタデータ) (2026-02-19T18:56:05Z) - From Images to Perception: Emergence of Perceptual Properties by Reconstructing Images [1.77513002450736]
網膜-V1大脳皮質のいくつかの既知の事実に対応するバイオインスパイアされたアーキテクチャであるPerceptNetは、画像再構成に関連するさまざまなタスクにエンドツーエンドで最適化されている。
以上の結果から,エンコーダの段階は画像歪みに対する人間の知覚的判断と一貫した相関を示すことがわかった。
論文 参考訳(メタデータ) (2025-08-14T08:37:30Z) - Towards Understanding Text Hallucination of Diffusion Models via Local Generation Bias [76.85949078144098]
本稿では,拡散モデルが個々のシンボルを正しく生成するが,それらを意味のない方法で組み立てるテキスト幻覚に焦点を当てる。
このような現象は,ネットワークの局所的生成バイアスに起因すると考えられる。
また、ハイパーキューブ上の2層学習パリティポイントを含む特定のケースのトレーニングダイナミクスを理論的に解析する。
論文 参考訳(メタデータ) (2025-03-05T15:28:50Z) - Towards Understanding Depth Perception in Foveated Rendering [8.442383621450247]
立体視の深度知覚にフェーベレートレンダリングが与える影響を調べた最初の評価を行った。
我々の分析では、立体視力は高レベルの周囲のぼかしの影響を受けていない(あるいは改善されている)ことが示されている。
以上の結果から, 卵胞形成は立体視の深度知覚に影響を与えず, 立体視は一般的に使用されるよりも2倍強い卵胞形成を伴わないことが示唆された。
論文 参考訳(メタデータ) (2025-01-28T16:06:29Z) - When Does Perceptual Alignment Benefit Vision Representations? [76.32336818860965]
視覚モデル表現と人間の知覚的判断との整合がユーザビリティに与える影響について検討する。
モデルと知覚的判断を一致させることで、多くの下流タスクで元のバックボーンを改善する表現が得られることがわかった。
その結果,人間の知覚的知識に関する帰納バイアスを視覚モデルに注入することは,より良い表現に寄与することが示唆された。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - Factorized Diffusion Architectures for Unsupervised Image Generation and
Segmentation [24.436957604430678]
本研究では,非教師付き拡散モデルとして訓練されたニューラルネットワークアーキテクチャを,画像の生成とセグメント分割の両面から同時に学習する。
実験により,複数のデータセットにまたがって,高精度な教師なし画像分割と高品質な合成画像生成を実現することができた。
論文 参考訳(メタデータ) (2023-09-27T15:32:46Z) - The role of noise in denoising models for anomaly detection in medical
images [62.0532151156057]
病理脳病変は脳画像に多彩な外観を示す。
正規データのみを用いた教師なし異常検出手法が提案されている。
空間分解能の最適化と雑音の大きさの最適化により,異なるモデル学習体制の性能が向上することを示す。
論文 参考訳(メタデータ) (2023-01-19T21:39:38Z) - Human Eyes Inspired Recurrent Neural Networks are More Robust Against Adversarial Noises [7.689542442882423]
我々は人間の脳にインスパイアされたデュアルストリーム視覚モデルを設計した。
このモデルは網膜のような入力層を特徴とし、次の焦点(固定点)を決定する2つのストリームと、固定点を取り巻く視覚を解釈する2つのストリームを含む。
このモデルを,物体認識,視線行動,対向強靭性の観点から評価した。
論文 参考訳(メタデータ) (2022-06-15T03:44:42Z) - Stereopagnosia: Fooling Stereo Networks with Adversarial Perturbations [71.00754846434744]
知覚不能な加法的摂動は,差分マップを著しく変更できることを示す。
敵データ拡張に使用すると、我々の摂動はより堅牢なトレーニングされたモデルをもたらすことを示す。
論文 参考訳(メタデータ) (2020-09-21T19:20:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。