論文の概要: Vision Models Predict Urban Scene Appraisal with Limited Neural Alignment
- arxiv url: http://arxiv.org/abs/2608.30964v1
- Date: Mon, 31 Aug 2026 15:28:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.481885
- Title: Vision Models Predict Urban Scene Appraisal with Limited Neural Alignment
- Title(参考訳): 限定的なニューラルアライメントによる都市景観評価予測モデル
- Abstract要約: 高い予測精度は、事前訓練された視覚埋め込みが、人間の知覚のようにシーンを整理することを証明しない。
我々は、時間とともにシーンの表現幾何学、説明可能な幾何学の比率、および17の特徴空間との対応性を推定する。
同じ埋め込みによる評価評価は、r = 0.87まで良好に予測され、2つの測度はモデル間では追跡されない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretrained vision embeddings are increasingly used as general-purpose representations for modelling how people appraise urban scenes, and are validated almost entirely by how well they predict human ratings. High predictive accuracy does not establish that these embeddings organise scenes as human perception does. We test the two properties separately against brain data. Using openly released EEG from 63 adults who viewed and rated 56 Berlin street scenes, we estimate the representational geometry of the scenes over time, the proportion of that geometry that is explainable at all, and its correspondence with seventeen feature spaces spanning language-supervised, self-supervised, category-supervised and dense-prediction training, two orders of magnitude of scale, and interpretable controls. Correspondence is low throughout: the best representation, DINOv2 ViT-B, reaches 29.6% of the lower bound of the noise ceiling, the panel spans 11.0% to 29.6%, and a Gabor energy descriptor is indistinguishable from the best model while outperforming every language-supervised model tested. Within a model, deeper layers still match later neural responses, so the hierarchical correspondence found for object recognition survives even at this low overall level. The same embeddings predict held-out appraisal ratings well, up to r = 0.87, and the two measures do not track each other across models; reweighting features towards the neural geometry lowers appraisal prediction for every model tested, against a control of matched dimensionality. Predicting how a street is appraised is therefore weak evidence that a model represents the street as the brain does. The benchmark uses only public data and requires no training, so evaluating a new representation needs only its embeddings for 55 images.
- Abstract(参考訳): 事前訓練された視覚埋め込みは、人々が都市景観を評価する方法をモデル化するための汎用的な表現として利用され、人間の評価の精度によってほぼ完全に検証される。
高い予測精度は、これらの埋め込みが人間の知覚のようにシーンを整理することを証明していない。
脳データに対して2つの特性を別々にテストする。
ベルリンの56の街路シーンを観、評価した63人の大人の脳波を用いて、時間とともにシーンの表現的幾何学、説明可能な幾何学の比率、言語指導、自己監督、カテゴリー監督、密接な予測訓練、2桁のスケール、解釈可能な制御を含む17の特徴空間との対応を推定した。
最高の表現であるDINOv2 ViT-Bは、ノイズ天井の下限の29.6%に達し、パネルは11.0%から29.6%まで広がり、ガボルエネルギー記述子は、テスト対象の全ての言語モデルを上回る性能を保ちながら、最良のモデルと区別できない。
モデル内では、深い層が後の神経反応と一致しているため、物体認識の階層的な対応は、この低い全体レベルでも生き残る。
同じ埋め込みによる評価評価は、r = 0.87まで良好に予測され、2つの測度はモデル間では追跡されず、ニューラルジオメトリーに対する再重み付けは、一致する次元の制御に対して、テストされたすべてのモデルに対する評価予測を低下させる。
したがって、どのように道路が評価されるかを予測することは、モデルが脳と同じように街路を表すという弱い証拠である。
ベンチマークは公開データのみを使用し、トレーニングを必要としないため、新しい表現を評価するには55の画像にのみ埋め込みが必要である。
関連論文リスト
- Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization [0.0]
人間の解釈をいかに忠実に捉えているかを測定するために,表現精度を導入する。
我々は,保留行動予測のプロトタイプベンチマークで仕様を評価する。
我々は、表現精度はリコールと異なるものであり、人間とAIのアライメントは、ユーザがどれだけ正確に表現されているかに依存していると結論づける。
論文 参考訳(メタデータ) (2026-05-27T18:18:54Z) - Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale [40.31924374728614]
プラトン表現仮説(Platonic Representation hypothesis)は、異なるモダリティで訓練されたニューラルネットワークが一致し、最終的に同じ現実の表現に向かって収束することを示唆している。
この仮説の実験的証拠は脆弱であり, 評価体制に大きく依存していることが示唆された。
論文 参考訳(メタデータ) (2026-04-20T17:56:02Z) - Non-identifiability of Explanations from Model Behavior in Deep Networks of Image Authenticity Judgments [0.07161783472741748]
ディープニューラルネットワークは人間の判断を予測できるが、これは人間のような情報に依存したり、それらの判断の根底にある手がかりを明らかにすることを意味するものではない。
我々は、人間の信頼性評価を予測するモデルが、アーキテクチャ内およびアーキテクチャ間で一貫した説明をもたらすかどうかを検証した。
深層ネットワークは人間の正当性判断を適切に予測できるが、それらの判断に対して識別可能な説明は得られない、と結論付けている。
論文 参考訳(メタデータ) (2026-04-08T16:15:08Z) - Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework [0.31497178896386996]
HUMAINEは人間とAIの相互作用を多次元、人口統計学的に把握するフレームワークである。
我々は5つの人間中心次元にわたる28の最先端モデルを評価する。
論文 参考訳(メタデータ) (2026-02-03T09:51:47Z) - Visual Affect Analysis: Predicting Emotions of Image Viewers with Vision-Language Models [2.2023261946811563]
視覚言語モデル(VLM)は、スケールでの視覚刺激の影響を推測するためのツールである。
我々は、最新のプロプライエタリモデルからオープンソースモデルまで、9つのVLMを心理測定で検証された3つの感情イメージデータセットでベンチマークした。
論文 参考訳(メタデータ) (2026-01-27T17:56:21Z) - Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test [62.17144846428715]
我々は、Embodied Turing Testベンチマーク: WoW-World-Eval (Wow,wo,val)を紹介する。
Wow-wo-valは知覚、計画、予測、一般化、実行の5つのコア能力を調べる。
Inverse Dynamic Model Turing Testでは、まずIMMを用いて、実世界におけるビデオ基盤モデルの実行精度を評価する。
論文 参考訳(メタデータ) (2026-01-07T17:50:37Z) - PoseBench: Benchmarking the Robustness of Pose Estimation Models under Corruptions [57.871692507044344]
ポース推定は、単眼画像を用いて人や動物の解剖学的キーポイントを正確に同定することを目的としている。
現在のモデルは一般的に、クリーンなデータに基づいてトレーニングされ、テストされる。
実世界の腐敗に対するポーズ推定モデルの堅牢性を評価するためのベンチマークであるPoseBenchを紹介する。
論文 参考訳(メタデータ) (2024-06-20T14:40:17Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z) - Utilizing Self-supervised Representations for MOS Prediction [51.09985767946843]
既存の評価は通常、クリーンな参照または平行な地上真実データを必要とする。
一方、主観的テストは、追加のクリーンデータや並列データを必要としず、人間の知覚とよりよく相関する。
基礎的真理データを必要とせず,人間の知覚とよく相関する自動評価手法を開発した。
論文 参考訳(メタデータ) (2021-04-07T09:44:36Z) - Visual Distant Supervision for Scene Graph Generation [66.10579690929623]
シーングラフモデルは通常、大量のラベル付きデータを人間のアノテーションで教師付き学習する必要がある。
本研究では,人間ラベルデータを用いずにシーングラフモデルを訓練できる視覚関係学習の新しいパラダイムである視覚遠方監視を提案する。
包括的な実験結果から、我々の遠隔監視モデルは、弱い監督と半監督のベースラインよりも優れています。
論文 参考訳(メタデータ) (2021-03-29T06:35:24Z) - Visually Grounded Compound PCFGs [65.04669567781634]
言語理解のための視覚的基盤の爆発は、最近多くの注目を集めている。
本研究では,視覚的な文法誘導について検討し,未ラベルテキストとその視覚的キャプションから選挙区を学習する。
論文 参考訳(メタデータ) (2020-09-25T19:07:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。