論文の概要: You Cannot Photograph the Same Street Twice: Reliability Limits in Vision-Language Measurement of Urban Change
- arxiv url: http://arxiv.org/abs/2609.00649v1
- Date: Tue, 01 Sep 2026 03:25:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.26886
- Title: You Cannot Photograph the Same Street Twice: Reliability Limits in Vision-Language Measurement of Urban Change
- Title(参考訳): 同じ街路を撮影できない:都市変化の視覚・言語計測における信頼性の限界
- Authors: Kaizhen Tan,
- Abstract要約: われわれは、アメリカの5つの都市で435のGoogleストリートビューから4,648枚の連続した画対を使っている。
同じ街路の再撮影では、同じ都市の2つの異なる通り間の差の66.5%に相当する知覚スコアが平均0.80ポイント変化している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models are increasingly used to measure urban change from repeated street-level imagery, but their longitudinal reliability is not well understood. We test how much a perception score can change when the street itself does not undergo substantial redevelopment. Using 4,648 consecutive-epoch image pairs from 435 Google Street View standpoints across five US cities, we find that re-photographing the same street changes a perception score by 0.80 points on average, equivalent to 66.5% of the difference between two different streets in the same city. Repeated model calls contribute almost no variation, while image re-encoding and prompt-order changes each account for about one fifth of the between-street difference. Six image statistics describing scattering, contrast, colour, exposure, sharpness and specularity explain almost none of the remaining epoch-to-epoch variation. A small systematic drift of about 0.1 points remains and increases with the interval between captures, consistent with minor physical changes not recorded by redevelopment labels. Controlled experiments further show that acquisition conditions can shift scores when camera and image properties are allowed to vary, and that the direction of these shifts depends on the model. In crowdsourced imagery, camera geometry alone causes a model to report physical change in 45% of identical-scene pairs; normalising both images to a common virtual camera reduces this rate to 7.5%. Despite poor reliability at the individual-location level, aggregation recovers a coherent redevelopment signal: changed streets are judged wealthier, better maintained, more enclosed and less green. These results show that vision-language measurement of urban change is reliable at the scale of hundreds of paired observations, but not at the scale of individual sample points.
- Abstract(参考訳): 視覚言語モデルは、繰り返し行われる街路レベルの画像から都市の変化を測定するためにますます使われているが、その縦方向の信頼性はよく理解されていない。
我々は、街路自体が実質的な再開発を受けていない場合に、どの程度の知覚スコアが変化するかをテストする。
5つの都市で435のGoogleストリートビューから連続して4,648枚の画像ペアを用いて、同じ通りの再撮影では、同じ都市の2つの通りの違いの66.5%に相当する、平均0.80ポイントの認識スコアが変更されている。
繰り返しモデルコールは、ほとんど変化しないが、画像の再エンコーディングとプロンプトオーダは、各アカウントを、ストリート間の差の約5分の1で変更する。
散乱, コントラスト, 色, 露出, 鋭さ, スペキュラリティの6つの画像統計は, 残余のエポックからエポックへの変動をほとんど説明していない。
約0.1点の小さな体系的なドリフトは、再開発ラベルに記録されていない小さな物理的変化と一致して、捕獲間隔とともに増加し続けている。
さらに、制御された実験により、カメラ特性や画像特性の変動が許される場合、取得条件がスコアのシフトを可能とし、これらのシフトの方向がモデルに依存することを示す。
クラウドソース画像では、カメラ幾何学だけで同一シーンのペアの45%に物理的変化を報告し、両方のイメージを共通の仮想カメラに正規化することで、このレートを7.5%に低下させる。
個々の位置レベルでの信頼性は低いが、アグリゲーションはコヒーレントな再開発シグナルを回復させる。
これらの結果から, 都市変動の視覚言語による計測は, 数百対の観測で信頼性が高いが, 個々の試料点では信頼性が低いことがわかった。
関連論文リスト
- Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning [0.12744523252873352]
本稿では,オーストラリアで1,196人を対象に,歩行性評価のデータセットを29,870名導入した。
歩行性知覚のためのユーザ条件付きマルチモーダルディープラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-07T08:07:06Z) - From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting [1.3947005195255644]
既存の研究の多くは、都市景観を静的なものとして扱い、歩行者や車両のような動的要素の役割を無視している。
本研究では,意味的セグメンテーションとMLLM誘導による動的要素の知覚的効果を分離する枠組みを提案する。
我々は、マルチモーダル視覚特徴を用いた11の機械学習モデルを訓練し、照明条件、人間の存在、深度の変化が知覚の変化を導く重要な要因であることを確認した。
論文 参考訳(メタデータ) (2025-12-30T23:21:10Z) - Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning [71.14084801851381]
変更キャプションは、類似した画像間のセマンティックな変化を簡潔に記述することを目的としている。
既存のほとんどの手法は、それらの違いを直接キャプチャし、エラーを起こしやすい特徴を得るリスクを負う。
本稿では,2つの画像表現の対応するチャネルを関連づけるイントラクタ免疫表現学習ネットワークを提案する。
論文 参考訳(メタデータ) (2024-07-16T13:00:33Z) - Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation [58.77994391566484]
W1KPは、画像の集合における可変性の人間の校正尺度である。
最高の知覚距離は、9つの基準線を最大18ポイント精度で上回る。
実際のプロンプトの56の言語的特徴を分析し、プロンプトの長さ、CLIP埋め込みノルム、具体性、単語感覚が最も変動に影響を及ぼすことを示した。
論文 参考訳(メタデータ) (2024-06-12T17:59:27Z) - Self-supervised learning unveils change in urban housing from
street-level images [2.0971479389679337]
Street2Vecは、手動のアノテーションなしで季節や日々の変更に不変ながら、都市構造を組み込む。
ロンドンの住宅供給の点レベルの変化をストリートレベルの画像から特定し、主要な変化とマイナーな変化を区別した。
この能力は、より活気があり、公平で持続可能な都市に向けた都市計画や政策決定のためのタイムリーな情報を提供することができる。
論文 参考訳(メタデータ) (2023-09-20T14:35:23Z) - MSR: Making Self-supervised learning Robust to Aggressive Augmentations [98.6457801252358]
本稿では,弱いペアと攻撃的なペアの役割のバランスをとることによって,意味変化の影響に対処する新たなSSLパラダイムを提案する。
我々は,BYOLを2.5%改善したResNet-50を200エポックとして,ImageNet-1Kで73.1%のTop-1精度を実現したことを示す。
論文 参考訳(メタデータ) (2022-06-04T14:27:29Z) - Semantic Pose Verification for Outdoor Visual Localization with
Self-supervised Contrastive Learning [0.0]
我々は視覚的ローカライゼーションを改善するためにセマンティックコンテンツを利用する。
このシナリオでは、データベースはパノラマ画像から生成されたグノーモニックビューで構成されている。
我々は、セグメンテーションされた画像のデータセット上で、コントラスト学習を行い、自己教師型でCNNを訓練する。
論文 参考訳(メタデータ) (2022-03-31T11:09:38Z) - With a Little Help from My Friends: Nearest-Neighbor Contrastive
Learning of Visual Representations [87.72779294717267]
対比損失で最も近い隣り合わせを正として使用すると、ImageNet分類でパフォーマンスが大幅に向上します。
提案手法が複雑なデータ拡張に依存しないことを実証的に証明する。
論文 参考訳(メタデータ) (2021-04-29T17:56:08Z) - Unsupervised Landmark Learning from Unpaired Data [117.81440795184587]
教師なしランドマーク学習の最近の試みは、外観は似ているがポーズでは異なる合成画像対を活用する。
本稿では,2回スワッピング・リコンストラクション・ストラテジーを適用して最終監視を行うクロスイメージ・サイクル整合性フレームワークを提案する。
提案するフレームワークは,強いベースラインを大きなマージンで上回ることを示す。
論文 参考訳(メタデータ) (2020-06-29T13:57:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。