論文の概要: Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View
- arxiv url: http://arxiv.org/abs/2606.07642v1
- Date: Mon, 01 Jun 2026 18:46:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.178191
- Title: Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View
- Title(参考訳): 車いすのアクセシビリティ評価のためのスケーラブルなエキスパートガイドデザイン
- Authors: Dongdong Wang, Alina Hagen, Isabelle Gatmaitan, Hao Zhou, Yiwen Dong, Shabboo Valipoor, Vivian W. H. Wong, Lingyao Li,
- Abstract要約: 本稿では,Googleストリートビューの画像から視覚言語モデル(VLM)がアクセシビリティ障壁を識別できるかどうかを検討する。
本稿では, アクセシビリティ次元を評価するために, GSV画像, ADAインフォームドガイダンス, およびエキスパート由来のルーリックを組み合わせた, エキスパート誘導型検索拡張フレームワークを提案する。
- 参考スコア(独自算出の注目度): 8.943780916614612
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Assessing built-environment interaction, such as wheelchair accessibility, is difficult because real-world mobility is shaped by distributed, context-dependent, and temporary barriers that are hard to capture at scale. To support scalable assessment, this paper examines whether vision-language models (VLMs) can identify accessibility barriers from Google Street View (GSV) imagery. We propose an expert-guided retrieval-augmented framework that combines GSV images, ADA-informed guidance, and expert-derived rubrics to evaluate accessibility dimensions. We collect a campus-scale dataset at the University of Florida, linking 407 unique GSV locations with GPS-derived wheelchair dwell behavior as a mobility-friction signal. Results show that VLM ratings are both negatively correlated and distributionally similar with dwell time, indicating partial but consistent alignment with a behavioral proxy for mobility friction. Visual cue analysis shows that certain environmental objects, such as curb ramps and crosswalks, are associated with higher VLM accessibility scores, while alignment remains limited for subtle surface conditions, transient obstructions, and viewpoint-dependent barriers. Overall, our findings show the potential of expert-guided VLMs for scalable accessibility assessment aligning with sensor-derived indicators of real-world wheelchair navigation.
- Abstract(参考訳): 車椅子のアクセシビリティなどの環境との相互作用を評価することは、現実のモビリティは、大規模に捉えるのが難しい分散、コンテキスト依存、一時的な障壁によって形成されているため困難である。
スケーラブルな評価を支援するために,Googleストリートビュー(GSV)画像から視覚言語モデル(VLM)がアクセシビリティ障壁を識別できるかどうかを検討する。
本稿では, アクセシビリティ次元を評価するために, GSV画像, ADAインフォームドガイダンス, およびエキスパート由来のルーリックを組み合わせた, エキスパート誘導型検索拡張フレームワークを提案する。
フロリダ大学のキャンパススケールのデータセットを収集し、407箇所のGSV位置とGPSによる車椅子の居住行動をモビリティフリクション信号として結びつけた。
以上の結果から, VLM 評価は負の相関関係があり, 分布は居住時間と類似しており, 移動摩擦の行動プロキシと部分的だが一貫した一致を示した。
視覚的キュー解析により、縁石ランプや横断歩道のような特定の環境オブジェクトは、高いVLMアクセシビリティスコアと関連し、一方アライメントは微妙な表面条件、過渡的な障害物、視点に依存した障壁に制限されていることが示された。
以上の結果から,現実の車いすナビゲーションのセンサインジケータに適合した,スケーラブルなアクセシビリティ評価のための専門家誘導型VLMの可能性が示唆された。
関連論文リスト
- Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study [0.5599792629509229]
自律運転における再同定は、一般的に視覚的マッチング問題として定式化され、車、歩行者、サイクリストの観察が時間、フレーム、カメラビューを通して関連付けられている。
本稿では,VLM(Vision-Language Models)を用いたゼロショットパイプラインのベースラインスタディを提案し,検出された交通参加者のテキスト記述を生成する。
ゼロショットのセマンティック記述は効果的なオブジェクト再識別をサポートし、教師付きCNNベースラインに匹敵する検索性能を実現する。
論文 参考訳(メタデータ) (2026-06-08T11:35:34Z) - Cross-View Urban Traffic Dataset: Drone-Supervised Ground Truth for Monocular Bird's-Eye View Localization [0.3001251717100776]
我々は,エゴ中心の自転車映像と実際の都市交差点で録画された空中ドローン映像から構築された都市交通知覚のデータセットとベンチマークを紹介する。
このベンチマークは、ストリートビューとドローンビューのオブジェクトトラック間のクロスビューアイデンティティマッチングと、航空監視を用いたエゴ・ツー・バードの目視予測の2つの関連タスクをターゲットにしている。
論文 参考訳(メタデータ) (2026-06-05T11:01:42Z) - VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training [52.05483137072975]
Universal Manipulation Interface (UMI)は、ハードウェア固有の遠隔操作なしでスケーラブルな実世界のロボットデータ収集を可能にする。
VISTAは、この2つのギャップを3つの相乗的コンポーネントを通して橋渡しするフレームワークである。
我々は,物理検証パイプライン,UMI-VQA,検証された軌道データ,コミュニティのための事前学習モデルをリリースする。
論文 参考訳(メタデータ) (2026-06-03T10:38:45Z) - Benchmarking Egocentric Visual-Inertial SLAM at City Scale [50.1245744173948]
本稿では,エゴセントリックなマルチモーダルデータを用いた視覚慣性SLAMのための新しいデータセットとベンチマークを提案する。
我々は、様々なセンサーを備えたメガネのような装置で、市内の中心部を何時間、何キロもの軌跡を記録している。
アカデミックによって開発された最先端のシステムは、これらの課題に対して堅牢ではないことを示し、これに責任を負うコンポーネントを特定します。
論文 参考訳(メタデータ) (2025-09-30T17:59:31Z) - LLM-Guided Indoor Navigation with Multimodal Map Understanding [1.5325823985727567]
屋内地図画像からコンテキスト対応ナビゲーションインストラクションを生成するための大規模言語モデル(LLM)、すなわちChatGPTの可能性を探る。
以上の結果から,パーソナライズされた屋内ナビゲーションを支援するLLMが,平均86.59%,最大97.14%の正答率を持つ可能性が示唆された。
これらの結果は、AI駆動ナビゲーションと補助技術に重要な意味を持つ。
論文 参考訳(メタデータ) (2025-03-12T09:32:43Z) - Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives [56.528835143531694]
視覚言語モデル(VLM)を評価するために設計されたベンチマークデータセットであるDriveBenchを紹介する。
以上の結果から, VLMは視覚的接地ではなく, 一般的な知識やテキストの手がかりから得られる, もっともらしい応答をしばしば生み出すことが明らかとなった。
本稿では,頑健な視覚的接地とマルチモーダル理解を優先する評価指標を提案する。
論文 参考訳(メタデータ) (2025-01-07T18:59:55Z) - OpenLKA: an open dataset of lane keeping assist from market autonomous vehicles [23.083443555590065]
レーンキーピング・アシスト(LKA)は近年の自動車の標準機能となっている。
LKAシステムの運用特性と安全性能は未調査のままである。
フロリダ州タンパの大手自動車メーカーからLKAシステムを広範囲にテストした。
論文 参考訳(メタデータ) (2025-01-06T04:46:10Z) - Learning Perceptual Locomotion on Uneven Terrains using Sparse Visual
Observations [75.60524561611008]
この研究は、人中心の環境において、よく見られるバンプ、ランプ、階段の広い範囲にわたる知覚的移動を達成するために、スパースな視覚的観察の使用を活用することを目的としている。
まず、関心の均一な面を表すことのできる最小限の視覚入力を定式化し、このような外受容的・固有受容的データを統合した学習フレームワークを提案する。
本研究では, 平地を全方向歩行し, 障害物のある地形を前方移動させるタスクにおいて, 学習方針を検証し, 高い成功率を示す。
論文 参考訳(メタデータ) (2021-09-28T20:25:10Z) - Pluggable Weakly-Supervised Cross-View Learning for Accurate Vehicle
Re-Identification [53.6218051770131]
クロスビューの一貫した機能表現は、正確な車両ReIDの鍵です。
既存のアプローチは、広範な余分な視点アノテーションを使用して、クロスビュー学習を監督する。
Weakly-supervised Cross-View Learning (WCVL) モジュールを車載用として提案する。
論文 参考訳(メタデータ) (2021-03-09T11:51:09Z) - Counterfactual Vision-and-Language Navigation via Adversarial Path Sampling [65.99956848461915]
VLN(Vision-and-Language Navigation)は、エージェントが目標を達成するために3D環境を移動する方法を決定するタスクである。
VLNタスクの問題点の1つは、対話型環境において、人間に注釈を付けた指示で十分なナビゲーションパスを収集することは困難であるため、データの不足である。
本稿では,低品質な拡張データではなく,効果的な条件を考慮可能な,対向駆動の反実的推論モデルを提案する。
論文 参考訳(メタデータ) (2019-11-17T18:02:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。