論文の概要: VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval
- arxiv url: http://arxiv.org/abs/2607.02371v1
- Date: Thu, 02 Jul 2026 16:12:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.914135
- Title: VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval
- Title(参考訳): VisionAId:パーソナライズされたオブジェクト検索機能を備えた、視覚障害者のためのオフライン初のマルチモーダルAndroidアシスタント
- Authors: Cristian-Gabriel Florea, Stelian Spînu,
- Abstract要約: 全世界で2億8500万人以上が視覚障害で暮らしている。
VisionAIdは、コモディティスマートフォンをリアルタイムのビジュアルアシスタントに変えるAndroidアプリケーションだ。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Over 285 million people worldwide live with a visual impairment, for whom everyday tasks such as avoiding obstacles, locating personal belongings, recognizing familiar faces, or handling cash remain persistent obstacles to personal autonomy. Existing assistive applications are typically limited to recognizing predefined categories, depend heavily on cloud connectivity, or require dedicated hardware. We present VisionAId, an Android application that turns a commodity smartphone into a real-time visual assistant. The system integrates six on-device deep learning models (metric monocular depth estimation, instance segmentation, visual and facial embeddings, face detection, and a custom banknote detector) running entirely through ONNX Runtime, with an optional cloud large language model (Google Gemini Flash) used only for narrative scene description and automatic object labeling. A distinctive contribution is a few-shot pipeline for personal objects: the user photographs an object from several angles, and the system later locates that specific instance in the environment, guiding the user toward it with augmented-reality markers, spatial audio, and distance-proportional haptics. All feedback is multimodal (Romanian speech synthesis, voice commands, vibration). On a reference device (Samsung Galaxy S21 Ultra), INT8 quantization reduces depth latency from ~1200 ms to ~491 ms, the custom banknote detector reaches an mAP@50 of 0.986, and metric depth is calibrated to below 1 cm of error within 3 m.
- Abstract(参考訳): 世界の2億8500万人以上が視覚障害に悩まされており、障害を避けたり、個人所有物を見つけたり、身近な顔を認識したり、現金を処理したりといった日常的な作業は、個人の自律性に対する永続的な障害のままである。
既存の補助アプリケーションは、通常、事前に定義されたカテゴリを認識するか、クラウド接続に大きく依存するか、専用のハードウェアを必要とするかに制限される。
VisionAIdは、コモディティスマートフォンをリアルタイムのビジュアルアシスタントに変えるAndroidアプリケーションだ。
このシステムは6つのオンデバイスディープラーニングモデル(メトリクス単眼深度推定、インスタンスセグメンテーション、視覚および顔の埋め込み、顔検出、カスタム紙幣検出)をONNX Runtime経由で完全に実行し、物語のシーン記述と自動オブジェクトラベリングにのみ使用されるオプションのクラウド大言語モデル(Google Gemini Flash)を統合する。
ユーザがいくつかの角度からオブジェクトを撮影し、システムはその後、その特定のインスタンスを環境に配置し、拡張現実マーカー、空間オーディオ、そして距離空間的な触覚でユーザーを誘導する。
フィードバックはすべてマルチモーダル(ルーマニア語音声合成、音声コマンド、振動)である。
リファレンスデバイス(Samsung Galaxy S21 Ultra)では、INT8量子化により、1200msから491msまでの深さ遅延を低減し、カスタム紙幣検出器は0.986のmAP@50まで到達し、メートル法深さは3m以内で1cm以下の誤差に調整される。
関連論文リスト
- NaviSense: A Multimodal Assistive Mobile application for Object Retrieval by Persons with Visual Impairment [21.405966774051326]
NaviSenseは、対話型AI、視覚言語モデル、拡張現実(AR)、LiDARを組み合わせたモバイル支援システムである。
ユーザは自然言語でオブジェクトを指定し、目標に向かって移動するための連続的な空間フィードバックを受け取る。
NaviSenseはオブジェクトの検索時間を著しく短縮し、既存のツールよりも好まれた。
論文 参考訳(メタデータ) (2025-09-23T05:45:11Z) - Turn-by-Turn Indoor Navigation for the Visually Impaired [0.0]
室内環境のナビゲーションは視覚障害者にとって重要な課題である。
本稿では,カメラを搭載したスマートフォンのみを用いた建物内部のターンバイターンナビゲーションシステムを提案する。
複雑な屋内空間を利用者に正確に案内するシステムの有効性について予備評価を行った。
論文 参考訳(メタデータ) (2024-10-25T20:16:38Z) - RoboSense: Large-scale Dataset and Benchmark for Egocentric Robot Perception and Navigation in Crowded and Unstructured Environments [62.5830455357187]
我々は3種類のセンサー(Camera, LiDAR, Fisheye)をベースとした自我中心型マルチセンサデータ収集プラットフォームを構築した。
大規模なマルチモーダルデータセットであるRoboSenseは、エゴセントリックなロボット知覚を促進するために構築されている。
論文 参考訳(メタデータ) (2024-08-28T03:17:40Z) - Swiss DINO: Efficient and Versatile Vision Framework for On-device Personal Object Search [21.223913863814367]
本稿では,最近のDINOv2変換モデルに基づく一括個人オブジェクト検索のためのフレームワークを提案する。
スイスのDINOは、デバイス上でパーソナライズされたシーン理解の要件に挑戦し、適応トレーニングを必要としない。
論文 参考訳(メタデータ) (2024-07-10T11:05:02Z) - EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards
Embodied AI [88.03089807278188]
EmbodiedScanはマルチモーダルでエゴ中心の3D知覚データセットであり、総合的な3Dシーン理解のためのベンチマークである。
1Mのエゴ中心のRGB-Dビューをカプセル化した5kスキャン、1Mの言語プロンプト、760以上のカテゴリにまたがる160kの3D指向ボックスを含んでいる。
このデータベースに基づいて、Embodied Perceptronというベースラインフレームワークを導入します。
任意の数のマルチモーダル入力を処理でき、顕著な3D知覚能力を示す。
論文 参考訳(メタデータ) (2023-12-26T18:59:11Z) - SqueezerFaceNet: Reducing a Small Face Recognition CNN Even More Via
Filter Pruning [55.84746218227712]
我々は,100万パラメータ未満の軽量顔認識ネットワークであるSqueezerFaceNetを開発した。
性能を損なうことなく、さらに(最大40%)削減できることを示す。
論文 参考訳(メタデータ) (2023-07-20T08:38:50Z) - Object Recognition System on a Tactile Device for Visually Impaired [1.2891210250935146]
このデバイスは、視覚情報を聴覚フィードバックに変換し、ユーザが自分の環境を、感覚的なニーズに合った形で理解できるようにする。
装置が特定の位置にタッチされると、シーンに存在する物体の識別を視覚障害者に伝える音声信号を提供する。
論文 参考訳(メタデータ) (2023-07-05T11:37:17Z) - OVTrack: Open-Vocabulary Multiple Object Tracking [64.73379741435255]
OVTrackは任意のオブジェクトクラスを追跡することができるオープン語彙トラッカーである。
大規模な大語彙のTAOベンチマークに新たな最先端技術が設定されている。
論文 参考訳(メタデータ) (2023-04-17T16:20:05Z) - MVLidarNet: Real-Time Multi-Class Scene Understanding for Autonomous
Driving Using Multiple Views [60.538802124885414]
マルチビューLidarNet(MVLidarNet)は,多層物体検出とドライビング空間分割のための2段階のディープニューラルネットワークである。
MVLidarNetは、単一のLiDARスキャンを入力として、乾燥可能な空間を同時に決定しながら、オブジェクトを検出し、分類することができる。
我々は、KITTIとはるかに大きな内部データセットの両方で結果を示し、その方法が桁違いにスケールできることを実証する。
論文 参考訳(メタデータ) (2020-06-09T21:28:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。