論文の概要: Sign Language Recognition Using Original and Synthetic Depth Image Based Point Cloud Data Models
- arxiv url: http://arxiv.org/abs/2608.09400v1
- Date: Mon, 10 Aug 2026 10:25:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.207165
- Title: Sign Language Recognition Using Original and Synthetic Depth Image Based Point Cloud Data Models
- Title(参考訳): 固有及び合成深度画像に基づくポイントクラウドデータモデルを用いた手話認識
- Authors: Rustem Ozakar, Eyup Gedikli,
- Abstract要約: 深度画像から得られるポイントクラウドは、PointNetのようなニューラルネットワークで手話認識に利用できる。
本研究では,Depth Anything V2ネットワークを用いたRGB画像から合成深度画像を作成する。
一般的には、オリジナルの深度ベースポイントクラウドモデルは合成モデルよりも優れた性能を示したが、いくつかのモデルでは合成深度ベースのモデルは原モデルより優れていた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Research regarding the sign language recognition mostly relies on RGB images, whileas sign language datasets that provide depth images are limited. Point clouds obtained from depth images can be used for sign language recognition with neural networks like PointNet. In recent years, various neural networks are used for generating realistic depth images from monocular RGB images. In this work, synthetic depth images were created from RGB images using Depth Anything V2 network. For this purpose, three sign language datasets (Real-time ASL Fingerspelling, KArSL, AUTSL) which contain both RGB and depth images were used. Classification accuracies of the point cloud data created from both original and synthetic depth images using various PointNet architectures were measured for sign language recognition. From the original and synthetic point clouds, frame based, Point Gesture Map and Long Short Term Memory data models were used for classification and their performances were compared. In the results, both original and synthetic based data achieved acceptable performance in most models. In general, original depth based point cloud models performed better than synthetic ones, however in some models synthetic depth based models performed better than the originals.
- Abstract(参考訳): 手話認識の研究は主にRGB画像に依存し、奥行き画像を提供する手話データセットは限られている。
深度画像から得られるポイントクラウドは、PointNetのようなニューラルネットワークで手話認識に利用できる。
近年,モノクラーRGB画像からリアルな深度画像を生成するために,様々なニューラルネットワークが用いられている。
本研究では,Depth Anything V2ネットワークを用いたRGB画像から合成深度画像を作成する。
この目的のために、RGBと深度画像の両方を含む3つの手話データセット(Real-time ASL Fingerspelling, KArSL, AUTSL)を使用した。
各種のPointNetアーキテクチャを用いて, 原画像および合成深度画像から生成した点群データの分類精度を手話認識のために測定した。
原点雲と合成点雲から, フレームベース, Point Gesture Map と Long Short Term Memory データモデルを用いて分類し, その性能を比較した。
その結果、オリジナルのデータと合成データの両方が、ほとんどのモデルで許容できる性能を達成した。
一般的には、オリジナルの深度ベースポイントクラウドモデルは合成モデルよりも優れた性能を示したが、いくつかのモデルでは合成深度ベースのモデルは原モデルより優れていた。
関連論文リスト
- DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation [66.7989548848166]
既存のアプローチでは、深度マップとRGBイメージをエンコードし、それらの間に特徴融合を行い、より堅牢な予測を可能にする。
我々はDFormerv2という強力なRGBDエンコーダを提案し、ニューラルネットワークで深度情報をエンコードするのではなく、深度マップを幾何先行として明示的に利用する。
我々のゴールは、すべての画像パッチトークンの深さと空間距離から幾何学的手がかりを抽出し、それを用いて、自己注意における注意重みを割り当てることである。
論文 参考訳(メタデータ) (2025-04-07T03:06:07Z) - Towards Fusing Point Cloud and Visual Representations for Imitation Learning [57.886331184389604]
本稿では,ポイントクラウドとRGBの両特性を効果的に組み合わせた新しい模倣学習手法であるFPV-Netを提案する。
適応層ノルム条件付けを用いて,グローバルおよびローカル画像トークン上のポイントクラウドエンコーダを条件付けする。
論文 参考訳(メタデータ) (2025-02-17T20:46:54Z) - Simple Image Signal Processing using Global Context Guidance [56.41827271721955]
ディープラーニングベースのISPは、深層ニューラルネットワークを使用してRAW画像をDSLRライクなRGBイメージに変換することを目指している。
我々は,全RAW画像からグローバルなコンテキスト情報をキャプチャするために,任意のニューラルISPに統合可能な新しいモジュールを提案する。
本モデルでは,多種多様な実スマートフォン画像を用いて,様々なベンチマークで最新の結果が得られる。
論文 参考訳(メタデータ) (2024-04-17T17:11:47Z) - Pyramid Deep Fusion Network for Two-Hand Reconstruction from RGB-D Images [11.100398985633754]
両手で高密度メッシュを復元するためのエンドツーエンドフレームワークを提案する。
我々のフレームワークはResNet50とPointNet++を使って、RGBとpoint cloudから機能を派生しています。
また,異なるスケールで特徴を集約する新しいピラミッド深層核融合ネットワーク (PDFNet) も導入した。
論文 参考訳(メタデータ) (2023-07-12T09:33:21Z) - Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images [60.34381768479834]
近年の拡散モデルの発展により、自然言語のテキストプロンプトから現実的なディープフェイクの生成が可能になった。
我々は、最先端拡散モデルにより生成されたディープフェイク検出に関する体系的研究を開拓した。
論文 参考訳(メタデータ) (2023-04-02T10:25:09Z) - Scale Invariant Semantic Segmentation with RGB-D Fusion [12.650574326251023]
RGB-D画像を用いたスケール不変セマンティックセグメンテーションのためのニューラルネットワークアーキテクチャを提案する。
画素単位のセマンティックセグメンテーションのためのRGBデータに深度情報を組み込んで,屋外シーンにおける異なるスケールオブジェクトに対処する。
我々のモデルはコンパクトであり、他のRGBモデルにも容易に適用できる。
論文 参考訳(メタデータ) (2022-04-10T12:54:27Z) - Using Motion History Images with 3D Convolutional Networks in Isolated
Sign Language Recognition [0.913755431537592]
動作履歴画像(MHI)を用いたモデルに基づく手話認識手法を提案する。
RGB-MHIを3D-CNNアーキテクチャに組み込まれたモーションベースの空間アテンションモジュールとして使用する。
第2のアプローチでは、3D-CNNモデルの特徴を持つ後期融合技術でRGB-MHIモデルを直接使用する。
論文 参考訳(メタデータ) (2021-10-24T09:25:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。