論文の概要: Tamaththul3D: High-Fidelity 3D Saudi Sign Language Avatars from Monocular Video
- arxiv url: http://arxiv.org/abs/2605.05367v1
- Date: Wed, 06 May 2026 18:47:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.377449
- Title: Tamaththul3D: High-Fidelity 3D Saudi Sign Language Avatars from Monocular Video
- Title(参考訳): Tamaththul3D: モノクロビデオによる高忠実な3Dサウジアラビア手話アバター
- Abstract要約: サウジアラビアのIshara-500 Sign Languageデータセットに対して,最初の高品質な3Dパラメトリックアノテーションを導入する。
また、ArSLの調音パターン用に設計された特殊な再構成パイプラインであるTamaththul3Dを提示する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Arabic Sign Language (ArSL) and its dialects serve approximately 400 million Arabic speakers worldwide, yet the community lacks high-quality 3D parametric annotations and specialized reconstruction methods for avatar generation. We address this critical gap through two key contributions: First, we introduce the first high-quality 3D parametric annotations for the Ishara-500 Saudi Sign Language dataset, providing precise SMPL-X parameters for 500 culturally authentic SSL signs. Second, we present Tamaththul3D, a specialized reconstruction pipeline designed for ArSL's unique articulation patterns. Our pipeline integrates SMPLer-X for robust body estimation, WiLoR for detailed hand refinement with automatic localization and mirroring, and MediaPipe for 2D pose supervision. Through kinematic-chain-based wrist alignment with hybrid swing-twist decomposition and 2D-supervised joint optimization, Tamaththul3D achieves state-of-the-art hand accuracy (up to 32% improvement over previous methods) while maintaining competitive body pose. Together, these 3D annotations and Tamaththul3D pipeline establish the first comprehensive framework for high-fidelity ArSL avatar reconstruction, enabling new accessibility technologies and cultural preservation efforts for the Arab Deaf community.
- Abstract(参考訳): アラビア手話(ArSL)とその方言は全世界で約4億人のアラビア語を話すが、高品質な3Dパラメトリックアノテーションやアバター生成のための特殊な再構築方法が欠けている。
まず、Ishara-500 Saudi Sign Languageデータセットに最初の高品質な3Dパラメトリックアノテーションを導入し、文化的に信頼できるSSLサイン500に対して正確なSMPL-Xパラメータを提供します。
第2に,ArSLの特異な調音パターンを設計した特殊再構成パイプラインであるTamaththul3Dを提案する。
我々のパイプラインは、堅牢な身体推定のためのSMPLer-Xと、自動位置決めとミラーリングによる細かな手修正のためのWiLoRと、2Dポーズ監視のためのMediaPipeを統合している。
キーネマティックチェーンを用いた手首アライメントとハイブリッド・スイング・ツイスト分解と2次元教師付き関節最適化により、タマトゥール3Dは、競技体ポーズを維持しながら、最先端の手の精度(従来の方法よりも最大32%改善)を達成する。
これらの3DアノテーションとTamaththul3Dパイプラインは、アラビア・ディーフ・コミュニティのための新しいアクセシビリティ技術と文化保護活動を可能にする、高忠実なArSLアバター再構築のための最初の包括的な枠組みを確立している。
関連論文リスト
- M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production [56.171224102170015]
非手動的特徴として, 口づけ, まぶたの上昇, 視線, 頭部運動は文法的に義務付けられ, 手動調音器のみでは回復できない。
既存の3Dプロダクションシステムは、それらを統合するための2つの障壁に直面している。
本稿では,FLAMEのリッチな表現空間とSMPL-X本体を結合したSMPL-FXを提案する。
論文 参考訳(メタデータ) (2026-03-24T18:05:03Z) - DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors [4.950209377730332]
DexAvatarは,手話ビデオから生体力学的に精密な手話や身体の動きを再現する新しいフレームワークである。
DexAvatarはSGNifyモーションキャプチャデータセットで強力なパフォーマンスを実現し、体と手のポーズの推定で35.11%向上した。
論文 参考訳(メタデータ) (2025-12-24T08:44:58Z) - WorldGrow: Generating Infinite 3D World [75.81531067447203]
我々は、無限に拡張可能な3D世界、すなわちコヒーレントな幾何学と現実的な外観を持つ大規模で連続的な環境を生み出すという課題に取り組む。
本研究では,非有界な3次元シーン合成のための階層的フレームワークWorldGrowを提案する。
提案手法は,(1)高品質なシーンブロックを抽出し,シーン生成に適した3D構造化潜在表現を作成するデータキュレーションパイプライン,(2)コンテキスト認識シーン拡張を可能にする3Dブロックインペイント機構,(3)グローバルなレイアウトの妥当性と局所幾何学的/音声的忠実性の両立を保証する粗大かつ微細な生成戦略,の3つのコアコンポーネントを特徴とする。
論文 参考訳(メタデータ) (2025-10-24T17:39:52Z) - From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors [54.84863164684646]
既存の視覚言語アクション(VLA)モデルは3Dの現実世界で機能するが、通常は2Dエンコーダ上に構築される。
本研究では,アクションヘッドにリッチな3次元空間トークンを注入する新しいパラダイムであるFALCONを紹介する。
論文 参考訳(メタデータ) (2025-10-20T11:26:45Z) - Controllable Human-centric Keyframe Interpolation with Generative Prior [55.16558476905587]
本稿では,PoseFuse3D Keyframe Interpolator(PoseFuse3D-KI)を紹介する。
我々は,PoseFuse3D-KIがCHKI-Videoの最先端のベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-06-03T17:50:05Z) - Online Language Splatting [28.066910888210973]
3DGS-SLAMシステム内で、オンライン、ほぼリアルタイムでオープン語彙の言語マッピングを実現するための最初のフレームワークであるOnline Language Splattingを紹介する。
我々のオンライン手法は最先端のオフライン手法を精度良く超え,40倍以上の効率向上を実現している。
論文 参考訳(メタデータ) (2025-03-12T14:49:24Z) - Arc2Avatar: Generating Expressive 3D Avatars from a Single Image via ID Guidance [69.9745497000557]
本稿では,人間の顔の基盤モデルを用いた最初のSDSベースの手法であるArc2Avatarについて述べる。
我々のアバターは人間の顔メッシュテンプレートとの密接な対応を維持しており、ブレンドシェープによる表現生成を可能にしている。
論文 参考訳(メタデータ) (2025-01-09T17:04:33Z) - 3D-Consistent Human Avatars with Sparse Inputs via Gaussian Splatting and Contrastive Learning [19.763523500564542]
CHASEはスパース入力のみを使用して高密度なインプットレベルのパフォーマンスを実現する新しいフレームワークである。
トレーニングセットからの類似のポーズを活用することにより,変形したガウスを洗練する動的アバター調整(DAA)モジュールを導入する。
スパース入力用に設計されているが、CHASEはZJU-MoCapとH36Mデータセットのフル設定とスパース設定の両方で最先端のメソッドを超越している。
論文 参考訳(メタデータ) (2024-08-19T02:46:23Z) - ID-to-3D: Expressive ID-guided 3D Heads via Score Distillation Sampling [96.87575334960258]
ID-to-3D(ID-to-3D)は、不整合表現を用いたIDとテキスト誘導型3次元頭部を生成する方法である。
前例のないアイデンティティ一貫性と高品質なテクスチャと幾何生成を実現する。
論文 参考訳(メタデータ) (2024-05-26T13:36:45Z) - SignAvatars: A Large-scale 3D Sign Language Holistic Motion Dataset and Benchmark [20.11364909443987]
SignAvatarsは、難聴者や難聴者のコミュニケーションギャップを埋めるために設計された、最初の大規模でマルチプロンプトな3D手話言語(SL)モーションデータセットである。
データセットは153のシグナから7万本のビデオで構成され、合計8.34万フレームが分離されたサインと、連続的かつ協調的なサインの両方をカバーしている。
論文 参考訳(メタデータ) (2023-10-31T13:15:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。