論文の概要: Mon3tr: Monocular 3D Telepresence with Pre-built Gaussian Avatars as Amortization
- arxiv url: http://arxiv.org/abs/2601.07518v1
- Date: Mon, 12 Jan 2026 13:17:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-13 19:08:01.399804
- Title: Mon3tr: Monocular 3D Telepresence with Pre-built Gaussian Avatars as Amortization
- Title(参考訳): Mon3tr: プリビルドされたガウスアバターによる単眼の3Dテレプレゼンス
- Abstract要約: Mon3trは、3Dガウススプラッティング(3DGS)に基づくパラメトリック人間モデリングを統合する新しいモノクル3Dテレプレゼンスフレームワークである。
単眼のRGBカメラは、身体の動きや表情をリアルタイムで捉え、3DGSベースのパラメトリック人間モデルを駆動するために使用される。
提案手法は,新しいポーズに対するPSNR > 28 dB,80msのエンドツーエンドレイテンシ,1000倍の帯域幅削減を実現する。
- 参考スコア(独自算出の注目度): 16.68162021163563
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Immersive telepresence aims to transform human interaction in AR/VR applications by enabling lifelike full-body holographic representations for enhanced remote collaboration. However, existing systems rely on hardware-intensive multi-camera setups and demand high bandwidth for volumetric streaming, limiting their real-time performance on mobile devices. To overcome these challenges, we propose Mon3tr, a novel Monocular 3D telepresence framework that integrates 3D Gaussian splatting (3DGS) based parametric human modeling into telepresence for the first time. Mon3tr adopts an amortized computation strategy, dividing the process into a one-time offline multi-view reconstruction phase to build a user-specific avatar and a monocular online inference phase during live telepresence sessions. A single monocular RGB camera is used to capture body motions and facial expressions in real time to drive the 3DGS-based parametric human model, significantly reducing system complexity and cost. The extracted motion and appearance features are transmitted at < 0.2 Mbps over WebRTC's data channel, allowing robust adaptation to network fluctuations. On the receiver side, e.g., Meta Quest 3, we develop a lightweight 3DGS attribute deformation network to dynamically generate corrective 3DGS attribute adjustments on the pre-built avatar, synthesizing photorealistic motion and appearance at ~ 60 FPS. Extensive experiments demonstrate the state-of-the-art performance of our method, achieving a PSNR of > 28 dB for novel poses, an end-to-end latency of ~ 80 ms, and > 1000x bandwidth reduction compared to point-cloud streaming, while supporting real-time operation from monocular inputs across diverse scenarios. Our demos can be found at https://mon3tr3d.github.io.
- Abstract(参考訳): 没入型テレプレゼンス(Immersive Telepresence)は、AR/VRアプリケーションにおける人間のインタラクションを変換することを目的として、リモートコラボレーションを強化するために、ライフスタイルのフルボディホログラフィック表現を可能にする。
しかし、既存のシステムはハードウェア集約型マルチカメラのセットアップに依存しており、ボリュームストリーミングには高い帯域幅を必要としており、モバイルデバイス上でのリアルタイムパフォーマンスを制限している。
これらの課題を克服するために,我々は,3次元ガウススプラッティング(3DGS)に基づくパラメトリックヒューマンモデリングを初めてテレプレゼンスに統合した,モノクロ3DテレプレゼンスフレームワークMon3trを提案する。
Mon3trは、アモータイズされた計算戦略を採用し、プロセスを1回のオフラインマルチビュー再構成フェーズに分割して、ユーザ固有のアバターと、ライブテレプレゼンスセッション中にモノラルなオンライン推論フェーズを構築する。
単眼のRGBカメラは、身体の動きや表情をリアルタイムで捉えて3DGSベースのパラメトリック人間モデルを駆動し、システムの複雑さとコストを大幅に削減する。
抽出された動きと外観の特徴はWebRTCのデータチャネル上で0.2Mbpsで送信され、ネットワークのゆらぎへの堅牢な適応を可能にする。
受信側,例えばMeta Quest 3では,プリビルドアバターの3DGS属性調整を動的に生成する軽量な3DGS属性変形ネットワークを開発し,フォトリアリスティックな動きと外観を60FPS程度で合成する。
提案手法の最先端性能を実証し,新しいポーズに対するPSNR > 28 dB, エンドツーエンドのレイテンシ ~ 80 ms, > 1000 倍の帯域幅削減を実現し, 多様なシナリオにおけるモノラル入力からのリアルタイム操作をサポートした。
私たちのデモはhttps://mon3tr3d.github.io.comで公開されています。
関連論文リスト
- Tele360: Real-Time Feed-Forward Human Reconstruction from Sparse Unposed Cameras [43.56045236607455]
我々は,人間の動的再構成とライブ自由視点可視化のための,最初のリアルタイムフィードフォワードシステムであるTele360を紹介する。
本システムでは,時間インスタンス毎に動的3次元ガウス表現を共同で推定し,再構成する。
実験によると、Tele360は1台のGPU上で25FPS以上のリアルタイム2K入力・レンダリングをサポートしながら、スタジオベンチマークの最先端のビジュアル品質を実現している。
論文 参考訳(メタデータ) (2026-09-14T04:50:52Z) - Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors [54.51965288351254]
ストリーミングビデオからリアルタイムな空間的理解を可能にするオンライン3次元視覚言語モデルを提案する。
提案手法では,LLMの次なる予測に基づく自己回帰型ストリーミング制御モデルを用いて,応答のタイミングを学習する。
3D言語データのストリーミングの難しさに対処するため、我々はさらにスケーラブルなデータ生成パイプラインを開発する。
論文 参考訳(メタデータ) (2026-06-05T04:16:24Z) - RobotPan: A 360$^\circ$ Surround-View Robotic Vision System for Embodied Perception [47.76543396190029]
6台のカメラをLiDARと組み合わせて360ドル(約3万2000円)のビジュアルカバレッジを提供するサラウンドビューロボットビジョンシステムを導入する。
また、キャリブレーションされたスパースビューの入力から、エンフェロメトリースケールとエンフェロパクトの3Dガウスを予測できるフィードフォワードフレームワークであるtextscRobotPan を提示する。
実験により,textscRobotPanはフィードフォワードの事前再構成やビュー合成手法と競合する品質を実現することが示された。
論文 参考訳(メタデータ) (2026-04-15T04:58:23Z) - A Multi-View 3D Telepresence System for XR Robot Teleoperation [50.624253593914084]
効果的な遠隔操作には、信頼性の高い深度に基づく直感的な3次元可視化が必要である。
我々は、3台のカメラから幾何学を融合させ、スタンドアロンのVRハードウェア上でGPUアクセラレーションされたポイントクラウドレンダリングを生成する多視点VRテレプレゼンスシステムを導入する。
パイプラインはMeta Quest 3で約75kポイントのリアルタイムレンダリングをサポートしています。
論文 参考訳(メタデータ) (2026-04-04T13:22:12Z) - GSStream: 3D Gaussian Splatting based Volumetric Scene Streaming System [52.652341168561016]
3DGSデータフォーマットをサポートする新しいボリュームシーンストリーミングシステムであるGSStreamを提案する。
GSStreamは協調的なビューポート予測モジュールを統合し、ユーザの将来の振る舞いをより正確に予測する。
提案するGSStreamシステムは,視覚的品質とネットワーク使用量において,既存の代表的なボリュームストリーミングシステムより優れている。
論文 参考訳(メタデータ) (2026-03-10T14:25:00Z) - Stereo-Inertial Poser: Towards Metric-Accurate Shape-Aware Motion Capture Using Sparse IMUs and a Single Stereo Camera [54.967647497048205]
本稿では,距離精度と形状を考慮した3次元動作を推定するリアルタイムモーションキャプチャシステムであるStereo-Inertial Poserを提案する。
モノクラーRGBをステレオビジョンに置き換え、直接3次元キーポイント抽出と形状パラメータ推定を可能にした。
ドリフトフリーなグローバル翻訳を長い記録時間で生成し,フットスケート効果を低減させる。
論文 参考訳(メタデータ) (2026-03-02T17:46:38Z) - Audio Driven Real-Time Facial Animation for Social Telepresence [65.66220599734338]
最小遅延時間で3次元顔アバターをアニメーションするオーディオ駆動リアルタイムシステムを提案する。
我々のアプローチの中心は、音声信号をリアルタイムに潜在表情シーケンスに変換するエンコーダモデルである。
我々は、リアルタイムなパフォーマンスを達成しつつ、自然なコミュニケーションに必要な表情の豊富なスペクトルを捉えている。
論文 参考訳(メタデータ) (2025-10-01T17:57:05Z) - M2DAO-Talker: Harmonizing Multi-granular Motion Decoupling and Alternating Optimization for Talking-head Generation [65.48046909056468]
我々は,音声音声生成をビデオ前処理,モーション表現,レンダリング再構成を含む統一的なフレームワークに再構成する。
M2DAO-Talkerは2.43dBのPSNRの改善とユーザ評価ビデオの画質0.64アップで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-07-11T04:48:12Z) - Progressive Inertial Poser: Progressive Real-Time Kinematic Chain Estimation for 3D Full-Body Pose from Three IMU Sensors [25.67875816218477]
スパース追跡信号からのフルボディポーズ推定は、環境条件や記録範囲によって制限されない。
従来の作業では、骨盤と下肢にセンサーを追加することや、キージョイントのグローバルな位置を得るために外部視覚センサーに頼ることが困難だった。
仮想現実技術の実用性を向上させるため,頭部と手首に装着した3つの慣性計測ユニット(IMU)センサから得られた慣性データのみを用いて,全身のポーズを推定した。
論文 参考訳(メタデータ) (2025-05-08T15:28:09Z) - EVolSplat: Efficient Volume-based Gaussian Splatting for Urban View Synthesis [61.1662426227688]
既存のNeRFおよび3DGSベースの手法は、フォトリアリスティックレンダリングを実現する上で有望な結果を示すが、スローでシーンごとの最適化が必要である。
本稿では,都市景観を対象とした効率的な3次元ガウススプレイティングモデルEVolSplatを紹介する。
論文 参考訳(メタデータ) (2025-03-26T02:47:27Z) - TaoAvatar: Real-Time Lifelike Full-Body Talking Avatars for Augmented Reality via 3D Gaussian Splatting [4.011241510647248]
各種信号によって駆動される高忠実で軽量な3DGSベースのフルボディ音声アバターであるTaoAvatarについて述べる。
TaoAvatarは、Apple Vision Proのような高精細ステレオデバイス上で90FPSを維持しながら、様々なデバイスでリアルタイムに実行しながら、最先端のレンダリング品質を実現していることを示す。
論文 参考訳(メタデータ) (2025-03-21T10:40:37Z) - SwinGS: Sliding Window Gaussian Splatting for Volumetric Video Streaming with Arbitrary Length [2.4844080708094745]
本稿では,リアルタイムストリーミング方式でボリュームビデオのトレーニング,配信,レンダリングを行う新しいフレームワークであるSwinGSを紹介する。
SwinGSのプロトタイプを実装し、さまざまなデータセットやシーンでストリーム性を示す。
また、現代的なブラウザを持つほとんどのデバイス上で、リアルタイムのボリュームビデオ再生を可能にするインタラクティブなWebGLビューアを開発した。
論文 参考訳(メタデータ) (2024-09-12T05:33:15Z) - EmbodiedSAM: Online Segment Any 3D Thing in Real Time [61.2321497708998]
身体的なタスクは、エージェントが探索と同時に3Dシーンを完全に理解する必要がある。
オンライン、リアルタイム、微粒化、高度に一般化された3D知覚モデルは、必死に必要である。
論文 参考訳(メタデータ) (2024-08-21T17:57:06Z) - WE-GS: An In-the-wild Efficient 3D Gaussian Representation for Unconstrained Photo Collections [8.261637198675151]
制約のない写真コレクションからの新規ビュー合成(NVS)は、コンピュータグラフィックスでは困難である。
写真コレクションからのシーン再構築のための効率的なポイントベース微分可能レンダリングフレームワークを提案する。
提案手法は、新しいビューのレンダリング品質と、高収束・レンダリング速度の外観合成において、既存のアプローチよりも優れている。
論文 参考訳(メタデータ) (2024-06-04T15:17:37Z) - InstantSplat: Sparse-view Gaussian Splatting in Seconds [91.77050739918037]
InstantSplatは,光速でスパークビュー3Dシーンを再現する新しい手法である。
InstantSplatでは,3Dシーン表現とカメラポーズを最適化する,自己管理フレームワークを採用している。
3D-GSの従来のSfMと比較して、30倍以上の再現を達成し、視覚的品質(SSIM)を0.3755から0.7624に改善する。
論文 参考訳(メタデータ) (2024-03-29T17:29:58Z) - Multi-view data capture for dynamic object reconstruction using handheld
augmented reality mobiles [0.0]
移動移動型携帯端末からほぼ同期のフレームストリームをキャプチャするシステムを提案する。
各モバイルは、そのポーズを推定するために同時にローカライズとマッピングを実行し、無線通信チャネルを使用して同期トリガーを送受信する。
3次元骨格とボリュームリコンストラクションに利用することで,本システムの有効性を示す。
論文 参考訳(メタデータ) (2021-03-14T10:26:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。