論文の概要: DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming
- arxiv url: http://arxiv.org/abs/2606.28840v1
- Date: Sat, 27 Jun 2026 09:56:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.702847
- Title: DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming
- Title(参考訳): DLGStream: オープン語彙で自由視点ビデオストリーミングを可能にする動的言語埋め込み型ガウススプラッティング
- Authors: Zhihui Ke, Yuyang Liu, Xiaobo Zhou, Tie Qiu,
- Abstract要約: 3D Gaussian Splatting(FVV)は、マルチビュービデオからストリーム可能な自由視点ビデオ(FVV)を再構成するための有望なパラダイムとして登場した。
最近の研究は、CLIPの言語機能を蒸留により3DGSに統合し、オープン語彙クエリを可能にし、多くの下流アプリケーションをサポートする。
DLGStreamは,4次元環境相互作用,シーン編集,空間知性をサポートするため,ガウス属性とともに時変言語特徴をストリームする新しい言語埋め込み型FVV表現である。
- 参考スコア(独自算出の注目度): 16.890908589888678
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D Gaussian Splatting~(3DGS) has emerged as a promising paradigm for reconstructing streamable free-viewpoint video~(FVV) from multi-view videos. However, 3DGS-based FVVs typically lack user interaction and editing capabilities, which diminishes the immersive experience. Recent research has integrated language features from CLIP into 3DGS via distillation, enabling open-vocabulary queries and supporting many downstream applications. Nevertheless, the stringent requirements of FVV, low frame size and high FPS, make current language Gaussian representations unsuitable for language-embedded FVV. In this paper, we propose DLGStream, a novel language-embedded FVV representation that streams time-varying language features alongside Gaussian attributes to support 4D environment interaction, scene editing, and spatial intelligence. Specifically, we propose a dual-opacity dynamic language Gaussian representation, which maintains two opacity attributes for color and language features to deal with performance degradation that occurs when colors and features are jointly optimized. Furthermore, we introduce an interpolation-based deformation field to reduce temporal redundancy. This deformation field can also be used for 4D frame interpolation, boosting FVV sequences from low to high FPS. Experimental results demonstrate that DLGStream achieves superior performance in both on open-vocabulary segmentation and reconstruction quality with an average frame size of merely 43 KB. The code is available on \href{https://github.com/kkkzh/DLGStream}{https://github.com/kkkzh/DLGStream}.
- Abstract(参考訳): 3D Gaussian Splatting~(3DGS)は、マルチビュービデオからストリーム可能なフリー視点ビデオ〜(FVV)を再構築するための有望なパラダイムとして登場した。
しかし、3DGSベースのFVVは一般的にユーザインタラクションや編集機能に欠けており、没入感を損なう。
最近の研究は、CLIPの言語機能を蒸留により3DGSに統合し、オープン語彙クエリを可能にし、多くの下流アプリケーションをサポートする。
それでも、FVVの厳密な要件、低フレームサイズ、高いFPSは、現在の言語ガウス表現を言語埋め込みのFVVには適さないものにしている。
本稿では,4次元環境相互作用,シーン編集,空間知性をサポートするために,ガウス属性とともに時変言語特徴をストリームする新しい言語埋め込み型FVV表現であるDLGStreamを提案する。
具体的には、色と特徴が協調的に最適化された場合に発生する性能劣化に対処するため、色と言語の特徴に対する2つの不透明属性を保持する二重オパシティ動的言語ガウス表現を提案する。
さらに,時間的冗長性を低減するために補間に基づく変形場を導入する。
この変形場は、低FPSから高FPSまでのFVVシーケンスを増強する4次元フレーム補間にも使用できる。
実験結果から, DLGStreamは, 平均フレームサイズが43KBのオープン語彙セグメンテーションと再構成品質の両方において, 優れた性能を発揮することが示された。
コードは \href{https://github.com/kkzh/DLGStream}{https://github.com/kkkzh/DLGStream} で公開されている。
関連論文リスト
- X-GS: An Extensible Open Framework for Perceiving and Thinking via 3D Gaussian Splatting [72.02343855552051]
我々は、X-GS-PerceiverとX-GS-Thinkerの2つの主要コンポーネントからなるオープンフレームワークであるX-GSを紹介する。
Perceiverは、リアルタイムオンラインSLAMを可能にするために、幅広い3DGS技術を統合する。
Thinkerは視覚サンプリングモデルに対応し、結果の3Dセマンティック・ガウシアンを使用し、オブジェクト検出、キャプション生成、潜在的に具体化されたタスクなどの下流アプリケーションを可能にする。
論文 参考訳(メタデータ) (2026-03-10T13:10:18Z) - Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Platform [104.39464309969253]
Visionaryは、リアルタイムな様々なガウススティングとレンダリングのための、オープンでWebネイティブなプラットフォームである。
Visionaryは、軽量で“クリック・トゥ・ラン”なブラウザエクスペリエンスを維持しながら、動的ニューラル処理を可能にする。
論文 参考訳(メタデータ) (2025-12-09T10:54:58Z) - StreamSTGS: Streaming Spatial and Temporal Gaussian Grids for Real-Time Free-Viewpoint Video [16.890908589888678]
リアルタイムで自由視点ビデオ(FVV)をストリーミングすることは大きな課題に直面している。
最近の3DGSベースのFVV法は、トレーニングとレンダリングの両方において顕著なブレークスルーを達成した。
本稿では,リアルタイムストリーミング用に設計された新しいFVV表現StreamSTGSを提案する。
論文 参考訳(メタデータ) (2025-11-08T15:35:43Z) - GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond [56.677984098204696]
マルチモーダル言語モデルは、VLM(3D Vision-Language Models)の開発を推進している
本稿では,言語とタスク認識のシーン表現を用いた3次元ガウシアンスプラットシーンのためのシーン中心の3次元VLMを提案する。
本稿では,標準RGB画像から導出した光リアルな3D表現を利用した最初のガウススプラッティングに基づくVLMを提案する。
論文 参考訳(メタデータ) (2025-07-01T15:52:59Z) - Déjà Vu: Efficient Video-Language Query Engine with Learning-based Inter-Frame Computation Reuse [13.680753232748705]
本稿では、連続するフレーム間の計算を再利用することで、VTベースのビデオLMを高速化するビデオ言語クエリエンジンであるD'eja Vuを紹介する。
コアとなるReuseViTは、ビデオLMタスク用に特別に設計された修正ViTモデルであり、フレーム間の再利用機会を検出することを学ぶ。
D'eja Vuは、2%のエラーバウンド内で最大2.64倍の埋め込み生成を加速し、大規模なビデオ解析のためのビデオLMの実用性を劇的に向上させることを示す。
論文 参考訳(メタデータ) (2025-06-17T01:59:10Z) - DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation [61.59996525424585]
DIFFVSGGはオンラインのVSGGソリューションで、このタスクを反復的なシーングラフ更新問題とみなしている。
オブジェクト分類の復号化、境界ボックス回帰、グラフ生成の3つのタスクを1つの共有特徴埋め込みを用いて統合する。
DIFFVSGGはさらに、後続のフレームの予測が過去のフレームの結果をLCMの条件入力として活用する継続的時間的推論を促進する。
論文 参考訳(メタデータ) (2025-03-18T06:49:51Z) - D2GV: Deformable 2D Gaussian Splatting for Video Representation in 400FPS [22.373386953378002]
Implicit Representations (INR) はビデオ表現の強力なアプローチとして登場し、圧縮やインペイントといったタスクの多角性を提供する。
本稿では,D2GVと呼ばれる変形可能な2次元ガウススプラッティングに基づく新しい映像表現を提案する。
我々はD2GVの多目的性について,映像表現における有望なソリューションとしての可能性を強調し,映像,ペンキ,デノベーションなどのタスクで実証する。
論文 参考訳(メタデータ) (2025-03-07T17:26:27Z) - g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks [62.74304008688472]
Generalizable 3D-Language Feature Fields (g3D-LF)は、大規模な3D言語データセットで事前訓練された3D表現モデルである。
論文 参考訳(メタデータ) (2024-11-26T01:54:52Z) - SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval [82.51117533271517]
以前はRGBビデオをエンコードするだけで高レベルのセマンティックな特徴が得られていた。
既存のRGBベースの手話検索作業は、エンドツーエンドのトレーニングに埋め込まれた濃密な視覚データによる膨大なメモリコストに悩まされる。
本稿では,Semantically Enhanced Dual-Streamという手話表現フレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-23T11:31:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。