論文の概要: SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM
- arxiv url: http://arxiv.org/abs/2607.26595v1
- Date: Wed, 29 Jul 2026 08:14:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.579825
- Title: SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM
- Title(参考訳): 空間Q:視覚的MLLMによる3次元ガウス撮影シーンの品質理解
- Authors: Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao,
- Abstract要約: 3DGSシーン理解のためのマルチモーダル品質評価フレームワークを開発した。
VGGTベースのエンコーダを専用のクオリティヘッドで拡張することにより、3D対応のクオリティ表現学習フレームワークを導入する。
原画像、深度マップ、点雲レンダリング、およびカメラパラメータをQwenベースのMLLMに共同で供給することにより、接地型マルチモーダル推論機構を構築する。
- 参考スコア(独自算出の注目度): 33.48299658365364
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D Gaussian Splatting (3DGS) has emerged as an effective representation for novel view synthesis and 3D scene reconstruction, creating an increasing demand for reliable quality assessment. Unlike conventional image quality assessment (IQA), the quality of a 3DGS scene depends not only on the perceptual fidelity of rendered views, but also on scene-level factors such as spatial structure and cross-view consistency. Existing IQA methods are limited by their reliance on 2D perceptual cues, whereas general multimodal large language models (MLLMs) are not designed for stable quality regression and may produce unreliable judgments. To address these limitations, a multimodal quality assessment framework is developed for 3DGS scene understanding. First, a 3D-aware quality representation learning framework is introduced by augmenting a VGGT-based encoder with a dedicated quality head. Multi-view images are encoded into view-specific features and aggregated to capture cross-view consistency, while geometric cues are incorporated through joint modeling of depth and point-cloud-related structural information, enabling the learning of structure-aware quality representations beyond appearance-driven features. Second, a grounded multimodal reasoning mechanism is constructed by jointly feeding original images, depth maps, point cloud renderings, and camera parameters into a Qwen-based MLLM.
- Abstract(参考訳): 3D Gaussian Splatting (3DGS) は、3Dシーンの合成と再現に有効な表現として登場し、信頼性の高い品質評価への需要が高まっている。
従来の画像品質評価(IQA)とは異なり、3DGSシーンの品質は、描画されたビューの知覚的忠実度だけでなく、空間構造やクロスビューの整合性といったシーンレベルの要因にも依存する。
既存のIQA法は2次元知覚的手がかりに依存しているため制限されているが、汎用マルチモーダル大規模言語モデル(MLLM)は安定した品質回帰のために設計されておらず、信頼性の低い判断を下す可能性がある。
これらの制約に対処するため、3DGSシーン理解のためのマルチモーダル品質評価フレームワークを開発した。
まず、VGGTベースのエンコーダを専用のクオリティヘッドで拡張することにより、3D対応のクオリティ表現学習フレームワークを導入する。
マルチビュー画像は、ビュー固有の特徴にエンコードされ、クロスビューの一貫性を捉えるために集約される一方、幾何学的手がかりは、深度とポイントクラウド関連の構造情報の連成モデリングによって組み込まれ、外観駆動的特徴を超えた構造認識品質表現の学習を可能にする。
第2に、原画像、深度マップ、点雲レンダリング、およびカメラパラメータをQwenベースのMLLMに共同で供給することにより、接地型マルチモーダル推論機構を構築する。
関連論文リスト
- Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis [38.10984626023432]
本稿では, 微調整を必要とせず, 濃密な視覚的特徴の質を直接的に調査する, コンテキスト内3Dシーン理解のための新しいベンチマークを提案する。
我々は8つの最先端基盤モデルをベンチマークし、DINOベースのエンコーダが大きな視点シフトで競争力を維持することを示す。
論文 参考訳(メタデータ) (2025-12-12T14:03:16Z) - IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction [82.53307702809606]
人間は自然に3次元世界の幾何学的構造と意味的内容を中間次元として知覚する。
本稿では,空間再構成とインスタンスレベルの文脈理解の両面での知識を統合するために,IGGT (InstanceGrounded Geometry Transformer) を提案する。
論文 参考訳(メタデータ) (2025-10-26T14:57:44Z) - Enhancing Novel View Synthesis from extremely sparse views with SfM-free 3D Gaussian Splatting Framework [14.927184256861807]
本稿では,SfMフリーな3DGSを用いたカメラのポーズを推定し,非常にスムーズな視点から3Dシーンを再構成する手法を提案する。
提案手法は,PSNRの高度2.75dB改善を極端に軽視条件下で達成し,他の最先端3DGS法よりも優れていた。
論文 参考訳(メタデータ) (2025-08-21T11:25:24Z) - Hi3DEval: Advancing 3D Generation Evaluation with Hierarchical Validity [78.7107376451476]
Hi3DEvalは3D生成コンテンツに適した階層的評価フレームワークである。
素材リアリズムを明示的に評価することで審美的外観を超えてテクスチャ評価を拡張する。
ハイブリッド3次元表現に基づく3次元自動スコアリングシステムを提案する。
論文 参考訳(メタデータ) (2025-08-07T17:50:13Z) - M3-AGIQA: Multimodal, Multi-Round, Multi-Aspect AI-Generated Image Quality Assessment [65.3860007085689]
M3-AGIQAは、AI生成画像のより人間らしく総合的な評価を可能にする包括的なフレームワークである。
モデル出力を人間の判断とより密接に整合させることで、M3-AGIQAは堅牢で解釈可能な品質スコアを提供する。
論文 参考訳(メタデータ) (2025-02-21T03:05:45Z) - No-Reference Point Cloud Quality Assessment via Graph Convolutional Network [89.12589881881082]
3次元(3D)ポイントクラウドは、新しいビジュアルメディアフォーマットとして、消費者にますます好まれている。
ポイントクラウドは、必然的に、マルチメディア通信システムによる品質劣化と情報損失に悩まされる。
マルチビュー2次元投影画像の相互依存関係を特徴付けるために,GCN(Graph Convolutional Network)を用いた新しい非参照PCQA手法を提案する。
論文 参考訳(メタデータ) (2024-11-12T11:39:05Z) - Multi-View Consistent Generative Adversarial Networks for 3D-aware Image
Synthesis [48.33860286920389]
3D認識画像合成は、3D表現を学習することにより、複数のビューからオブジェクトの画像を生成することを目的としている。
既存のアプローチには幾何学的制約がないため、通常はマルチビュー一貫性のある画像を生成することができない。
幾何制約付き高品質な3次元画像合成のためのマルチビュー一貫性ジェネレータネットワーク(MVCGAN)を提案する。
論文 参考訳(メタデータ) (2022-04-13T11:23:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。