論文の概要: Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
- arxiv url: http://arxiv.org/abs/2607.12752v1
- Date: Tue, 14 Jul 2026 13:19:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.155609
- Title: Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
- Title(参考訳): Hallo4D: 連続時空間生成のためのマルチモード幻覚緩和
- Authors: Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He,
- Abstract要約: bfHallo4Dtextは3Dおよび4Dコンテンツ生成における幻覚を緩和するための統一的でモデルに依存しないフレームワークである。
- 参考スコア(独自算出の注目度): 40.74104010015429
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While recent advances in 3D generation have enabled impressive visual synthesis, existing methods often rely on 2D diffusion supervision without explicit mechanisms for geometric consistency, leading to spatial hallucinations such as duplicated structures and misaligned geometry. These issues become more severe in 4D generation, where maintaining consistency across viewpoints and temporal evolution introduces additional challenges, including jitter, identity flicker, and structural drift. We present \textbf{Hallo4D}, a unified and model-agnostic framework for mitigating spatiotemporal hallucinations in 3D and 4D content generation. Hallo4D introduces a generation-detection-correction paradigm that leverages large multimodal language models (LMMs) to identify and summarize spatial and temporal inconsistencies from multi-view and multi-frame renderings. These insights guide a consensus-driven image-space consistency optimization, where an LMM-based selector evaluates candidate corrections through multi-model voting, without requiring retraining or architectural modifications. To further improve temporal consistency and optimization efficiency, Hallo4D incorporates motion-aware keyframe sampling, LMM-guided initialization, and appearance alignment. We additionally introduce exposure-aware optimization and visibility pruning to enhance robustness under challenging viewpoints. Extensive experiments demonstrate that Hallo4D consistently outperforms strong baselines across diverse 3D and 4D generation settings, providing a scalable and generalizable solution for consistency-aware content generation.
- Abstract(参考訳): 近年の3次元生成の進歩は印象的な視覚合成を可能にしているが、既存の手法は幾何整合性の明示的なメカニズムを伴わずに2次元拡散の監督に依存しており、重複構造や不整合幾何といった空間幻覚を招いている。
これらの問題は、4D世代ではより深刻になり、視点間の一貫性と時間的進化がジッタ、アイデンティティ・フリック、構造的ドリフトといった新たな課題をもたらす。
本稿では,3次元および4次元コンテンツ生成における時空間幻覚を緩和するための統一的でモデルに依存しないフレームワークである「textbf{Hallo4D}」を提案する。
Hallo4Dは、大規模なマルチモーダル言語モデル(LMM)を利用して、マルチビューおよびマルチフレームレンダリングから空間的および時間的不整合を特定し、要約するジェネレーション-検出-補正パラダイムを導入している。
これらの知見は、LMMベースのセレクタが、再トレーニングやアーキテクチャの変更を必要とせずに、多モデル投票による候補修正を評価する、コンセンサス駆動の画像空間整合性最適化を導く。
時間的一貫性と最適化の効率をさらに向上するため、Halo4Dはモーション対応キーフレームサンプリング、LMM誘導初期化、外観アライメントを取り入れている。
さらに,難解な視点下でのロバスト性を高めるために,露出認識最適化と可視プルーニングを導入する。
大規模な実験により、Holo4Dは多様な3Dおよび4D生成セッティングの強いベースラインを一貫して上回り、一貫性を意識したコンテンツ生成のためのスケーラブルで一般化可能なソリューションを提供する。
関連論文リスト
- Uni4D-LLM: A Unified SpatioTemporal-Aware VLM for 4D Understanding and Generation [61.60600246983274]
既存の3Dおよび4Dアプローチは、通常、シーン幾何学を意味的理解とコンテンツ生成のための拡散モデルのための自己回帰モデルに組み込む。
我々は4次元シーン理解と生成のための時間的認識を備えた最初の統合VLMフレームワークであるUni4D-LLMを提案する。
論文 参考訳(メタデータ) (2025-09-28T12:06:54Z) - MVG4D: Image Matrix-Based Multi-View and Motion Generation for 4D Content Creation from a Single Image [8.22464804794448]
静止画像から動的4Dコンテンツを生成する新しいフレームワークであるMVG4Dを提案する。
MVG4Dのコアとなるのは、時間的コヒーレントで空間的に多様なマルチビュー画像を合成するイメージマトリックスモジュールである。
本手法は, 時間的一貫性, 幾何学的忠実度, 視覚的リアリズムを効果的に向上させ, 動きの不連続性や背景劣化における重要な課題に対処する。
論文 参考訳(メタデータ) (2025-07-24T12:48:14Z) - AR4D: Autoregressive 4D Generation from Monocular Videos [27.61057927559143]
既存のアプローチは主に、ノベルビューの動画を推測するためにスコア蒸留サンプリングに依存している。
SDSフリー4D生成のための新しいパラダイムであるAR4Dを提案する。
我々は,AR4DがSDSを使わずに最先端の4D生成を実現し,多様性の向上,空間的時間的整合性の向上,入力プロンプトとの整合性の向上を実現していることを示す。
論文 参考訳(メタデータ) (2025-01-03T09:27:36Z) - MagicMan: Generative Novel View Synthesis of Humans with 3D-Aware Diffusion and Iterative Refinement [23.707586182294932]
単一画像再構成における既存の作業は、訓練データ不足や総合的な多視点知識の欠如による3次元不整合により、弱い一般化性に悩まされている。
単一の参照画像から高品質な新規ビュー画像を生成するために設計された,人間固有の多視点拡散モデルであるMagicManを紹介する。
論文 参考訳(メタデータ) (2024-08-26T12:10:52Z) - 4Diffusion: Multi-view Video Diffusion Model for 4D Generation [55.82208863521353]
現在の4D生成法は, 高度な拡散生成モデルの助けを借りて, 有意義な有効性を実現している。
モノクロビデオから空間的・時間的に一貫した4Dコンテンツを生成することを目的とした,新しい4D生成パイプライン,すなわち4Diffusionを提案する。
論文 参考訳(メタデータ) (2024-05-31T08:18:39Z) - EG4D: Explicit Generation of 4D Object without Score Distillation [105.63506584772331]
DG4Dは、スコア蒸留なしで高品質で一貫した4Dアセットを生成する新しいフレームワークである。
私たちのフレームワークは、世代品質のベースラインをかなりのマージンで上回ります。
論文 参考訳(メタデータ) (2024-05-28T12:47:22Z) - Diffusion4D: Fast Spatial-temporal Consistent 4D Generation via Video Diffusion Models [116.31344506738816]
高速でスケーラブルな4Dコンテンツ生成のための新しいフレームワーク textbfDiffusion4D を提案する。
ダイナミックな3Dアセットの軌道ビューを合成できる4D対応ビデオ拡散モデルを開発した。
提案手法は, 生成効率と4次元幾何整合性の観点から, 従来の最先端技術を超えている。
論文 参考訳(メタデータ) (2024-05-26T17:47:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。