Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models
Abstractの概要
本論文では、大規模言語モデル(LLM)との複数ターンの対話を通じて3Dおよび単眼4Dシーンを編集するためのインタラクティブなフレームワークであるCE3D++を提案します。その中核となる技術的アイデアはHash-Atlasであり、シーンビューを2Dの前景および背景アトラスにマッピングすることで、アトラス空間上で編集を行ってシーンへ逆投影できるようにし、2D編集と3D/4D再構成を分離します。この表現の上で、システムはLLMを用いて自由形式のユーザー指示を解釈し、視覚ツールが必要なタイミングを判断し、広範な外部ビジョンモデル群を統括します。さらに本フレームワークは、ピボットビュー初期化とモーショントラッキング損失を導入して動くオブジェクトのアトラス安定性を維持することで、動的な4Dシーンにも対応しています。
新規性
主な新規性は、分離されたハッシュベースのアトラス表現とLLM駆動の対話エージェントを組み合わせ、インタラクティブな3Dおよび4Dシーン編集を実現した点にあります。動的4Dシーン専用のピボットビュー初期化およびモーション損失を導入しているほか、マルチステップの編集タスクにおいて30以上の外部視覚ツールを小規模LLMが確実に統括できるようにする軌跡チューニングデータセットを提案しています。
成果
複数の3Dおよび4Dデータセットにおいて、Hash-Atlasはアトラス再構成でLNAを上回り、1.1〜5.1 dBのPSNR向上、14.2〜18.6倍の学習高速化、7.6〜9.0倍の推論FPS向上が報告されています。編集ベンチマークにおいて、CE3D++は既存の3D・4D編集ベースラインと比較してより短い編集時間で高いCLIP類似度およびCLIP方向性スコアを達成しました。さらに、軌跡チューニングにより、複雑な複数ターンの編集ワークフローにおけるQwen-14BやLLaMA-8Bなどの軽量LLMのツール呼び出し失敗率が大幅に低減しました。
論文の注目点
- Hash-Atlasは3Dおよび4Dシーン編集を2Dアトラス操作として再定式化し、シーン表現の再学習を行うことなく編集段階を標準的な2D画像モデルと幅広く適合させます。
- CE3D++は、抽象シーン識別子と実行部のマージ・分割戦略を備えたLLMベースの対話エージェントを採用し、自由形式のユーザー指示を解析して複数ターンの対話にわたり視覚ツールを統括します。
- 動的4Dシーンに対しては、ピボットビュー選択とポイントトラッキングモーション損失が移動オブジェクトのアトラスを安定化させ、特化された軌跡チューニングデータセットにより小規模LLMでも信頼性の高いツールスケジューリングを実現します。