論文の概要: Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing
- arxiv url: http://arxiv.org/abs/2603.17583v1
- Date: Wed, 18 Mar 2026 10:46:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-19 18:32:57.654727
- Title: Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing
- Title(参考訳): エディット・アズ・アクト:オープン・ボキャブラリ3次元屋内シーン編集のためのゴール・レグレッシブ・プランニング
- Abstract要約: Edit-As-Actは3D空間における目標回帰計画としてオープン語彙シーン編集を行うフレームワークである。
言語駆動のプランナーが行動を提案し、バリケータがゴール指向性、単調性、身体的実現性を強制する。
E2A-Benchでは,9つの屋内環境を対象とした63の編集タスクのベンチマークを行った。
- 参考スコア(独自算出の注目度): 20.022591860394012
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Editing a 3D indoor scene from natural language is conceptually straightforward but technically challenging. Existing open-vocabulary systems often regenerate large portions of a scene or rely on image-space edits that disrupt spatial structure, resulting in unintended global changes or physically inconsistent layouts. These limitations stem from treating editing primarily as a generative task. We take a different view. A user instruction defines a desired world state, and editing should be the minimal sequence of actions that makes this state true while preserving everything else. This perspective motivates Edit-As-Act, a framework that performs open-vocabulary scene editing as goal-regressive planning in 3D space. Given a source scene and free-form instruction, Edit-As-Act predicts symbolic goal predicates and plans in EditLang, a PDDL-inspired action language that we design with explicit preconditions and effects encoding support, contact, collision, and other geometric relations. A language-driven planner proposes actions, and a validator enforces goal-directedness, monotonicity, and physical feasibility, producing interpretable and physically coherent transformations. By separating reasoning from low-level generation, Edit-As-Act achieves instruction fidelity, semantic consistency, and physical plausibility - three criteria that existing paradigms cannot satisfy together. On E2A-Bench, our benchmark of 63 editing tasks across 9 indoor environments, Edit-As-Act significantly outperforms prior approaches across all edit types and scene categories.
- Abstract(参考訳): 自然言語から3D屋内シーンを編集するのは、概念的には単純だが技術的には難しい。
既存のオープン語彙システムは、しばしばシーンの大部分を再生するか、空間構造を乱す画像空間の編集に依存し、意図しないグローバルな変化や物理的に一貫性のないレイアウトをもたらす。
これらの制限は、編集を主に生成タスクとして扱うことに由来する。
私たちは別の見方を取る。
ユーザ命令は、望ましい世界状態を定義し、編集は、他のすべてを保存しながら、この状態を真にする最小のアクションシーケンスであるべきである。
この視点は、3D空間における目標回帰計画としてオープン語彙シーン編集を実行するフレームワークであるEdit-As-Actを動機付けている。
ソースシーンと自由形式の命令が与えられた後、Edit-As-ActはPDDLにインスパイアされた行動言語であるEditLangでシンボル目標の述語と計画を予測する。
言語駆動型プランナーが行動を提案し、バリケータが目標指向性、単調性、物理的実現性を適用し、解釈可能かつ物理的に一貫性のある変換を生成する。
低レベルの生成から推論を分離することで、Edit-As-Actは命令の忠実さ、セマンティックな一貫性、物理的妥当性を達成する。
E2A-Benchでは、9つの屋内環境にわたる63の編集タスクのベンチマークを行い、編集-As-Actは、すべての編集タイプやシーンカテゴリで以前のアプローチよりも大幅に優れています。
関連論文リスト
- What Makes a 3D Scene Editable? A Factorized Benchmark of Fidelity, Locality, Consistency, and Preservation [0.0]
本稿では,編集を制御情報置換として扱う表現非依存のベンチマークであるEditBench3Dを紹介する。
240のシーン編集ペアに対して,8つの代表的NeRF,3Dガウススプラッティング,ハイブリッド,プロキシベースのエディタを評価した。
論文 参考訳(メタデータ) (2026-09-14T01:38:38Z) - Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models [57.59888019135289]
Hash-Atlasネットワークは2次元アトラス画像の操作として3Dシーン編集を再構成する。
本稿では,CE3D++と呼ばれる対話型3Dシーン編集手法を提案する。
その結果、CE3D++は複数のビジュアルモデルを効果的に統合し、多様なビジュアル編集効果を実現することを示した。
論文 参考訳(メタデータ) (2026-08-29T08:25:58Z) - DesignAgent3D: Interactive 3D Scene Editing via Designer-like Multimodal Reasoning [32.91291969659809]
テキストガイド3Dシーン編集は、再構成された環境を修正するための直感的なインタフェースを提供する。
既存の方法は、通常、タスクを単一のプロンプトからワンショット条件生成として定式化する。
DesignAgent3Dは、3Dシーンの編集をデザインライクなPlan-Perceive-Actパラダイムとして再構成する対話型マルチモーダルエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-18T01:16:13Z) - Geometry-Instructed Video Editing [54.86319853573801]
GIVEは幾何学的に指示されたビデオ編集フレームワークで、統一されたオブジェクト状態の定式化によって編集を表現する。
我々は、オブジェクトレベルの編集プログラムを実行し、ペアの前後で制御されるレンダリングを行うスケーラブルなグラフィックスエンジンパイプラインを構築している。
実験結果から,GIVEは時間的コヒーレンスと一貫した二次効果で忠実な幾何学的編集を行うことが示された。
論文 参考訳(メタデータ) (2026-06-23T07:11:45Z) - TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing [25.304236821424198]
高忠実なセマンティックな3Dシーン表現は、ロボット工学、自律運転、シミュレーションを含む多くのアプリケーションに不可欠である。
現在のアプローチでは、コントロール可能な編集を限定的にサポートしている。
本稿では,事前学習した2Dセマンティックな特徴をトランケーション対応の埋め込み空間に投影する手法であるTASEを紹介する。
論文 参考訳(メタデータ) (2026-06-02T08:25:53Z) - VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction [59.303842406260124]
VGGT-Editはテキスト条件のネイティブ3Dシーン編集のためのフィードフォワードフレームワークである。
本研究では,奥行き同期テキストインジェクションを導入し,意味的指導をバックボーンの空間的ポーズと整合させる。
VGGT-Editは2Dリフトベースラインを大幅に上回り、よりシャープなオブジェクトの詳細、より強力なマルチビュー一貫性、ほぼインスタントな推論速度を生み出している。
論文 参考訳(メタデータ) (2026-05-14T17:59:04Z) - CEI-3D: Collaborative Explicit-Implicit 3D Reconstruction for Realistic and Fine-Grained Object Editing [51.73433734209541]
既存の3D編集手法は、再構成ネットワークの深い統合性のために、非現実的で未精細な結果をもたらすことが多い。
本稿では,現実的できめ細かな編集を容易にするための,編集指向の再構築パイプラインであるCEI-3Dを紹介する。
提案手法は,最新技術(SOTA)手法よりも,よりリアルできめ細かな編集結果を実現すると同時に,編集時間を短縮する。
論文 参考訳(メタデータ) (2026-03-12T11:15:11Z) - InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning [60.799998743918955]
複雑な現実世界のシーンにおける微細な画像編集のためのテキストビジョンインターリーブド・チェーン・オブ・グラウンド推論フレームワークを提案する。
InterCoGの重要な洞察は、まずテキスト内でのみオブジェクト位置推論を実行することである。
また,マルチモーダル・グラウンド・ライティング・アライメント・アライメントとマルチモーダル・グラウンド・ライティング・アライメント・アライメントの2つの補助的トレーニング・モジュールを提案する。
論文 参考訳(メタデータ) (2026-03-02T08:13:16Z) - I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing [59.434028565445885]
I2Eは、画像編集を構造化された環境内の実行可能な相互作用プロセスとして再考する、新しい「分解・テーマ・アクション」パラダイムである。
I2EはDecomposerを使用して、非構造化画像を個別に操作可能なオブジェクト層に変換し、複雑な命令を解析するために、物理を意識したVision-Language-Action Agentを導入する。
I2Eは、複雑な構成命令の処理、物理的妥当性の維持、マルチターン編集安定性の確保において、最先端の手法よりも大幅に優れている。
論文 参考訳(メタデータ) (2026-01-07T09:29:57Z) - ReSpace: Text-Driven 3D Indoor Scene Synthesis and Editing with Preference Alignment [8.954070942391603]
ReSpaceはテキスト駆動型屋内シーン合成と編集のための生成フレームワークである。
教師付き微調整と選好アライメントを組み合わせた二段階学習手法を応用した。
シーン編集にはゼロショットLLMを用いてオブジェクトの削除と追加のプロンプトを行う。
論文 参考訳(メタデータ) (2025-06-03T05:22:04Z) - EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing [114.14164860467227]
自然言語コマンドで様々なレイアウト編集を実行できるフレームワークであるEditRoomを提案する。
特にEditRoomは、コマンドプランニングとターゲットシーンの生成にLarge Language Models(LLM)を利用している。
既存の3Dシーンデータセットを拡張する自動パイプラインを開発し,83kの編集ペアを備えた大規模データセットであるEditRoom-DBを導入した。
論文 参考訳(メタデータ) (2024-10-03T17:42:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。