論文の概要: SPHERE: Adaptive VR Indoor Scene Generation via LLM-Enhanced Spatial Preference Learning and Human-in-the-Loop RL
- arxiv url: http://arxiv.org/abs/2610.02023v1
- Date: Thu, 01 Oct 2026 16:43:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.307107
- Title: SPHERE: Adaptive VR Indoor Scene Generation via LLM-Enhanced Spatial Preference Learning and Human-in-the-Loop RL
- Title(参考訳): SPHERE: LLMによる空間選好学習と人間-the-the-Loop RLによる適応型VR室内シーン生成
- Abstract要約: SPHEREは、独立合成を連続した人間とAIの共創に変換する適応型VR生成フレームワークである。
自然なマルチモーダル相互作用から永続的な空間的嗜好を抽出する。
これらの生編集を階層的制約に抽象化し、局所的機能的および大域的トポロジ的文脈の両方をモデル化する。
- 参考スコア(独自算出の注目度): 9.103837104517888
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Large Language Models (LLMs) advance 3D indoor scene synthesis, current pipelines fail to retain user-specific preferences across sessions, making immersive authoring a repetitive and physically fatiguing process. We present SPHERE, an adaptive VR generation framework that transforms isolated synthesis into continuous human-AI co-creation. SPHERE extracts persistent spatial preferences from natural multimodal interactions (speech and controller edits). To ensure geometric resilience against spatial distortions, it abstracts these raw edits into hierarchical constraints modeling both local functional and global topological contexts. Furthermore, a human-in-the-loop reinforcement learning mechanism dynamically updates retrieval policies based on the user's final edited scenes. A mixed-design user study ($N=42$) and an offline ablation demonstrate that SPHERE significantly reduces corrective edits and physical demand, preventing bias toward shallow object-level traits to yield geometrically resilient, profile-aligned layouts. Ultimately, SPHERE demonstrates how capturing demonstrated spatial logic enables controlled spatial adaptation, establishing a reliable, governed human-AI collaboration framework for immersive authoring. Project page and source code will be available at: https://github.com/hyeonmin11/SPHERE
- Abstract(参考訳): LLM(Large Language Models)が屋内シーンの3D合成を前進させる一方で、現在のパイプラインはセッション間でユーザ固有の嗜好を維持することができず、没入的なオーサリングが反復的で物理的に不利なプロセスになる。
独立合成を連続した人間とAIの共創に変換する適応型VR生成フレームワークSPHEREを提案する。
SPHEREは、自然なマルチモーダル相互作用(音声とコントローラの編集)から永続的な空間的嗜好を抽出する。
空間歪みに対する幾何学的レジリエンスを確保するため、これらの原編集を局所的機能的および大域的位相的文脈の両方をモデル化する階層的制約に抽象化する。
さらに、人道支援学習機構は、ユーザの最終的な編集シーンに基づいて、動的に検索ポリシーを更新する。
複合設計ユーザスタディ(N=42$)とオフラインアブレーションは、SPHEREが修正編集と物理的要求を著しく低減し、浅いオブジェクトレベルの特性に対するバイアスを防止し、幾何学的にレジリエントなプロファイル整列レイアウトが得られることを示した。
最終的にSPHEREは、実証された空間論理をキャプチャすることで、制御された空間適応を可能にし、没入的なオーサリングのための信頼性の高い管理された人間とAIの協調フレームワークを確立することを実証する。
プロジェクトページとソースコードは、https://github.com/hyeonmin11/SPHEREで利用可能になる。
関連論文リスト
- DEAL-Grasp: Decoupled Alignment Representation for Geometry-Aware Dexterous Grasp Generation [10.173872050793895]
既存の巧妙なグリップ合成法は、通常、関節空間におけるポーズを回帰または復調する。
本稿では,アライメント空間生成としてグリップ合成を再構成するDEAL-Graspを提案する。
MultiDexとゼロショットのRealDexベンチマーク全体で、DEAL-Graspは高い強制摂動成功率を達成する。
論文 参考訳(メタデータ) (2026-09-23T13:56:26Z) - Dynamic-Robust Photometric-Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding [63.599342750566485]
SPARは、潜在空間アグリゲーションの前に過渡的ダイナミックノイズを明示的に分離する新しい意味幾何学的エンコーディングアーキテクチャである。
エンド・ツー・エンドのアプローチは例外的な新規なビュー合成品質を実現し、PSNRは22.15dB、23.33dBでそれぞれ3と4の入力ビューしか与えられなかった。
論文 参考訳(メタデータ) (2026-08-29T09:58:24Z) - SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video [88.79625979053873]
事前学習型視覚言語モデル(VLM)のための新しいフレームワークSpaceEraを提案する。
データ構築、モデル設計、トレーニング最適化、推論の促進にまたがる、SpaceEra++と呼ばれる、オリジナルのフレームワークを包括的なシステムに拡張します。
さらに,空間的推論を強化するために,絶対座標と相対空間関係を協調的に利用することにより,対物制約を強制するSpaceAlignを開発した。
論文 参考訳(メタデータ) (2026-07-02T06:56:29Z) - Plan in Sandbox, Navigate in Open Worlds: Learning Physics-Grounded Abstracted Experience for Embodied Navigation [63.11032720821731]
textitSAGEは、エージェントがフォトリアリスティックなシミュレーションではなく、物理基底のセマンティック抽象化内で学習することを可能にするフレームワークである。
textitSAGEは、A-EQA上で53.21% LLM-Match Success Rateを達成することで、プランナー支援の実施ナビゲーションを大幅に改善することを示した。
論文 参考訳(メタデータ) (2026-05-11T07:34:30Z) - Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models [50.14156501544165]
空間的推論は3次元シーンにおける空間的関係に基づく対象物の位置決めに焦点を当てる。
従来のアプローチでは、大規模言語モデルの入力空間に3Dシーン表現を注入しようと試みてきた。
オブジェクト数に線形な入力長を持つ新しい位置埋め込み法であるQuatRoPEを提案する。
論文 参考訳(メタデータ) (2026-03-25T18:46:23Z) - From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors [54.84863164684646]
既存の視覚言語アクション(VLA)モデルは3Dの現実世界で機能するが、通常は2Dエンコーダ上に構築される。
本研究では,アクションヘッドにリッチな3次元空間トークンを注入する新しいパラダイムであるFALCONを紹介する。
論文 参考訳(メタデータ) (2025-10-20T11:26:45Z) - ReSem3D: Refinable 3D Spatial Constraints via Fine-Grained Semantic Grounding for Generalizable Robotic Manipulation [12.059517583878756]
本稿では,意味的に多様な環境に対する統一的な操作フレームワークReSem3Dを提案する。
本稿では,ReSem3Dがゼロショット条件下で多様な操作を行い,適応性と一般化性を示すことを示す。
論文 参考訳(メタデータ) (2025-07-24T10:07:31Z) - Implicit Neural Spatial Representations for Time-dependent PDEs [29.404161110513616]
Inlicit Neural Spatial Representation (INSR) は空間依存ベクトル場の効果的な表現として登場した。
本研究は,INSRを用いた時間依存型PDEの解法について検討する。
論文 参考訳(メタデータ) (2022-09-30T22:46:40Z) - Scene Synthesis via Uncertainty-Driven Attribute Synchronization [52.31834816911887]
本稿では,3次元シーンの多様な特徴パターンを捉えるニューラルシーン合成手法を提案する。
提案手法は,ニューラルネットワークと従来のシーン合成手法の双方の長所を結合する。
論文 参考訳(メタデータ) (2021-08-30T19:45:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。