論文の概要: Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds
- arxiv url: http://arxiv.org/abs/2606.26964v2
- Date: Fri, 26 Jun 2026 09:10:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 13:57:07.338213
- Title: Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds
- Title(参考訳): Look-Before-Move:ダイナミックな3Dストーリーワールドにおけるナラティブ・グラウンドワールド・アテンション
- Abstract要約: Look-Before-Moveは、監視仕様とモーション実行を分離するカメラ計画フレームワークである。
StoryBlenderをベースとしたダイナミックな3Dストーリーワールドベンチマークを構築し,50ストーリー,457シーン,アニメーションによる1585ショットをカバーした。
実験により,本フレームワークは主観的知覚,意図整合性,軌道品質を代表的ベースラインよりも向上することが示された。
- 参考スコア(独自算出の注目度): 22.4160057556312
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As embodied AI and world models increasingly operate in dynamic 3D environments, visual perception must move beyond passively interpreting given observations toward actively deciding what to observe. We study this problem through camera planning in dynamic 3D story worlds, where the camera must not only generate smooth motion, but also decide what visual evidence should be acquired before it moves. We formulate this capability as Narrative-Grounded World Visual Attention, where the camera acts as an embodied observer that determines what to observe, how to compose the observation, and how to shift attention over time under narrative intent and physical 3D constraints. To realize this capability, we propose Look-Before-Move, a camera planning framework that separates observation specification from motion execution. It first builds a Semantic Observation Contract to convert directorial intent into executable visual constraints, then performs Monte Carlo Viewpoint Search to find narrative-compliant and geometrically feasible viewpoints, and finally applies Semantic Trajectory Grounding to connect selected viewpoints into continuous, collision-aware, and temporally coherent camera motion. We further construct a dynamic 3D Story World Benchmark based on StoryBlender, covering 50 stories, 457 scenes, and 1585 shots with animated characters, semantic scene configurations, and executable 3D environments. Experiments show that our framework improves subject perception, intent consistency, and trajectory quality over representative baselines, demonstrating the importance of organizing visual attention before generating camera motion.
- Abstract(参考訳): AIと世界モデルはダイナミックな3D環境でますます機能するので、視覚的な知覚は、与えられた観察を受動的に解釈し、何を見るべきかを積極的に決定する必要がある。
ダイナミックな3Dストーリーの世界において、カメラはスムーズな動きを発生させるだけでなく、動き出す前にどのような視覚的証拠を取得するべきかを判断する必要がある。
我々は、この能力をナラティブ・グラウンド・ワールド・ビジュアル・アテンション(Narrative-Grounded World Visual Attention)として定式化し、カメラは、何を見るべきか、どのように構成するか、そして、物語の意図や物理的な3D制約の下で時間とともに注意を移すかを決定する具体的オブザーバーとして機能する。
この機能を実現するために,観測仕様と動作実行を分離したカメラ計画フレームワークであるLook-Before-Moveを提案する。
最初にセマンティック・オブザーブ・コントラクトを構築し、監督意図を実行可能な視覚的制約に変換するとともに、モンテカルロ・ビューポイント・サーチを行い、物語に忠実で幾何学的に実現可能な視点を見つけ、最後にセマンティック・トラジェクトリー・グラウンド(Semantic Trajectory Grounding)を適用して、選択された視点を連続的、衝突的、時間的に一貫性のあるカメラ・モーションに結びつける。
さらに,50ストーリー,457シーン,アニメーション文字による1585ショット,セマンティックシーン構成,実行可能な3D環境を含む,StoryBlenderに基づく動的3Dストーリーワールドベンチマークを構築した。
実験により,本フレームワークは主観的知覚,意図の整合性,軌道品質を代表ベースラインよりも向上し,カメラモーションを生成する前に視覚的注意を組織することの重要性が示された。
関連論文リスト
- Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models [11.352994779962208]
実写3次元レンダリングを用いた実写特性から視覚的変化を厳密に分離するベンチマークであるDyn-3Dを導入する。
計量物理基底真理をポリシー最適化に組み込むことで、TempoVistaは3D空間の視覚的表現を明確に定義する。
論文 参考訳(メタデータ) (2026-09-01T10:54:27Z) - WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory [106.28234880163723]
WorldDirectorは、高度に制御可能なビデオワールドモデルフレームワークである。
我々のフレームワークは、視覚生成から意味的な動きのオーケストレーションを明示的に分離する。
長時間の視界外から再突入しても,動的実体の正確な視覚的アイデンティティを保たせることができた。
論文 参考訳(メタデータ) (2026-07-02T17:59:59Z) - LIME: Learning Intent-aware Camera Motion from Egocentric Video [56.023644847494836]
自動回帰観測ゲイン出力と連続的なフローマッチングポーズヘッドを組み合わせた視覚言語カメラモーションジェネレータを提案する。
LIMEは、人間の受動的ビデオからカメラのポーズを積極的に選択し、通常の自我中心の録音を意図認識のアクティブな知覚の監督に変えることができる。
論文 参考訳(メタデータ) (2026-07-02T16:48:43Z) - SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation [50.175987640001644]
テキストから動的に編集可能な4Dシーンを生成するマルチエージェントフレームワークであるSimWorldsを紹介する。
また,プロシージャのダイナミックな3Dシーンの視覚的忠実度と身体的整合性を評価するベンチマークである4DBuildBenchも導入した。
論文 参考訳(メタデータ) (2026-07-02T06:29:18Z) - 3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement [51.22216867938034]
映像生成のための再構成3次元環境において,人間の動作軌跡を制御できる3次元モーションアニメーションフレームワークを提案する。
我々は,視点適応型潜伏融合機構を設計し,映像視認性マスキングによる点-雲の幾何前兆を生成過程に注入する。
2つの標準的な人体画像アニメーションベンチマークデータセットによる実験は、関連する映像生成のメカティクスにおける芸術的状況に対する我々の手法の顕著な改善を実証している。
論文 参考訳(メタデータ) (2026-06-29T16:22:54Z) - Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos [17.190262848866396]
本稿では,Action Genomeの映像をフィードフォワード3D再構成により4DシーンにアップグレードするデータセットであるActionGenome4Dを紹介する。
次に、各タイムスタンプでワールドシーングラフを構築するタスクであるワールドシーングラフ生成(WSGG)を定式化する。
我々は3つの補完的手法を提案し、それぞれが観測されていない物体について推論するための異なる帰納バイアスを探索する。
論文 参考訳(メタデータ) (2026-03-13T17:18:03Z) - Bringing Objects to Life: training-free 4D generation from 3D objects through view consistent noise [31.533802484121182]
テキストプロンプトを条件に4D生成を誘導することで,3Dオブジェクトをアニメーション化するためのトレーニング不要な手法を提案する。
まず,3次元メッシュを物体の視覚特性を保存する4次元ニューラルラジアンス場(NeRF)に変換する。
そして,テキスト駆動画像拡散モデルを用いてオブジェクトをアニメーション化する。
論文 参考訳(メタデータ) (2024-12-29T10:12:01Z) - Decoupling Dynamic Monocular Videos for Dynamic View Synthesis [50.93409250217699]
動的モノクロビデオからの動的ビュー合成の課題を教師なしで解決する。
具体的には、動的物体の運動を物体の動きとカメラの動きに分離し、教師なし表面の整合性およびパッチベースのマルチビュー制約によって規則化する。
論文 参考訳(メタデータ) (2023-04-04T11:25:44Z) - Neural Groundplans: Persistent Neural Scene Representations from a
Single Image [90.04272671464238]
本稿では,シーンの2次元画像観察を永続的な3次元シーン表現にマッピングする手法を提案する。
本稿では,永続的でメモリ効率のよいシーン表現として,条件付きニューラルグラウンドプランを提案する。
論文 参考訳(メタデータ) (2022-07-22T17:41:24Z) - Attentive and Contrastive Learning for Joint Depth and Motion Field
Estimation [76.58256020932312]
単眼視システムからシーンの3次元構造とともにカメラの動きを推定することは複雑な作業である。
モノクロ映像からの3次元物体運動場推定のための自己教師付き学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-10-13T16:45:01Z) - Unsupervised Video Prediction from a Single Frame by Estimating 3D
Dynamic Scene Structure [42.3091008598491]
まず,移動物体のセグメンテーションを含むシーンの潜伏3次元構造を推定するモデルを開発する。
そして、オブジェクトとカメラのダイナミクスをシミュレートし、その結果のビューをレンダリングすることで、将来のフレームを予測する。
自然ビデオの2つの挑戦的なデータセットの実験により、我々のモデルは単一のフレームから3次元構造と動きのセグメンテーションを推定できることを示した。
論文 参考訳(メタデータ) (2021-06-16T18:00:12Z) - Tracking Emerges by Looking Around Static Scenes, with Neural 3D Mapping [23.456046776979903]
本稿では,任意の場面(静的あるいは動的)における静止点のマルチビューデータを利用して,ニューラル3Dマッピングモジュールを学習することを提案する。
ニューラル3Dマッパーは、RGB-Dデータを入力として消費し、深い特徴の3Dボクセルグリッドを出力として生成する。
教師なし3Dオブジェクトトラッカーは、教師なし2Dと2.5Dのトラッカーよりも優れており、教師なし3Dオブジェクトトラッカーの精度に近づいていることを示す。
論文 参考訳(メタデータ) (2020-08-04T02:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。