論文の概要: LoGo: Local-Global Rewards for Consistent Long-Horizon Video Generation
- arxiv url: http://arxiv.org/abs/2610.03636v1
- Date: Fri, 02 Oct 2026 17:26:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.51596
- Title: LoGo: Local-Global Rewards for Consistent Long-Horizon Video Generation
- Title(参考訳): LoGo:一貫した長距離ビデオ生成のためのローカルGlobal Rewards
- Abstract要約: カメラ制御ビデオモデルに対して,グローバルおよび空間的局所的な報酬をブレンドするLoGoを紹介する。
局所的な報酬はきめ細かなクレジット割り当てを提供し、3D一貫性を大幅に向上させる。
LoGoはDL3DVとTrajectoryBenchに対して明確な優位性を示している。
- 参考スコア(独自算出の注目度): 41.845453257675196
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Camera-controlled video models are rapidly advancing toward long generation horizons and complex camera control. A key failure mode is 3D inconsistency: as the camera moves, objects lose permanence and scene structures shift. Existing post-training techniques, which assign a single scalar reward to the entire generation, are poorly suited to correcting these inconsistencies over long horizons. We introduce LoGo, which blends global and spatially localized rewards for camera-controlled video models. The local reward provides fine-grained credit assignment, which substantially improves 3D consistency, while the global reward preserves camera following and video quality. Across three base models, LoGo shows a clear advantage on DL3DV and TrajectoryBench, a new benchmark for long-horizon, complex-camera-control generation that current evaluations lack. LoGo effectively reduces local object shifts, artifacts, and global scene changes, illustrating the importance of credit assignment in post-training video models. Project website: https://ziqi-ma.github.io/logo-website/
- Abstract(参考訳): カメラ制御ビデオモデルは、長期の地平線と複雑なカメラ制御に向かって急速に進歩している。
カメラが動くと、オブジェクトは永続性を失い、シーン構造はシフトする。
既存のトレーニング後のテクニックは、世代全体に対して単一のスカラー報酬を割り当てるが、これらの不整合を長い地平線上で修正するには適していない。
カメラ制御ビデオモデルに対して,グローバルおよび空間的局所的な報酬をブレンドするLoGoを紹介する。
ローカルな報酬はきめ細かいクレジットの割り当てを提供し、3Dの一貫性を大幅に向上させ、グローバルな報酬はカメラの追従とビデオの品質を保っている。
3つのベースモデル全体で、LoGoはDL3DVとTrajectoryBenchに対して明確な優位性を示している。
LoGoは、ローカルオブジェクトのシフト、アーティファクト、グローバルなシーンの変更を効果的に削減し、トレーニング後のビデオモデルにおけるクレジット割り当ての重要性を浮き彫りにする。
プロジェクトウェブサイト:https://ziqi-ma.github.io/logo-website/
関連論文リスト
- TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting [17.23436401314677]
ビデオの再撮影は、コントロール可能なカメラモーションと視点でビデオを再生することを目的としている。
TARSは従来の方法よりも正確で時間的に一貫したカメラ制御を提供する。
論文 参考訳(メタデータ) (2026-07-30T14:18:43Z) - CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback [43.174121093566264]
我々は、Reward Feedback Learningを構築し、カメラの制御性をさらに向上することを目指している。
現在の報酬モデルには、ビデオカメラのアライメントを評価する能力がない。
本稿では,映像遅延を3次元表現にデコードして報酬量子化を行う,効率的なカメラ対応3Dデコーダを提案する。
論文 参考訳(メタデータ) (2026-01-22T18:59:56Z) - Pixel-to-4D: Camera-Controlled Image-to-Video Generation with Dynamic 3D Gaussians [7.051077403685518]
人間は、1つの画像だけを与えられたシーンの将来のダイナミクスを予測するのに優れています。
この能力を模倣できるビデオ生成モデルは、インテリジェントシステムにとって不可欠なコンポーネントである。
最近のアプローチでは、単一画像条件のビデオ生成における時間的コヒーレンスと3次元の整合性が改善されている。
論文 参考訳(メタデータ) (2026-01-02T13:04:47Z) - Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation [66.95956271144982]
本稿では,単一画像から一貫した3Dポイントクラウドシーケンスを生成する新しいビデオ拡散フレームワークであるVoyagerを紹介する。
既存のアプローチとは異なり、Voyagerはフレーム間で固有の一貫性を持って、エンドツーエンドのシーン生成と再構築を実現している。
論文 参考訳(メタデータ) (2025-06-04T17:59:04Z) - GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control [88.90505842498823]
本稿では,正確なカメラ制御と時間的3次元一貫性を備えた生成ビデオモデルGEN3Cを提案する。
以上の結果から,従来の作業よりも精密なカメラ制御と,スパースビューの新規ビュー合成の最先端結果が得られた。
論文 参考訳(メタデータ) (2025-03-05T18:59:50Z) - CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation [117.16677556874278]
我々はCamCoを導入し、細粒度カメラのポーズ制御を画像からビデオへ生成する。
生成したビデオの3D一貫性を高めるため,各アテンションブロックにエピポーラアテンションモジュールを統合する。
実験の結果,CamCoは従来のモデルに比べて3次元の整合性とカメラ制御能力を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2024-06-04T17:27:19Z) - Reconstructing Hand-Held Objects in 3D from Images and Videos [53.277402172488735]
モノクローナルなRGB映像が与えられると、時間とともに手持ちの物体の幾何学を3Dで再構築することを目指している。
1枚のRGB画像から手と物体の形状を共同で再構成するMCC-Hand-Object(MCC-HO)を提案する。
次に、GPT-4(V)を用いてテキストから3D生成モデルを作成し、画像中のオブジェクトにマッチする3Dオブジェクトモデルを検索する。
論文 参考訳(メタデータ) (2024-04-09T17:55:41Z) - Persistent Nature: A Generative Model of Unbounded 3D Worlds [74.51149070418002]
任意のカメラポーズから3Dデコーダとボリュームレンダリングによって描画できる拡張可能な平面配置グリッドを提案する。
この表現に基づいて、単一視点のインターネット写真のみから生成的世界モデルを学ぶ。
提案手法は,現在の3次元生成モデルの固定境界を超えるシーン外挿を可能にするとともに,永続的でカメラに依存しない世界表現をサポートする。
論文 参考訳(メタデータ) (2023-03-23T17:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。