論文の概要: Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization
- arxiv url: http://arxiv.org/abs/2608.13037v2
- Date: Fri, 14 Aug 2026 08:06:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.224768
- Title: Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization
- Title(参考訳): 推論時間勾配自由最適化による空間的広帯域テキスト・ビデオ生成
- Authors: Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord,
- Abstract要約: Diffusion Transformer Text-to-Videoモデルは優れた合成品質を実現している。
きめ細かい空間制御性は依然として重要な課題である。
そこで本研究では,空間的ガイダンスの精度向上のために,トレーニングフリーで勾配のない新しいアプローチを提案する。
- 参考スコア(独自算出の注目度): 46.49480145234397
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion Transformer Text-to-Video models have achieved remarkable synthesis quality, yet fine-grained spatial controllability remains a significant challenge. While existing training-free methods produce solid overall results in spatially grounded generation, \ie, placing a specific object in a designated location, they rely on gradient-based optimization techniques that incur prohibitive computational overhead, a bottleneck amplified in modern large-scale architectures. To address this limitation, we present Gradient-free Analytical Trajectory Optimization Video Generation (GATO-Vid), a novel training-free and gradient-free approach for precise spatial guidance. Rather than relying on costly backward passes, we introduce an alternative cross-attention score and solve it analytically to obtain an exact, closed-form solution. To use our analytical solution, we propose an on-the-fly injection mechanism tailored to the topological manifold of the transformer's latent space. Our experiments demonstrate that GATO-Vid significantly outperforms existing baselines in localization accuracy while introducing minimal computational overhead.
- Abstract(参考訳): 拡散トランスフォーマー テキスト・トゥ・ビデオモデルは、驚くほどの合成品質を達成したが、きめ細かい空間制御性は重要な課題である。
既存のトレーニング不要な手法は、空間的に接地された生成である \ie を特定の対象を指定された場所に配置するが、それらは、現代の大規模アーキテクチャで増幅されたボトルネックである、禁止的な計算オーバーヘッドを発生させる勾配に基づく最適化技術に依存している。
この制限に対処するため、我々は、空間的ガイダンスのための新しいトレーニングフリーで勾配なしのアプローチであるGATO-Vid(Gradient-free Analytical Trajectory Optimization Video Generation)を提案する。
コストのかかる後進パスに頼るのではなく、代替のクロスアテンションスコアを導入し、それを解析的に解決し、正確な閉形式解を得る。
解析解を用いるために,変圧器の潜伏空間の位相多様体に合わせたオンザフライ注入機構を提案する。
実験により,GATO-Vidは,計算オーバーヘッドを最小限に抑えながら,局所化精度において既存のベースラインを大幅に上回ることを示した。
関連論文リスト
- Need We Teach Foundation Models What is a Generative Image? Gradient-Free Generative Artifact Detection via Analytic Spectral Adaptation [3.881211374324378]
勾配ベースの更新による生成成果物の検出に基礎モデルを適用することで、本質的な表現が損なわれる。
本稿では,二分分類から外分布(OOD)異常測定問題への検出を緩和する勾配のない手法を提案する。
論文 参考訳(メタデータ) (2026-06-03T13:04:23Z) - Natural Functional Gradients for Smooth Trajectory Optimization [11.331190543795914]
本稿では,自然関数勾配を用いて,関数空間の幾何認識更新を直接行う軌道最適化フレームワークを提案する。
ブラックボックス軌道評価のみを必要とする自然関数勾配の実用的なモンテカルロ推定器を導出する。
制約されたロボット操作タスクの実験は,提案手法が軌道実現性を改善し,よりスムーズな動作を生み出すことを示す。
論文 参考訳(メタデータ) (2026-05-27T09:25:57Z) - Parallel Diffusion Solver via Residual Dirichlet Policy Optimization [88.7827307535107]
拡散モデル(DM)は、最先端の生成性能を達成したが、シーケンシャルなデノナイジング特性のため、高いサンプリング遅延に悩まされている。
既存のソルバベースの加速度法では、低次元の予算で画像品質が著しく低下することが多い。
本研究では,各ステップに複数の勾配並列評価を組み込んだ新しいODE解法であるEnsemble Parallel Directionsolvr(EPD-EPr)を提案する。
論文 参考訳(メタデータ) (2025-12-28T05:48:55Z) - Optimal Transport-Based Displacement Interpolation with Data Augmentation for Reduced Order Modeling of Nonlinear Dynamical Systems [0.0]
本稿では,複雑なシステムにおける非線形力学の表現を強化するために,最適輸送理論と変位を利用した新しいリダクション・オーダー・モデル(ROM)を提案する。
複雑なシステム挙動の予測における精度と効率の向上を示し、計算物理学や工学における幅広い応用の可能性を示している。
論文 参考訳(メタデータ) (2024-11-13T16:29:33Z) - Hierarchical Features Matter: A Deep Exploration of Progressive Parameterization Method for Dataset Distillation [44.03611131165989]
階層型生成蒸留(H-PD)と呼ばれる新しい生成パラメータ化法を提案する。
提案したH-PDは、等価な時間消費で様々な設定で大幅な性能向上を実現している。
IPC=1, IPC=10の超過圧縮比下での拡散モデルを用いて, 現在の再生蒸留を超越している。
論文 参考訳(メタデータ) (2024-06-09T09:15:54Z) - Constrained Optimization via Exact Augmented Lagrangian and Randomized
Iterative Sketching [55.28394191394675]
等式制約付き非線形非IBS最適化問題に対する適応的不正確なニュートン法を開発した。
ベンチマーク非線形問題,LVMのデータによる制約付きロジスティック回帰,PDE制約問題において,本手法の優れた性能を示す。
論文 参考訳(メタデータ) (2023-05-28T06:33:37Z) - Accelerating Inverse Learning via Intelligent Localization with
Exploratory Sampling [1.5976506570992293]
逆問題の解決は 物質と薬物発見の 長年の課題です
近年,逆問題の解法として深部生成モデルが提案されている。
逆学習を高速化する新しい手法(iPage)を提案する。
論文 参考訳(メタデータ) (2022-12-02T08:00:04Z) - The Neural Network shifted-Proper Orthogonal Decomposition: a Machine
Learning Approach for Non-linear Reduction of Hyperbolic Equations [0.0]
本研究では,統計的学習フレームワークにおいて,正しい前処理変換を自動的に検出する問題にアプローチする。
純粋にデータ駆動方式により、線形部分空間操作の既存のアプローチを未知の対流場を持つ非線形双曲問題に一般化することができる。
提案アルゴリズムは、その性能をベンチマークするために単純なテストケースに対して検証され、その後、多相シミュレーションに成功している。
論文 参考訳(メタデータ) (2021-08-14T15:13:35Z) - Pushing the Envelope of Rotation Averaging for Visual SLAM [69.7375052440794]
視覚SLAMシステムのための新しい最適化バックボーンを提案する。
従来の単分子SLAMシステムの精度, 効率, 堅牢性を向上させるために, 平均化を活用している。
我々のアプローチは、公開ベンチマークの最先端技術に対して、同等の精度で最大10倍高速に表示することができる。
論文 参考訳(メタデータ) (2020-11-02T18:02:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。