論文の概要: Temporal State Transport in Video Generation: Diagnosing and Correcting Spectral Imbalance
- arxiv url: http://arxiv.org/abs/2609.08505v1
- Date: Tue, 08 Sep 2026 09:52:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.62659
- Title: Temporal State Transport in Video Generation: Diagnosing and Correcting Spectral Imbalance
- Title(参考訳): 映像生成における時間的状態移動 : スペクトル不均衡の診断と補正
- Abstract要約: 我々は時間的国家交通の観点から映像生成を研究する。
本稿では,病的側頭葉状態をソフトに補正するトレーニングフリーレギュレータであるSpectral Transport Homeostasisを提案する。
- 参考スコア(独自算出の注目度): 44.436870785777494
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable video generation requires more than high-quality frames to form a coherent story: a model must maintain a persistent state, transporting visual attributes such as identity, scene layout, motion, and fine details across time. Existing training-free methods mainly strengthen cross-frame attention or analyze local attention entropy, but these views do not reveal whether temporal interactions stay in a healthy transport regime. In this work, we study video generation through the perspective of Temporal State Transport. We introduce Spectral Tension, a signed diagnostic that compares local attention diffuseness with global spectral diversity, and use it to identify two opposite temporal failures: fragmented transport and over-mixing hotspots. Based on this diagnosis, we propose Spectral Transport Homeostasis, a training-free regulator that softly corrects pathological temporal states while largely preserving balanced ones. Experiments on pretrained video generation models show that the original model often occupies imbalanced temporal regimes, whereas our method selectively applies larger corrections to the worst temporal hotspots and improves temporal consistency and visual quality without finetuning. Code: https://github.com/lytang63/temporal-state-transport
- Abstract(参考訳): モデルは永続的な状態を維持し、アイデンティティ、シーンのレイアウト、動き、細かな詳細などの視覚的属性を時間にわたって輸送する必要がある。
既存のトレーニングフリー手法は主にクロスフレーム・アテンションを強化するか、あるいは局所的なアテンション・エントロピーを分析するものであるが、これらの見解は時間的相互作用が健全な輸送体制に留まっているかどうかを明らかにしていない。
本研究では,時間的国家交通の観点から映像生成について考察する。
我々は、局所的な注意拡散とグローバルなスペクトルの多様性を比較するサイン付き診断であるスペクトル張力を導入し、それを用いて、断片化された輸送と過剰混合ホットスポットの2つの反対の時間的障害を識別する。
本診断に基づき, ほぼバランスの取れた状態を維持しつつ, 病的側頭葉状態をソフトに補正する訓練自由度調節器であるSpectral Transport Homeostasisを提案する。
事前訓練されたビデオ生成モデルを用いた実験では、原モデルが時間的バランスの取れていない状態に占める場合が多いが、本手法では、最悪の時間的ホットスポットに対してより大きな補正を選択的に適用し、微調整なしで時間的一貫性と視覚的品質を改善する。
コード:https://github.com/lytang63/temporal-state-transport
関連論文リスト
- Generative Diffusion Surrogates with Analytical Variance Schedule [0.0]
輸送とは、最初に構造化された分布が未解決の強制、散乱、不均一な媒体の下で拡散する物理システムを指す。
ここでは、この分散の時間微分としてフォワードノイズ発生率を規定し、生成時間をキャリブレーションされた輸送クロックに変換する。
乱流プラズマの弾道-拡散輸送では、サロゲートは試験粒子分布と一致し、実験室で測定された分散スケールを再現し、スケジュール調整なしでシミュレーションされたクルトーシスの進化を追跡する。
論文 参考訳(メタデータ) (2026-09-01T18:00:00Z) - ChronoSSM: Training for Temporally Aware Representations in Autoregressive State Space Models [0.5366467936613011]
イベントとタイムスタンプを共有バックボーンでモデル化する自動回帰状態空間モデル(SSM)であるChronoSSMを紹介する。
時間的監視は、自己回帰イベントモデリングを著しく劣化させることなく、時間的により情報的な表現を生み出すことができることを示す。
論文 参考訳(メタデータ) (2026-08-10T18:35:19Z) - FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring [38.650762310010734]
本稿では,SSA(Spectral Self-Anchoring)による長ビデオ生成におけるエラー蓄積に対処するフリートレーニングフレームワークFreqForcingを提案する。
私たちのFreqForcingは、5sクリップで事前訓練されたSelf-Forcingを2分間に拡張し、24倍の補間を実現しています。
論文 参考訳(メタデータ) (2026-07-29T16:38:47Z) - CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating [49.94171749437024]
本稿では,ビジョンランゲージモデルに基づく粗大な異常報酬モデルである集中と集中(CaC)を提案する。
フレーム単位のバウンディングボックスアノテーション,時間的異常ウィンドウ,微粒な属性ラベルを備えた,最初の大規模ビデオ異常データセットを構築した。
実験では、CaCは微妙な異常に安定して集中することができ、微細な異常ベンチマークの精度が25.7%向上した。
論文 参考訳(メタデータ) (2026-05-12T08:08:33Z) - Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation [73.84423888025171]
オートレグレッシブ(AR)ビデオ拡散は,近年,長大なビデオ生成において有望なパラダイムとして浮上している。
時間的劣化が進行しているため, 生成から微小スケールの地平線への延長は依然として困難であることを示す。
本稿では,AR拡散のための時間記憶機構であるRelax Forcingを紹介する。
論文 参考訳(メタデータ) (2026-03-22T18:59:24Z) - CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models [92.04182855442254]
我々は、I2Vモデルの脆弱性を分析し、時間的制御機構が新たな攻撃面を構成することを発見し、それらを一様にモデル化することの難しさを明らかにする。
我々はCtrlAttackと呼ばれるトラジェクトリ制御攻撃を提案し、生成過程における状態の進化を妨害する。
実験結果から,低次元および高規則化摂動制約下であっても,時間的一貫性を著しく損なう可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-13T08:05:50Z) - BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models [50.986189632485285]
モデル自身のロールアウトから補正軌道を構築する自己教師型スキームであるバックワードアグリゲーション(BAgger)を導入する。
数段階の蒸留と分配整合損失に依存する従来のアプローチとは異なり、BAggerは標準的なスコアやフローマッチングの目的を持つ列車である。
因果拡散変換器でBAggerをインスタンス化し、テキスト・ツー・ビデオ、ビデオ・エクステンション、マルチプロンプト・ジェネレーションで評価する。
論文 参考訳(メタデータ) (2025-12-12T23:02:02Z) - Stable Video-Driven Portraits [52.008400639227034]
アニメーションは、ドライビングビデオから表現とポーズを再現することで、単一のソースイメージから写真リアルなビデオを生成することを目的としている。
拡散モデルを用いた最近の進歩は品質の向上を示しているが、弱い制御信号やアーキテクチャ上の制約によって制約されている。
本研究では, 眼, 鼻, 口などのマスク付き顔面領域を, 強力な動き制御手段として活用する新しい拡散型枠組みを提案する。
論文 参考訳(メタデータ) (2025-09-22T08:11:08Z) - Transient and steady-state chaos in dissipative quantum systems [0.0]
散逸的な量子カオスは、情報スクランブル、非単位進化、熱化の特徴づけと制御において中心的な役割を果たす。
確率行列玩具モデルを導入し,Ginibreスペクトルが定常カオスではなく短時間カオスを信号することを示す。
論文 参考訳(メタデータ) (2025-06-05T18:00:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。