論文の概要: No Corners Cut: State-Grounded Transitions for Mid-Stream Prompt Switches in Video Generation
- arxiv url: http://arxiv.org/abs/2609.38691v2
- Date: Tue, 06 Oct 2026 11:19:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.234745
- Title: No Corners Cut: State-Grounded Transitions for Mid-Stream Prompt Switches in Video Generation
- Title(参考訳): No Corners: ビデオ生成における中流プロンプトスイッチの状態遷移
- Abstract要約: このプロセスを明確にし、これらの遷移を忠実に実行するようにジェネレータを訓練する新しいフレームワークSEGUEを提案する。
各スイッチでは、トレーニング不要のプランナーが最新のフレームを解析してプロンプトし、いくつかのセグプロンプトを役割と期間で書き、その後、ユーザのプロンプトに制御を戻す。
SPANDMDは、フルロールアウトを使用して各アクティブプロンプトを時間的コンテキストとして評価し、プロンプトの割り当てられたスパン内でのみDMDの残余を保持する。
- 参考スコア(独自算出の注目度): 18.557372237470144
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Streaming video generators allow users to dynamically modulate video synthesis via mid-stream prompt switching. Existing streaming methods can respond to the updated instruction while still cutting corners, prematurely realizing goals or taking heuristic shortcuts that bypass necessary intermediate state changes needed for a plausible transition. In this study, we present SEGUE, a novel framework that makes this process explicit and trains the generator to execute these transitions faithfully. At each switch, a training-free planner parses the latest frame and prompts, writes a few segue prompts with roles and durations, and then hands control back to the user's prompt. Furthermore, to address the inherent difficulty of training causal models on short-lived temporal schedules without corrupting preparatory supervision, we introduce SPANDMD, which evaluates each active prompt using the full rollout as temporal context while retaining its DMD residual only within the prompt's assigned span. On OpenTrans-360, a benchmark of 1,800 switches that scores how the old state exits and the new one begins, SEGUE ranks first on all eight transition metrics and raises the overall score over the strongest baseline from 0.866 to 0.887. It also ranks first on four of six instruction-response metrics of StreamAV-Bench, while the planner transfers to frozen autoregressive generators without retraining. Project Page: https://anonymous.4open.science/w/No-Corners-Cut-6C5D/
- Abstract(参考訳): ストリーミングビデオジェネレータは、ビデオ合成を中間ストリームのプロンプトスイッチで動的に調整することができる。
既存のストリーミング手法は、更新された命令に応答し、コーナーを切断したり、目標を早期に実現したり、あるいは可算遷移に必要な中間状態の変更をバイパスするヒューリスティックなショートカットを取ることができる。
本研究では,このプロセスを明確にし,これらの遷移を忠実に実行するようにジェネレータを訓練する新しいフレームワークSEGUEを提案する。
各スイッチでは、トレーニング不要のプランナーが最新のフレームを解析してプロンプトし、いくつかのセグプロンプトを役割と期間で書き、その後、ユーザのプロンプトに制御を戻す。
さらに、予備監督を損なうことなく短寿命の時間スケジュールで因果モデルを訓練することの難しさに対処するため、SPANDMDを導入し、各アクティブプロンプトをフルロールアウトを用いて時間的文脈として評価し、プロンプトの割り当てられたスパン内のみにMDD残余を保持する。
古い状態の終了と新しい状態の開始をスコアする1,800のスイッチのベンチマークであるOpenTrans-360では、SEGUEが8つの遷移指標すべてでトップにランクインし、最強のベースラインを0.866から0.887に引き上げている。
また、StreamAV-Benchの6つの命令応答指標のうち4つにランクインし、プランナーは再訓練せずに凍結した自己回帰発電機に転送する。
Project Page: https://anonymous.4open.science/w/No-Corners-Cut-6C5D/
関連論文リスト
- TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL [72.7712729541565]
自己回帰(AR)ビデオ拡散モデルにより、ビデオチャンクをキャッシュされたビジュアルコンテキストでチャンクで合成することで、低レイテンシなストリーミング生成を可能にする。
1つのグローバルプロンプトは、どのサブイベントを各チャンクで実現すべきかを指定しないが、ステップワイズプロンプトにナビゲート的に切り替えると、しばしば遅延反応、ブレンドステップセマンティクス、プロンプト遷移間のエラー伝播につながる。
我々は、時間分解とステップ条件付き実行を協調的に最適化し、時間分解可能なARビデオ生成のためのプランナー-実行型強化学習フレームワークであるTempActでこれらの課題に対処する。
論文 参考訳(メタデータ) (2026-06-26T12:19:28Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models [81.32710031596591]
ビデオ推論タスクには、動きの追跡、時間順、フレーム全体の視覚状態の進化が必要である。
視覚言語モデル(LVLM)上に構築された既存の手法はしばしば、チェーン・オブ・ソート(CoT)を通じて推論を外部化することでこの問題に対処する。
STORMSは,LVLMに明示的なテキストCoTではなく,有界な連続的な潜在軌道を推論する2段階のフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T16:33:00Z) - Real-time Controllable Motion Transition for Characters [14.88407656218885]
リアルタイムの動作生成はゲームでは普遍的に必要であり、既存のアニメーションパイプラインでは非常に望ましい。
我々のアプローチは、運動多様体と条件遷移という2つの重要な構成要素から構成される。
提案手法は,複数の測定基準の下で測定された高品質な動きを生成できることを示す。
論文 参考訳(メタデータ) (2022-05-05T10:02:54Z) - Multimodal Transformer with Variable-length Memory for
Vision-and-Language Navigation [79.1669476932147]
VLN(Vision-and-Language Navigation)は、エージェントが目標位置に向かうために言語命令に従う必要があるタスクである。
近年のTransformer-based VLN法は,視覚的観察と言語指導の直接的な結びつきから大きな進歩を遂げている。
視覚的な自然言語ナビゲーションのための可変長メモリ(MTVM)を備えたマルチモーダルトランス (Multimodal Transformer) を提案する。
論文 参考訳(メタデータ) (2021-11-10T16:04:49Z) - End-to-end Temporal Action Detection with Transformer [86.80289146697788]
時間的アクション検出(TAD)は、トリミングされていないビデオにおいて、すべてのアクションインスタンスのセマンティックラベルとバウンダリを決定することを目的としている。
そこで我々は,textitTadTR と呼ばれる Transformer によるTAD のエンドツーエンドフレームワークを構築した。
本手法は,HACSセグメンツとTHUMOS14の最先端性能とActivityNet-1.3の競合性能を実現する。
論文 参考訳(メタデータ) (2021-06-18T17:58:34Z) - Relaxed Transformer Decoders for Direct Action Proposal Generation [30.516462193231888]
本稿では、直接アクション提案生成のためのシンプルでエンドツーエンドの学習可能なフレームワーク(RTD-Net)を提案する。
時間と空間の視覚的相違に対処するため、元の変換器検出フレームワーク(DETR)に対して3つの重要な改善を行った。
THUMOS14とActivityNet-1.3ベンチマークの実験では、RTD-Netの有効性が示されている。
論文 参考訳(メタデータ) (2021-02-03T06:29:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。