論文の概要: Diagnosing Under-Development of Irreversible Processes in Video Generation
- arxiv url: http://arxiv.org/abs/2608.00617v1
- Date: Sat, 01 Aug 2026 12:16:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.827288
- Title: Diagnosing Under-Development of Irreversible Processes in Video Generation
- Title(参考訳): 映像生成における不可逆過程の診断
- Authors: Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao,
- Abstract要約: 氷は溶けるが、再凍ることはないが、紙炭は燃やさない。
我々は、この疑問は測ることが難しいことを示し、確実に測定できることは、逆転ではなく、啓発であることを示した。
- 参考スコア(独自算出の注目度): 28.97171921966014
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many physical attributes are \emph{irreversible}: ice melts but does not re-freeze, paper chars but does not un-burn. Do video generators respect this? We show the question is hard to measure, and that what can be measured reliably is \emph{development} rather than reversal. Metrics of local reversal are null-degenerate: a per-clip violation rate scores $0.50$ on pure noise, and a variance-normalized reversal residual sits at its noise ceiling. What survives null-testing is a two-part protocol: progress (a directional attribute correlation) and a stasis rate. Under this protocol, generated video separates cleanly from real footage, and the gap is human-validated. Across seven text-to-video models, real reference footage advances ($ρ{=}{+}0.40$, $35\%$ static) while every generator shows near-zero progress and $92$--$100\%$ stasis; nine annotators rate real footage far above generated ($2.75$ vs.\ $0.99$ on a $0$--$4$ scale). The reliable finding is \emph{under-development}: generators barely advance irreversible attributes rather than reversing them. As a complementary mechanism, we show that post-hoc readout guidance is gameable, whereas enforcing monotonicity by construction in a disentangled attribute latent removes the gameable readout, validated in controlled and semi-synthetic settings.
- Abstract(参考訳): 氷は溶けるが、再凍ることはないが、紙のチャーは燃やさない。
ビデオジェネレータはこのことを尊重していますか?
質問は測ることは困難であり、確実に測定できるものは逆転ではなく「emph{development}」であることを示す。
1クリックあたりの違反率は、純粋なノイズに対して0.50$で、分散正規化された反転残差はそのノイズ天井に置かれる。
null-testingを生き残るのは、プログレス(方向属性の相関)とスタシスレートという2つの部分のプロトコルです。
このプロトコルでは、生成されたビデオは実際の映像からきれいに分離され、そのギャップは人間によって検証される。
7つのテキスト・ビデオ・モデル全体で、実際の参照映像は(ρ{=}{+}0.40$, $35\%$ static)、どのジェネレータもほぼゼロに近い進歩を示し、9,2$-100\%$ stasis; 9のアノテーションが生成された実際の映像を2.75$ vs.\ $0.99$ on a $0$--4$ scale)。
信頼できる発見は \emph{under-development} である。
相補的なメカニズムとして、ポストホック読み出し指導はゲーム可能であり、一方、非絡み合った属性ラテントにおける構築による単調性は、制御された半合成設定で検証されるゲーム可能読み出しを除去する。
関連論文リスト
- Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors [51.56484100374058]
自動回帰モデルは、長時間のロールアウトでエラーを蓄積しますが、デプロイ時には、それを測定するための基本的な真実はありません。
我々は、方向フラグを介して動的システムを前方または後方にステップする単一の条件付き潜在拡散モデルを訓練する。
この双方向性は測定不要なテスト時間誤差信号を提供することを示す。
論文 参考訳(メタデータ) (2026-08-01T13:49:46Z) - Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control [41.15180918658398]
我々は、未来を構成する計算が再利用可能な場合、世界生成モデルは最も再利用可能であると論じる。
本稿では,この計算を現在の視覚的コンテキストと言語命令から予測された表現に変換するEnfoldを提案する。
LIBERO、RoboTwin2.0、および実ロボットタスク全体で、Enfoldは強力な制御をサポートし、アクション遅延をFast--WAMと比較して3.7Times$減らし、Enfold-Flashは10.1times$に達した。
論文 参考訳(メタデータ) (2026-07-29T09:17:33Z) - Breaking the Total Variance Barrier: Sharp Sample Complexity for Linear Heteroscedastic Bandits with Fixed Action Set [93.03556214432615]
本稿では,学習過程を通じて動作セットをプレフィックスするヘテロセシダスティックノイズによる線形帯域問題を再検討する。
本稿では,情報ゲインを最大化するアクションを積極的に探求する,大規模アクション集合のための分散適応アルゴリズムのtexttVAEEを提案する。
音素平均依存率が避けられないことを示す固定作用集合に対して、ほぼ一致する下界を確立する。
論文 参考訳(メタデータ) (2026-07-26T14:24:34Z) - Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream [0.764671395172401]
AI生成ビデオの検出器はオフラインで評価される。
クリップはピクセルにデコードされ、大きな視覚言語モデルによって1回得点される。
我々は、タスクをストリーミング認識として再キャストし、すでに書いた動き場をビットストリームにスコアする。
論文 参考訳(メタデータ) (2026-07-21T18:00:51Z) - Variance-Reduced Trajectory Unravelings for GPU Noisy Quantum-Circuit Simulation: Characterization and a Qiskit-Aer Integration Gap [0.0]
共分散が還元された非発散体 -- プロジェクターとアナログサンプリング -- は、ばらつきを著しく削減したことを示す。
Qiskit-Aerのttbatched_shots_gpuの$n=10$より少ないトラジェクトリで、20.8times$のターゲット標準エラーに達する。
Aer's Born-rule collapse machines は既に存在するので、我々はこの技術を生産中に解き放つ最小限の変更を規定する。
論文 参考訳(メタデータ) (2026-07-20T08:28:31Z) - Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation [39.009217034010796]
ノイズガイド最適化(TANGO)による端末点回避について紹介する。
我々の手法は、VBenchの最先端技術に対する絶対的な改善を3.1%で達成し、Fréchet Video Distanceを平均で15ドルのビデオで28.3%削減する。
論文 参考訳(メタデータ) (2026-07-17T11:07:07Z) - A global predicted-fMRI drive signal from TRIBE does not predict YouTube replay heatmaps [0.0]
マルチモーダル脳エンコーディングモデルは、自然なビデオに対するfMRI応答を高精度に予測する。
TRIBEを48本のYouTubeビデオで実行し、秒単位のエンゲージメント曲線に対する予測された皮質反応を削減します。
TRIBEの入力ストリームでプローブを実行すると、少なくとも小さな境界線視覚ストリーム信号が明らかになる。
我々は、YouTubeのSABRストリーミングに堅牢なコード、ビデオIDマニフェスト、ヒートマップ取得方法をリリースする。
論文 参考訳(メタデータ) (2026-07-01T19:03:17Z) - CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis [49.596677723190886]
スケッチベースの似顔絵合成は、基本的な失敗モードに悩まされる。
アイデンティティと形状の条件は拡散モデルに組み合わされ、地味な肖像画や認識不能な歪みに対して崩壊する。
並列な未汚染拡散経路を通じてこの汚染を明示的に解消する最初の訓練不要な手法であるCaricHarmonyを提案する。
論文 参考訳(メタデータ) (2026-06-11T22:57:59Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。