論文の概要: Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
- arxiv url: http://arxiv.org/abs/2606.28593v1
- Date: Fri, 26 Jun 2026 20:38:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.615417
- Title: Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
- Title(参考訳): Animation2Code:ビデオ・ツー・コード生成における時間的視覚的推論の評価
- Abstract要約: Animation2Codeは、ビデオからWebアニメーションコードを再構成することで、時間的視覚的推論を評価するためのベンチマークである。
本研究では、視覚的忠実度を時間的アライメントから切り離すことができる、外観的類似度と時間的類似性の2つのヒトアライメント指標を提案する。
- 参考スコア(独自算出の注目度): 19.381777207086007
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While recent vision-language models (VLMs) have achieved significant improvements on static visual-to-code tasks such as generating code for webpages, charts, or SVGs, it remains unclear whether they can recover temporal dynamics when motion is present. To this end, we introduce Animation2Code, a benchmark for evaluating temporal visual reasoning via reconstructing executable web animation code from videos. Animation2Code consists of 1,069 web animation videos with diverse visual appearances and motion patterns, paired with corresponding HTML/CSS/JavaScript implementations. We propose two human-aligned metrics, appearance similarity and temporal similarity, which allow us to disentangle visual fidelity from temporal alignment when comparing rendered animations against ground-truth samples. Benchmarking state-of-the-art VLMs on this dataset shows that current VLMs struggle to maintain temporal consistency in reconstruction, even when achieving high appearance similarity, including under finetuning and iterative refinement settings. Code and data are available at https://anya-ji.github.io/animation2code-website .
- Abstract(参考訳): 近年の視覚言語モデル(VLM)は、Webページ、チャート、SVGのコード生成などの静的ビジュアル・ツー・コードタスクにおいて大幅に改善されているが、動作時の時間的ダイナミクスを回復できるかどうかは不明である。
この目的のために、ビデオから実行可能なWebアニメーションコードを再構成することで、時間的視覚的推論を評価するためのベンチマークであるAnimation2Codeを紹介した。
Animation2Codeは、さまざまな視覚的外観とモーションパターンを持つ1,069のWebアニメーションビデオで構成されており、対応するHTML/CSS/JavaScript実装と組み合わせている。
本研究では,時間的アライメント(時間的アライメント)と視覚的アライメント(時間的アライメント)の2つの指標,外観的類似性と時間的類似性(時間的類似性)を提案する。
このデータセットで最先端のVLMをベンチマークすると、現在のVLMは、微調整や反復的な精錬設定を含む外観の類似性が高い場合であっても、再構築時の時間的一貫性を維持するのに苦労していることがわかる。
コードとデータはhttps://anya-ji.github.io/animation2code-website で公開されている。
関連論文リスト
- Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit [29.235206428769505]
我々は、実行可能なUI状態遷移を回復するためのアクション対応ビデオ・ツー・コード・アプローチであるVideo2Codeを紹介した。
Video2CodeはUIビデオ・コード生成の基盤となるオープンソースモデルを大幅に強化する。
論文 参考訳(メタデータ) (2026-06-16T11:40:48Z) - AnimationBench: Are Video Models Good at Character-Centric Animation? [67.15372653996833]
AnimationBenchはアニメーション画像とビデオの生成を評価するための最初の体系的なベンチマークである。
アニメーションの基本原則とIP保存を計測可能な評価次元に運用する。
リアリズム指向のベンチマークで見過ごされるアニメーション固有の品質差を公開する。
論文 参考訳(メタデータ) (2026-04-16T17:57:08Z) - MVAnimate: Enhancing Character Animation with Multi-View Optimization [55.4217617472079]
MVAnimateは,マルチビュー先行情報に基づく動的図形の2次元情報と3次元情報の両方を合成する新しいフレームワークである。
提案手法は,複数ビュー先行情報を利用して時間的一貫性と空間的整合性のあるアニメーション出力を生成する。
論文 参考訳(メタデータ) (2026-02-09T14:55:21Z) - Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure [57.89872230703339]
本稿では,信頼性の高いSVGアニメーションに必要なセマンティック構造を復元するフレームワークを提案する。
SVGをセマンティックグループに再編成することにより、VLMはより深いコヒーレンスを持つアニメーションを作成できる。
論文 参考訳(メタデータ) (2025-12-16T12:03:46Z) - Animate-X++: Universal Character Image Animation with Dynamic Backgrounds [32.04255747303296]
Animate-X++は、擬人化文字を含む様々な文字タイプ向けのDiTに基づく普遍的なアニメーションフレームワークである。
動作表現を強化するために,暗黙的かつ明示的な方法で動画から包括的な動作パターンをキャプチャするPose Indicatorを導入する。
第2の課題として、アニメーションとTI2Vタスクを共同でトレーニングするマルチタスクトレーニング戦略を導入する。
論文 参考訳(メタデータ) (2025-08-13T03:11:28Z) - LatentMove: Towards Complex Human Movement Video Generation [35.83863053692456]
我々は、高ダイナミックな人間のアニメーションに特化して設計されたDiTベースのフレームワークであるLatentMoveを提示する。
アーキテクチャには条件制御ブランチと学習可能なフェイス/ボディトークンが組み込まれており、フレーム間のきめ細かい詳細や一貫性を保っている。
I2Vシステムのロバスト性を評価するために設計された多種多様で挑戦的な人間の動きを特徴付けるデータセットである複合Human-Videos(CHV)を紹介する。
論文 参考訳(メタデータ) (2025-05-28T07:10:49Z) - MagicAnimate: Temporally Consistent Human Image Animation using
Diffusion Model [74.84435399451573]
本稿では、特定の動きシーケンスに従って、特定の参照アイデンティティのビデオを生成することを目的とした、人間の画像アニメーションタスクについて検討する。
既存のアニメーションは、通常、フレームウォーピング技術を用いて参照画像を目標運動に向けてアニメーションする。
MagicAnimateは,時間的一貫性の向上,参照画像の忠実な保存,アニメーションの忠実性向上を目的とした,拡散に基づくフレームワークである。
論文 参考訳(メタデータ) (2023-11-27T18:32:31Z) - AnimeRun: 2D Animation Visual Correspondence from Open Source 3D Movies [98.65469430034246]
既存の2次元漫画のデータセットは、単純なフレーム構成と単調な動きに悩まされている。
我々は,オープンソースの3D映画を2Dスタイルのフルシーンに変換することによって,新しい2Dアニメーション視覚対応データセットAnimeRunを提案する。
分析の結果,提案したデータセットは画像合成において実際のアニメに似るだけでなく,既存のデータセットと比較してよりリッチで複雑な動きパターンを持つことがわかった。
論文 参考訳(メタデータ) (2022-11-10T17:26:21Z) - Unpaired Motion Style Transfer from Video to Animation [74.15550388701833]
1つのアニメーションクリップからもう1つのアニメーションクリップへモーションスタイルを転送する一方で、後者のモーションコンテンツを保存することは、キャラクターアニメーションにおいて長年の課題であった。
本稿では,スタイルラベル付き動きの集合から学習する動きスタイル伝達のための新しいデータ駆動フレームワークを提案する。
本フレームワークでは,映像から直接動作スタイルを抽出し,3次元再構成をバイパスし,これらを3次元入力動作に適用することができる。
論文 参考訳(メタデータ) (2020-05-12T13:21:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。