論文の概要: Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation
- arxiv url: http://arxiv.org/abs/2608.09355v1
- Date: Mon, 10 Aug 2026 09:35:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.186205
- Title: Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation
- Title(参考訳): 能率信号としてのアルファ:可視性制御されたRGBA画像-映像生成
- Authors: Zhe Li, Honghao Qiao, Zhixin Xu, Qijie Wang, Bo Peng, Dawei Li,
- Abstract要約: RGBAビデオはRGBの外観とアルファチャンネルを組み合わせることで、任意の背景にアニメーションアセットを適用することができる。
既存のRGBAビデオデータセットのほとんどは、フォトリアリスティックなコンテンツに支配されている。
従来のジェネレータ-マットパイプラインは、RGB合成後にのみアルファを推定する。
- 参考スコア(独自算出の注目度): 10.796062926739511
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: RGBA videos combine RGB appearance with an alpha channel, enabling animated assets to be applied across arbitrary backgrounds, which are heavily used in gaming industry. However, generating high-quality RGBA animations for games remains challenging for two reasons. First, most existing RGBA video datasets are dominated by photorealistic content, with limited coverage of game assets. Second, the traditional generate-then-matte pipelines estimate alpha only after RGB synthesis, so semi-transparent regions are often blurred by background, resulting in unstable matting outputs. More recently, many methods have begun to model RGB and alpha jointly, but existing approaches are mostly text-conditioned, and still have unresolved issues in efficiency and quality. To address these challenges, we introduce GameAlpha-2.4K, a 2.4K-clip game-style RGBA video dataset built with matte-friendly synthesis, multi-hypothesis alpha recovery, and compositing-based quality gates. Using this dataset, we train a reference-conditioned RGBA video generator that jointly produces RGB frames and alpha mattes in a single pass. To improve efficiency, we propose a visibility router that identifies transparent tokens in an early stage and bypasses their later DiT updates, while x_0-lock guides them along the original flow-matching schedule toward self-predicted endpoints. Our model obtains lower FVD than traditional two-stage pipelines, and the visibility router skips 35% of token evaluations in the final two DiT denoising steps, providing a 1.2x backbone speedup with negligible quality degradation compared to dense inference.
- Abstract(参考訳): RGBAビデオはRGBの外観とアルファチャンネルを組み合わせることで、ゲーム業界で多用されている任意の背景にアニメーションアセットを適用することができる。
しかし、ゲーム用の高品質なRGBAアニメーションを作成することは、2つの理由から困難である。
まず、既存のRGBAビデオデータセットのほとんどは、ゲーム資産の限られた範囲で、フォトリアリスティックなコンテンツに支配されている。
第二に、RGB合成後にのみアルファを推定するため、半透明領域は背景によって曖昧にされ、不安定な出力をもたらす。
最近では、RGBとアルファを共同でモデル化する手法が数多く存在するが、既存の手法はほとんどテキストで条件付けされており、効率と品質に未解決の問題がある。
これらの課題に対処するために,マットフレンドリーな合成,マルチハイブリッドアルファリカバリ,合成ベースの品質ゲートを備えた2.4Kクリップ型RGBAビデオデータセットであるGameAlpha-2.4Kを紹介した。
このデータセットを用いて、RGBフレームとアルファマットを1パスで共同で生成する参照条件付きRGBAビデオジェネレータを訓練する。
そこで我々は,早期の透明トークンを識別し,その後のDiT更新をバイパスする可視性ルータを提案する。
本モデルでは従来の2段パイプラインよりもFVDが低く, 可視性ルータは2段階のDiT復調ステップでトークン評価の35%をスキップする。
関連論文リスト
- Wan-Alpha: High-Quality Text-to-Video Generation with Alpha Channel [14.361698701397545]
Wan-Alphaは、RGBとアルファチャネルを共同で学習することで透明なビデオを生成する新しいフレームワークである。
我々のモデルは最先端の手法と比較して、視覚的品質、動きリアリズム、透明性のレンダリングにおいて優れた性能を示す。
論文 参考訳(メタデータ) (2025-09-29T16:08:21Z) - AlphaVAE: Unified End-to-End RGBA Image Reconstruction and Generation with Alpha-Aware Representation Learning [32.798523698352916]
ALPHAは、標準RGBメトリクスを標準背景のアルファブレンディングにより4チャンネル画像に適応する最初の総合RGBAベンチマークである。
さらに、専用アルファチャンネルを組み込むことで、事前訓練されたRGB VAEを拡張した、統一されたエンドツーエンドRGBA VAEであるALPHAVAEを紹介する。
我々のRGBA VAEは、従来の1Mに比べて8K画像のみに基づいて訓練されており、PSNRでは+4.9dB、再構築時にはLayerDiffuseよりも+3.2%のSSIM向上を実現している。
論文 参考訳(メタデータ) (2025-07-12T14:53:42Z) - Human Activity Recognition using RGB-Event based Sensors: A Multi-modal Heat Conduction Model and A Benchmark Dataset [65.76480665062363]
人間の活動認識は主に、高性能な活動認識を実現するために従来のRGBカメラに依存していた。
照明不足や急激な動きといった現実のシナリオにおける課題は、必然的にRGBカメラの性能を低下させる。
本研究では,RGBとイベントカメラを組み合わせることで,人間の活動認識を再考する。
論文 参考訳(メタデータ) (2025-04-08T09:14:24Z) - TransPixeler: Advancing Text-to-Video Generation with Transparency [43.6546902960154]
本稿では,従来のRGB機能を維持しつつ,RGBA生成のための事前学習ビデオモデルを拡張する方法であるTransPixelerを紹介する。
提案手法は,多彩で一貫したRGBA動画を効果的に生成し,VFXやインタラクティブなコンテンツ制作の可能性を高める。
論文 参考訳(メタデータ) (2025-01-06T13:32:16Z) - Meta 3D AssetGen: Text-to-Mesh Generation with High-Quality Geometry, Texture, and PBR Materials [58.178540282148475]
AssetGenはテキストから3D生成の大幅な進歩である。
テクスチャと素材制御を備えた忠実で高品質なメッシュを生成する。
論文 参考訳(メタデータ) (2024-07-02T17:21:47Z) - Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient
Object Detection [67.33924278729903]
本研究では,Dual Swin-Transformerを用いたMutual Interactive Networkを提案する。
視覚入力における長距離依存をモデル化するために,RGBと奥行きモードの両方の機能抽出器としてSwin-Transformerを採用している。
5つの標準RGB-D SODベンチマークデータセットに関する総合的な実験は、提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2022-06-07T08:35:41Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。