論文の概要: FSFVE: Few Shot Compressed Face Video Enhancement
- arxiv url: http://arxiv.org/abs/2607.11040v1
- Date: Mon, 13 Jul 2026 03:12:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.321829
- Title: FSFVE: Few Shot Compressed Face Video Enhancement
- Title(参考訳): FSFVE:顔の映像を圧縮するカメラ
- Authors: Varun Ramesh Jois, Antonella DiLillo, James Storer,
- Abstract要約: 高度に圧縮されたビデオコールを向上するための新しいフレームワークを提案する。
顔の10フレームしか持たない状態で、素早くモデルを訓練して、ビデオコールのインスタンスを強化できることが示されています。
モデルは通話前または通話中のいずれかでトレーニングすることができ、より良い品質のビデオを生成することで通話の残りの部分を強化することができる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Videocalling has become a popular form of communication in the world today, with many companies providing free services for it. However, there are still millions of people around the world that experience poor quality videocalls due to limitations in bandwidth. This despite, most people having the required hardware. In this paper we present a novel framework for enhancing highly compressed videocalls. We show, that with as little as 10 frames of the face, we can rapidly (in under 100 seconds) train a model to enhance that instance of the videocall. The model can be trained either prior to or during the call, enhancing the rest of the call by producing better quality video. The video conferencing application need not be modified - it can be off the shelf with our system as a layer on top that trains quickly then simply lets the video conferencing application (e.g. Zoom) run as usual, where our system intercepts and improves images before they are displayed. The model is designed to run in realtime on low-compute devices such as a typical laptop CPU. Experimentally, we show that the model significantly improves quality of compressed face video both quantitatively as well as perceptually. Code can be found at https://github.com/varun-jois/FSFVE.
- Abstract(参考訳): 今日、ビデオ通話は世界中で人気があり、多くの企業が無料サービスを提供している。
しかし、帯域幅の制限により、質の悪いビデオ通話を経験する人は世界中に何百万人もいる。
しかし、ほとんどの人は必要なハードウェアを持っている。
本稿では,高度に圧縮されたビデオ通話を実現するための新しいフレームワークを提案する。
10フレームの顔しか持たない状態で、高速(100秒未満)でモデルをトレーニングして、ビデオコールのインスタンスを拡大できることが、私たちは示しています。
モデルは通話前または通話中のいずれかでトレーニングすることができ、より良い品質のビデオを生成することで通話の残りの部分を強化することができる。
ビデオ会議アプリケーションは、変更する必要はなく、私たちのシステムを最上層として棚から外し、素早くトレーニングし、ビデオ会議アプリケーション(例:Zoom)を通常通り実行させます。
このモデルは、典型的なラップトップCPUのような低スループットデバイス上でリアルタイムに実行されるように設計されている。
実験により,圧縮顔画像の品質は定量的にも知覚的にも有意に向上することが示された。
コードはhttps://github.com/varun-jois/FSFVEで見ることができる。
関連論文リスト
- RTFVE: Realtime Face Video Enhancement [0.0]
ビデオデコーダに簡単に組み込むことができ、通常のCPU上でリアルタイムに実行できるRTFVE(Realtime Face Video Enhancement)モデルを導入する。
実験により, 圧縮ビデオベースラインよりも低設定で知覚品質が向上することが確認された。
論文 参考訳(メタデータ) (2026-07-13T02:58:44Z) - REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents [110.41795676048835]
大規模アプリケーションにとって重要な障害のひとつは、高価なトレーニングと推論コストである。
我々は、ビデオには画像よりもはるかに冗長な情報が含まれており、非常に少ない動きでエンコードできると主張している。
我々は、映像を非常に圧縮された潜在空間に投影する画像条件付きVAEを設計し、コンテンツ画像に基づいてデコードする。
論文 参考訳(メタデータ) (2024-11-20T18:59:52Z) - Movie Gen: A Cast of Media Foundation Models [133.41504332082667]
高品質の1080pHDビデオを生成する基礎モデルのキャストであるMovie Genについて紹介する。
ユーザの画像に基づいて,高精度な命令ベースのビデオ編集やパーソナライズされたビデオの生成などの追加機能を示す。
論文 参考訳(メタデータ) (2024-10-17T16:22:46Z) - Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video
Synthesis [69.83405335645305]
映像生成領域に画像モデルの進化をもたらすことによって、動きの忠実度、視覚的品質、スケーラビリティを損なうことが議論されている。
この作業では、これらの課題に体系的に対処するビデオファーストモデルであるSnap Videoを構築します。
画像生成の背後にあるワークホースであるU-Netは、ビデオ生成時に低スケールであり、計算オーバーヘッドがかなり必要であることを示す。
これにより、初めて数十億のパラメータを持つテキスト・ビデオモデルを効率的にトレーニングし、多数のベンチマークで最先端の結果に到達し、はるかに高い品質、時間的一貫性、動きの複雑さの動画を生成することができる。
論文 参考訳(メタデータ) (2024-02-22T18:55:08Z) - Compressed Vision for Efficient Video Understanding [83.97689018324732]
本稿では,2時間ビデオの処理が可能なハードウェアを用いて,時間長動画の研究を可能にするフレームワークを提案する。
私たちは、JPEGなどの標準的なビデオ圧縮をニューラル圧縮に置き換え、圧縮されたビデオを通常のビデオネットワークへの入力として直接フィードできることを示します。
論文 参考訳(メタデータ) (2022-10-06T15:35:49Z) - Gemino: Practical and Robust Neural Compression for Video Conferencing [19.137804113000474]
Geminoは、新しい高周波超解像パイプラインに基づくビデオ会議のための新しいニューラル圧縮システムである。
我々は,GeminoがTitan X GPU上でリアルタイムに動画を処理し,従来のビデオコーデックよりも2.2~5倍低画質で知覚品質を実現していることを示す。
論文 参考訳(メタデータ) (2022-09-21T17:10:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。