論文の概要: Latent-Frequency Validity: Fast Spectral Editing with Screened Video-VAE Transfer Operators
- arxiv url: http://arxiv.org/abs/2608.07569v1
- Date: Tue, 04 Aug 2026 00:14:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.439682
- Title: Latent-Frequency Validity: Fast Spectral Editing with Screened Video-VAE Transfer Operators
- Title(参考訳): 遅延周波数妥当性:ビデオ-VAE転送演算子を用いた高速スペクトル編集
- Abstract要約: ビデオVAEラテントの直接スペクトル編集は、デコード-フィルタ-リコードパスなしでノイズ、フリック、滑らか、および周波数コンテンツを制御できる。
本稿では,コンパクトなVAEスペクトル応答を学習するEmphlatent- frequency validity (LFV)を提案する。
LFVは、ラウンドトリップドリフトを悪化させることなく、デコードされたターゲットフィリティを改善する場合にのみデプロイする。
- 参考スコア(独自算出の注目度): 1.8315700560557984
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Direct spectral editing in video-VAE latents can control noise, flicker, smoothness, and frequency content without a decode--filter--reencode pass. However, video VAEs may redistribute pixel-space frequency bands across latent channels, and latent edits can disrupt VAE round-trip dynamics. We introduce \emph{latent-frequency validity} (LFV), which learns a compact VAE-specific spectral response and deploys it only when it improves decoded-target fidelity without worsening round-trip drift. LFV follows a validation-selected path from a diagonal per-frequency calibrator (C1) to full channel mixing (CM), making cross-channel capacity a controllable per-edit resource. Across 544 VAE--edit cells spanning six spectral families, LFV emits 423 cheap operators: 277 are handled by C1, while 146 (34.5\% of emitted operators) require channel mixing. On the primary 120-cell radial sweep, 99/100 emitted operators pass source-video-grouped held-out evaluation. Across five additional filter families, all 323 emitted operators pass held-out evaluation. Fully frozen OpenVid-fitted operators, including the validation-selected path coefficient, pass all 20 tested CogVideoX and HunyuanVideo generated-domain cells without adaptation. The selected response matches direct latent-filter latency and is about $3\times$ faster than pixel filter--reencode. The resulting maps reveal distinct VAE regimes, including strongly channel-coupled CogVideoX responses and a sharp Open-Sora high-band stability frontier.
- Abstract(参考訳): ビデオVAEラテントの直接スペクトル編集は、デコード-フィルタ-リコードパスなしでノイズ、フリック、滑らか、および周波数コンテンツを制御できる。
しかし、ビデオVAEは、潜伏チャネルをまたいでピクセル空間の周波数帯域を再分配し、潜伏編集はVAEのラウンドトリップダイナミクスを妨害する可能性がある。
小型なVAEスペクトル応答を学習し、ラウンドトリップドリフトを悪化させることなくデコードターゲットの忠実度を改善する場合にのみ展開する。
LFVは、対角的な周波数ごとのキャリブレータ(C1)から全チャネル混合(CM)へのバリデーション選択パスに従い、チャネル間のキャパシティをエジット単位のリソースとして制御可能にする。
LFVは6つのスペクトル族にまたがる544個のVAE-edit細胞にまたがって423個の安価な演算子を放出し、277はC1で処理され、146個のVAE-edit細胞はチャネル混合を必要とする。
一次120セルラジアルスイープでは、99/100の出力演算子がソースビデオ群によるホールドアウト評価をパスした。
5つのフィルタファミリにまたがって、323個の出力された演算子はすべてホールドアウト評価をパスする。
バリデーション選択されたパス係数を含む完全に凍結されたOpenVid対応オペレータは、20の試験されたCogVideoXとHunyuanVideo生成ドメイン細胞を適応せずにパスする。
選択されたレスポンスは、遅延フィルタの直接レイテンシと一致し、ピクセルフィルタのコードよりも約$3\times$高速である。
結果として得られたマップは、強くチャネル結合されたCagVideoX応答や、シャープなOpen-Soraハイバンド安定性フロンティアを含む、異なるVAE体制を明らかにしている。
関連論文リスト
- Optimized Adaptive Loop Filter in Versatile Video Coding [59.71144973605487]
Versatile Video Coding(VVC)標準では、アダプティブループフィルタ(ALF)が圧縮アーティファクトの低減に重要な役割を果たしている。
本稿では,GALF と CCALF の並列設計,GALF の適応パラメータ決定,ワンパス CCALF スキームなどの ALF フレームワークを提案する。
VTM-8.0と比較して、提案手法は画像バッファアクセスを152から1に削減し、ALFモジュールの約25%の時間節約を実現する。
論文 参考訳(メタデータ) (2026-07-07T01:47:50Z) - Active Sampling for Ultra-Low-Bit-Rate Video Compression via Conditional Controlled Diffusion [8.8956772305056]
本稿では,超低ビットレート方式のための拡散型ビデオ圧縮フレームワークである ActDiff-VC を提案する。
提案手法は,動画を可変長セグメントに分割し,必要なときにのみ送信し,トラックされた点軌道のコンパクトなセットを用いて時間的ダイナミクスを要約する。
スパース信号に基づいて、条件拡散復号器は残りのフレームを合成し、厳しい速度制約の下で知覚的に現実的な再構成を可能にする。
論文 参考訳(メタデータ) (2026-05-04T17:25:14Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - SAFT: Sensitivity-Aware Filtering and Transmission for Adaptive 3D Point Cloud Communication over Wireless Channels [19.663306099798323]
感性認識型フィルタリング・伝送(SAFT)について紹介する。
Point-BERTにインスパイアされたエンコーダ、感度誘導型トークンフィルタリングユニット、量子化ブロック、適応的再構成のためのSNR対応デコーダを統合する。
ShapeNet, ModelNet40, 8iVFB の実験では、SAFT はソースチャネルの別のパイプラインと比較して幾何学的忠実度(D1/D2 PSNR)を向上している。
論文 参考訳(メタデータ) (2026-03-27T09:18:04Z) - Spectral Complex Autoencoder Pruning: A Fidelity-Guided Criterion for Extreme Structured Channel Compression [7.913101398893967]
本稿では,個々の出力チャネルのレベルにおける機能的冗長度を測定するリコンストラクションベースの基準を提案する。
複素相互作用場を周波数領域に変換し、低容量オートエンコーダを訓練して正規化スペクトルを再構成する。
複素相互作用場のスペクトル再構成忠実度は、アグレッシブ圧縮下でのチャネルレベルの冗長性の効果的なプロキシであることがわかった。
論文 参考訳(メタデータ) (2026-01-14T10:34:18Z) - Context Video Semantic Transmission with Variable Length and Rate Coding over MIMO Channels [49.624608869195065]
無線ビデオ伝送のためのコンテキストビデオセマンティックトランスミッション(CVST)フレームワークを提案する。
我々は、特徴群と多重入力多重出力(MIMO)サブチャネルの関係を明確に定式化するために、コンテキストチャネル相関マップを学習する。
近年の無線ビデオ・セマンティック・コミュニケーション・アプローチにおいて,標準化された分離符号化方式に対して性能が大幅に向上したことを示す。
論文 参考訳(メタデータ) (2025-12-23T10:48:43Z) - PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs [57.790910044227935]
ビデオLLMは時間的不整合に悩まされ、フレームタイミングの小さなシフトは注意をそらすことができ、関連するフレームを抑えることができる。
本稿では, 位相アグリゲード平滑化(PAS)について述べる。これは, 頭部に小さな反対位相オフセットを適用して, 出力を集約する学習自由機構である。
解析の結果,RoPE回転ロジットは,時間核でスケールしたコンテントドット積として近似でき,このカーネルを滑らかにすることで,小さな時間シフトに対する注意のリプシッツ安定性が得られ,マルチフェーズ平均化は,Nyquist-valid サンプリング下での頭当たりスペクトルを保ちながら高周波リップルを減衰させることがわかった。
論文 参考訳(メタデータ) (2025-11-14T05:56:47Z) - Improving the Diffusability of Autoencoders [54.920783089085035]
高品質な画像やビデオを生成するための主要なアプローチとして、潜伏拡散モデルが登場している。
我々は、現代のオートエンコーダのスペクトル分析を行い、その潜在空間における不規則な高周波成分を同定する。
我々は、この高周波成分が拡散合成プロセスの粗大な微細な性質に干渉し、生成品質を阻害する仮説を立てた。
論文 参考訳(メタデータ) (2025-02-20T18:45:44Z) - Light-weight CNN-based VVC Inter Partitioning Acceleration [28.62405283825515]
Versatile Video Coding(VVC)標準は、2020年にJVET(Joint Video Exploration Team)によって確定した。
VVC は Bjontegaard Delta-Rate (BD-rate) の約50%の圧縮効率向上を提供する。
本稿では,VVCにおけるパーティショニングを高速化するために,畳み込みニューラルネットワーク(CNN)に基づく手法を提案する。
論文 参考訳(メタデータ) (2023-12-17T00:20:02Z) - Distortion-Aware Loop Filtering of Intra 360^o Video Coding with
Equirectangular Projection [81.63407194858854]
等角射影(ERP)フォーマットで投影された360$o$ビデオの符号化性能を向上させるため,歪みを考慮したループフィルタリングモデルを提案する。
提案モジュールは、符号化ユニット(CU)パーティションマスクに基づいてコンテンツ特性を分析し、部分的畳み込みによって処理し、指定された領域を活性化する。
論文 参考訳(メタデータ) (2022-02-20T12:00:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。