論文の概要: On Color Alignment in VAE Latent Spaces and Its Applications
- arxiv url: http://arxiv.org/abs/2610.07072v1
- Date: Mon, 05 Oct 2026 08:53:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.541517
- Title: On Color Alignment in VAE Latent Spaces and Its Applications
- Title(参考訳): VAE潜時空間における色アライメントとその応用について
- Abstract要約: テキスト・ツー・イメージ・モデルのVAEは、明るさと反対色に整合した色部分空間を共有する。
GenColorBenchの細粒度CSS3/X11システム上で,高精度な数値色生成を実現するColorTuningを提案する。
- 参考スコア(独自算出の注目度): 49.123442484409985
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Variational autoencoders (VAEs) are a key part of modern text-to-image models, which generate images within their latent space. VAEs are known to disentangle the main factors of variation in the data, and color is known to be one of the most structured of these in natural images: decorrelating it yields one luminance axis and two opponent-color axes. Color should therefore be expected to emerge as a distinct factor in the VAE latent space. Yet how these latent spaces represent color remains largely unexplored. In this work, we show that the VAEs of text-to-image models share a color subspace aligned with brightness and opponent-colors. Through a linear approximation of the encoder and targeted latent steering, we find this subspace consistently across a broad range of VAEs, from SD1.5 to FLUX.2 and Z-Image. Building on this characterization, we propose three applications: ColorTuning, which achieves state-of-the-art in precise numerical color generation on the fine-grained CSS3/X11 system of GenColorBench, saturation control, to adjust the global chromatic intensity, and color transfer, to change the palette to match a reference. The code and models are publicly available at https://julian075.github.io/Color_Subspace/
- Abstract(参考訳): 変分オートエンコーダ(VAE)は、最新のテキスト・画像モデルの重要な部分であり、その潜在空間内で画像を生成する。
VAEはデータの変動の主な要因を解き放つことで知られており、色は自然画像の中で最も構造化されているものの1つであることが知られている。
したがって、色は、VOE潜在空間における別の要因として現れることが期待される。
しかし、これらの潜在空間がどのように色を表すかはほとんど未解明のままである。
本研究は,テキスト・ツー・イメージ・モデルのVAEが,明るさと対色に整合した色部分空間を共有することを示す。
エンコーダの線形近似と潜在ステアリングにより、SD1.5 から FLUX.2 、Z-Image に至るまで、この部分空間は VAE の広い範囲にわたって一貫して存在する。
この特徴に基づいて,GenColorBenchの細粒度CSS3/X11システム上で,高精度な数値色生成を実現するColorTuningという手法を提案する。
コードとモデルはhttps://julian075.github.io/Color_Subspace/で公開されている。
関連論文リスト
- Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion [43.72039047537043]
カラーは、イメージ生成において最も知覚的に健全だが最小限の制御可能な属性の1つである。
ColourCrafterは、色編集をグローバルトーン転送から構造化された地域対応生成プロセスに変換する。
ColourfulSetは、連続的および多彩なカラーバリエーションを備えた、高品質な画像ペアの大規模なデータセットです。
論文 参考訳(メタデータ) (2026-03-19T03:53:38Z) - NumColor: Precise Numeric Color Control in Text-to-Image Generation [57.72106507860579]
テキストと画像のモデルは、自然言語の記述から画像を生成するのに優れているが、数値的な色を解釈できない。
我々は,複数の拡散アーキテクチャを横断する正確な数値色制御が可能なNumColorを提案する。
NumColorは、GenColorBenchベンチマークで色調和スコアを10-30倍改善しながら、5つのモデルで4-9倍の数値色精度を向上させる。
論文 参考訳(メタデータ) (2026-03-13T19:37:25Z) - Perception-Inspired Color Space Design for Photo White Balance Editing [20.114221919949603]
ホワイトバランス(WB)は、画像信号プロセッサ(ISP)パイプラインにおける重要なステップである。
本稿では,知覚にインスパイアされたLearable HSI(LHSI)色空間を利用するWB補正のための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-10T07:27:16Z) - HVI-CIDNet+: Beyond Extreme Darkness for Low-Light Image Enhancement [56.02740727422916]
低光画像強調(LLIE)は、劣化した低光画像から鮮明なコンテンツと詳細を復元することを目的としている。
既存の標準RGB(sRGB)カラースペースベースのLLIE法は、しばしば色バイアスと明るさのアーチファクトを生成する。
HV色マップと学習可能な強度によって定義されるLLIEの新しい色空間を提案する。
HVI-CIDNet+はHVI色空間上に構築されており、損傷したコンテンツを復元し、極暗い領域における色歪みを軽減する。
論文 参考訳(メタデータ) (2025-07-09T13:03:34Z) - Free-Lunch Color-Texture Disentanglement for Stylized Image Generation [62.215875006311876]
本稿では,タイマライズされたT2I生成において,フリーランチなカラーテクスチャ・ディコンタングルを実現するための,最初のチューニング自由アプローチを提案する。
Our Style Attributes Disentanglement approach (SADis)は、より正確でカスタマイズ可能な、スタイリングされた画像生成ソリューションを提供する。
WikiArtとStyleDropのデータセットの画像に対する実験は、SADisがDisIGタスクの最先端化方法を上回ることを実証している。
論文 参考訳(メタデータ) (2025-03-18T14:10:43Z) - Color Matching Using Hypernetwork-Based Kolmogorov-Arnold Networks [44.97307414849601]
cmKANはカラーマッチングのための多用途フレームワークである。
我々は、KAN(Kolmogorov-Arnold Networks)を用いて、ソースとターゲットの分布間の色マッチングをモデル化する。
2つの異なるカメラで撮影されたペア画像の大規模なデータセットを初めて紹介する。
論文 参考訳(メタデータ) (2025-03-14T18:17:19Z) - Control Color: Multimodal Diffusion-based Interactive Image Colorization [81.68817300796644]
Control Color (Ctrl Color) は、事前訓練された安定拡散(SD)モデルを利用する多モードカラー化手法である。
ユーザのストロークをエンコードして、局所的な色操作を正確に行うための効果的な方法を提案する。
また、カラーオーバーフローと不正確な色付けの長年の問題に対処するために、自己注意に基づく新しいモジュールとコンテンツ誘導型変形可能なオートエンコーダを導入する。
論文 参考訳(メタデータ) (2024-02-16T17:51:13Z) - The Utility of Decorrelating Colour Spaces in Vector Quantised
Variational Autoencoders [1.7792264784100689]
ネットワーク学習構造表現を強制するカラー空間変換を提案する。
入力が1つの色空間のイメージであり、出力が別の色空間のイメージであるVQ-VAEのいくつかの例を訓練した。
論文 参考訳(メタデータ) (2020-09-30T07:44:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。