論文の概要: Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer
- arxiv url: http://arxiv.org/abs/2607.08227v1
- Date: Thu, 09 Jul 2026 08:23:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.46515
- Title: Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer
- Title(参考訳): 光写実的スタイル転送のための統計的特徴を持つStatLUTによるマルチモーダル3D LUT生成
- Authors: Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu,
- Abstract要約: 光現実的スタイル転送(PST)は、コンテンツ画像への参照の色と音色を転送することを目的としている。
既存のディープラーニングベースの手法は、事前に訓練された画像エンコーダによって引き起こされる意味的絡み合いに本質的に苦しむ。
3D LUT生成のための革新的なマルチモーダルフレームワークStatLUTを提案する。
- 参考スコア(独自算出の注目度): 6.827125120104924
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Photorealistic Style Transfer (PST) aims to transfer the color and tonal style of a reference to a content image while strictly preserving its structural integrity. However, existing deep learning-based methods inherently suffer from semantic entanglement caused by pre-trained image encoders, leading to unnatural spatial distortions. Moreover, current pixel-level mapping paradigms often ignore color gamut topology, resulting in color banding, while also lacking the multimodal capability for intuitive text-driven control. To address these bottlenecks, we propose StatLUT, an innovative multimodal framework for 3D LUT generation. First, we bypass traditional encoders and introduce a Lab-Extractor to derive spatially-agnostic statistical features, fundamentally decoupling color distributions from structural semantics to ensure artifact-free rendering. Second, we formulate LUT generation as a Transformer-based Seq2Seq translation task, utilizing a Multi-dimensional Residual Mapper (MR-Mapper) to predict topologically smooth 3D LUTs. Finally, to break the single-modal barrier, we propose the H-Diffuser, a lightweight Diffusion Transformer that directly synthesizes statistical features from natural language prompts, enabling flexible text-driven color grading. Extensive experiments on standard benchmarks demonstrate that StatLUT significantly outperforms state-of-the-art methods in both visual quality and quantitative metrics, pioneering a highly robust and flexible paradigm for multimodal photorealistic style transfer.
- Abstract(参考訳): フォトリアリスティック・スタイル・トランスファー(PST)は、その構造的整合性を厳格に保ちながら、コンテンツ画像への参照の色と音色を転送することを目的としている。
しかし、既存のディープラーニングに基づく手法は、訓練済みの画像エンコーダによって引き起こされる意味的絡み合いに本質的に悩まされ、不自然な空間歪みを引き起こす。
さらに、現在のピクセルレベルのマッピングパラダイムは色域トポロジを無視することが多く、色バンド化が生じると同時に、直感的なテキスト駆動制御のためのマルチモーダル機能が欠如している。
これらのボトルネックに対処するために,3D LUT 生成のための革新的なマルチモーダルフレームワーク StatLUT を提案する。
まず,従来のエンコーダをバイパスし,空間非依存の統計特徴を導出するLab-Extractorを導入する。
第2に,変換器をベースとしたSeq2Seq変換タスクとして,多次元残留マッパー(MR-Mapper)を用いてLUT生成を定式化し,位相的に滑らかな3D LUTを予測する。
最後に,H-Diffuserを提案する。H-Diffuserは,自然言語のプロンプトから統計的特徴を直接合成し,フレキシブルなテキスト駆動カラーグレーディングを実現する軽量な拡散変換器である。
標準ベンチマークにおける広範囲な実験により、StatLUTは視覚的品質と定量的メトリクスの両方において最先端の手法を著しく上回り、マルチモーダルなフォトリアリスティックなスタイル転送のための非常に堅牢で柔軟なパラダイムを開拓した。
関連論文リスト
- GLUT: 3D Gaussian Lookup Table for Continuous Color Transformation [17.14390334312844]
Gaussian LUT (GLUT) は、学習可能な3Dガウスプリミティブの集合を用いて色変換をモデル化する連続的で明示的な色表現である。
この表現に基づいて,複数のLUTインスタンスに対してGLUTパラメータを予測し,スムーズかつ制御可能なLUTスタイルのブレンディングを実現するために,多彩なカラースタイルを単一のフレームワークで符号化する,コンパクト条件生成器(CGLUT)を導入する。
実験の結果,従来のLUT表現よりも精度と効率が優れ,解釈性や対話性も向上した。
論文 参考訳(メタデータ) (2026-05-19T14:17:44Z) - LoR-LUT: Learning Compact 3D Lookup Tables via Low-Rank Residuals [8.420640298306237]
LoR-LUTは、コンパクトで解釈可能な3Dルックアップテーブル(LUT)生成のための統一された低ランク定式化である。
LoR-LUTはMIT-Adobe FiveKデータセットでトレーニングされている。
LoR-LUT Viewerと呼ばれる対話型可視化ツールは、入力画像をLUT調整された出力画像に変換する。
論文 参考訳(メタデータ) (2026-02-26T04:28:35Z) - Bringing Your Portrait to 3D Presence [46.11577347349078]
本研究では,頭部,半体,全体にまたがる単一のポートレートから,アニマタブルな3次元アバターを再構築するための統一的な枠組みを提案する。
提案手法は,ポーズやフレーミングに敏感な特徴表現,拡張性に制限のあるデータ,信頼できないプロキシ・メシュ推定という3つのボトルネックに対処する。
論文 参考訳(メタデータ) (2025-11-27T15:42:07Z) - FlowLUT: Efficient Image Enhancement via Differentiable LUTs and Iterative Flow Matching [10.213645938731338]
FlowLUTは、LUTの効率性、複数プリエント、フローマッチングされた再構成画像のパラメータ非依存特性を統合する、新しいエンドツーエンドモデルである。
軽量な融合予測ネットワークは複数の3D LUT上で動作し、シーン適応色補正には$mathcalO(1)$の複雑さがある。
モデル全体は、知覚的および構造的忠実性を含む複合損失関数の下で共同最適化される。
論文 参考訳(メタデータ) (2025-09-28T03:22:01Z) - Reference-Guided Diffusion Inpainting For Multimodal Counterfactual Generation [55.2480439325792]
自律運転や医用画像解析などの安全クリティカルなアプリケーションは、厳格なテストのために広範なマルチモーダルデータを必要とする。
本研究は, 自律運転における合成データ生成法と, 医療画像解析法であるMObIとAnydoorMedの2つの新しい手法を紹介する。
論文 参考訳(メタデータ) (2025-07-30T19:43:47Z) - Large Spatial Model: End-to-end Unposed Images to Semantic 3D [79.94479633598102]
大空間モデル(LSM)は、RGB画像を直接意味的放射場に処理する。
LSMは、単一のフィードフォワード操作における幾何学、外観、意味を同時に推定する。
新しい視点で言語と対話することで、多目的ラベルマップを生成することができる。
論文 参考訳(メタデータ) (2024-10-24T17:54:42Z) - OrientDream: Streamlining Text-to-3D Generation with Explicit Orientation Control [66.03885917320189]
OrientDreamは、テキストプロンプトから効率よくマルチビューで一貫した3D生成のためのカメラ指向条件付きフレームワークである。
本戦略は,2次元テキスト・画像拡散モジュールの事前学習におけるカメラ配向条件付き機能の実装を強調する。
提案手法は,一貫したマルチビュー特性を持つ高品質なNeRFモデルを生成するだけでなく,既存手法よりも最適化速度が大幅に向上することを示した。
論文 参考訳(メタデータ) (2024-06-14T13:16:18Z) - SepLUT: Separable Image-adaptive Lookup Tables for Real-time Image
Enhancement [21.963622337032344]
上記の制限に対処するため、SepLUT(分離画像適応ルックアップテーブル)を提案する。
具体的には、単一色変換を1Dおよび3D LUTとしてインスタンス化されたコンポーネント非依存およびコンポーネント関連サブ変換のカスケードに分離する。
このように、2つのサブ変換の能力は相互に促進され、3D LUTは色成分を混合する能力を補完する。
論文 参考訳(メタデータ) (2022-07-18T02:27:19Z) - DynaST: Dynamic Sparse Transformer for Exemplar-Guided Image Generation [56.514462874501675]
本稿では,動的スパースアテンションに基づくトランスフォーマーモデルを提案する。
このアプローチの核心は、ある位置がフォーカスすべき最適なトークン数の変化をカバーすることに特化した、新しいダイナミックアテンションユニットです。
3つの応用、ポーズ誘導型人物画像生成、エッジベース顔合成、歪みのない画像スタイル転送の実験により、DynaSTは局所的な詳細において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2022-07-13T11:12:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。