論文の概要: RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation
- arxiv url: http://arxiv.org/abs/2608.29280v1
- Date: Sat, 29 Aug 2026 14:06:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.911614
- Title: RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation
- Title(参考訳): RAGDiffusion++: マクロ検索からガーメント生成のためのマイクロフィデリティアライメントへ
- Abstract要約: 強化学習は、フローモデルのサンプリング分布を再構築することができる。
Garment-RMは、微細なコントラスト学習によって500K画像を訓練し、84.67%の人間の嗜好精度を達成した。
我々の戦略は、動的識別器をRLサンプリング軌道に統合し、真に高周波の詳細を豊かにしながら、アーティファクトをペナル化する。
- 参考スコア(独自算出の注目度): 41.42598259381642
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Standard clothing asset generation---restoring forward-facing flat-lay garment images from diverse real-world contexts---holds immense commercial value yet demands both macroscopic topological accuracy and microscopic physical fidelity. Although our previous work RAGDiffusion effectively eradicated large-scale structural hallucinations via retrieval-augmented macro-constraints, achieving industrial-grade micro-texture realism remains an unsolved bottleneck. We formally identify this limitation as High-Frequency Trajectory Collapse: supervised fine-tuning (SFT) converges to the conditional mean of the training distribution, which is dominated by smooth, low-frequency textures, causing high-frequency patterns (e.g., fabric weaves, intricate logos) to become nearly un-sampleable. Naively applying Reinforcement Learning (RL) post-training further triggers Artifact Hacking, where models exploit semantic biases in generic reward models by generating deceptive checkerboard noise. Our key insight is that RL can fundamentally reshape the sampling distribution of flow models---elevating the probability of high-fidelity trajectories under accurate reward guidance---while adversarial regularization prevents exploitation of reward blind spots. Realizing this principle requires three prerequisites: (i)inherent capacity, established through a 27,725-pair high-complexity garment dataset (STGarment-Plus) and a Dual-Image-Stream FLUX architecture upgrade; (ii)perceptive reward, provided by a novel attribute-aware reward model (Garment-RM) trained on 500K images via fine-grained contrastive learning, achieving 84.67% human preference accuracy; and (iii)hacking prevention, enforced by our Adversarial-Regularized GRPO (AR-GRPO) strategy that integrates a dynamic discriminator into the RL sampling trajectory to penalize artifacts while enriching authentic high-frequency details.
- Abstract(参考訳): 標準的な衣服資産 - 様々な現実世界の状況から前方のフラットレイの衣服イメージを復元する -- は、大きな商業価値を保ちながら、マクロなトポロジカルな精度と微視的な物理的忠実さの両方を必要としている。
これまでのRAGDiffusionは、検索強化マクロ制約による大規模構造幻覚を効果的に根絶したが、産業レベルのマイクロテクスチャリアリズムを実現することは未解決のボトルネックのままである。
教師付き微調整(SFT)は、スムーズで低周波なテクスチャに支配されるトレーニング分布の条件平均に収束し、高周波パターン(例えば、織物織り、複雑なロゴ)がほとんどサンプル化されなくなる。
強化学習(Reinforcement Learning, RL)のポストトレーニングの適用により、Artifact Hackingはさらにトリガーとなる。
我々の重要な洞察は、RLがフローモデルのサンプリング分布を根本的に再形成し、精度の高い報酬誘導の下で高忠実度軌道の確率を上昇させることで、一方、逆正則化は報酬盲点の活用を妨げているということである。
この原則を実現するには3つの前提条件が必要である。
(i)27,725対の高複雑衣料データセット(STGarment-Plus)とデュアルイメージストリームFLUXアーキテクチャのアップグレードにより確立された継承能力
(ii)人選好精度84.67%を達成し、500K画像を微妙なコントラスト学習により訓練した新しい属性認識報酬モデル(Garment-RM)により提供される知覚報酬
3) 動的識別器をRLサンプリング軌道に統合し, 真正な高周波細部を充実させながら, アーティファクトをペナル化するためのハッキング防止策(AR-GRPO)を施行した。
関連論文リスト
- FDIR: Harmonizing Fidelity and Human-Machine Preference in Lossy Compression Image Restoration [3.7323617838648566]
Flow-Conditioned Detail Refinement (FCDR)は、高周波テクスチャを決定的に復元し、画素空間における生成幻覚を抑制する。
FDIRは、知覚-忠実バランスと競合するマシンの選好により、優れた忠実性を達成する。
論文 参考訳(メタデータ) (2026-07-31T08:33:40Z) - IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation [9.17007090517294]
自由誘導軌道を対象とする蒸留は2次元圧縮パラダイムとして広く普及している。
我々は、情報理論の理論レンズを通して蒸留プロセスを再検討する。
本稿では、難解なKL分散制約をゼロオーバーヘッド閉形式解に変換するインスタンス認識選択機構を提案する。
論文 参考訳(メタデータ) (2026-07-10T06:43:43Z) - Immunizing 3D Gaussian Generative Models Against Unauthorized Fine-Tuning via Attribute-Space Traps [54.68389949880821]
本稿では,3次元生成モデルを微調整攻撃から守るためのフレームワークであるGaussLockを提案する。
GassLockは、認可された蒸留と、位置、スケール、回転、不透明度、色をターゲットにした属性対応トラップ損失を統合する。
実験により、ガウスロックは無許可の微調整攻撃を効果的に中和することが示された。
論文 参考訳(メタデータ) (2026-04-06T09:30:49Z) - StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models [98.72926158261937]
本稿では,Visual AutoRegressive モデルのためのトレーニングフリートークン解析フレームワークを提案する。
我々は局所的なテクスチャの詳細を捉えるために軽量なハイパスフィルタを使用し、グローバルな構造情報を保存するために主成分分析(PCA)を活用している。
スパーストークンの下で有効な次世代の予測を維持するために,近接した特徴伝達戦略を導入する。
論文 参考訳(メタデータ) (2026-03-02T11:35:05Z) - Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models [15.709482146201283]
現代のビジョン・ファンデーション・モデル(Vision Foundation Models)の凍結した特徴に基づいて訓練された単純な線形分類器は、新しい最先端技術を確立している。
この基準線は標準ベンチマーク上の特別な検出器と一致し、また、ウィジェット内のデータセット上では決定的に優れていることを示す。
我々は、AIの法医学におけるパラダイムシフトを提唱し、静的ベンチマークの過度な適合から、ファンデーションモデルの進化する世界の知識を現実の信頼性に活用することへと移行した。
論文 参考訳(メタデータ) (2026-02-02T07:20:02Z) - Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model [18.526821056010384]
視覚言語モデル(VLM)は、3次元シーン理解のための正確な数値予測を実現する上で重要なボトルネックに直面している。
伝統的な強化学習アプローチは、主に相対的なランクに基づいており、しばしば深刻な報酬の分散と勾配不安定に悩まされる。
本稿では,Smooth Numerical Reward Activation (SNRA)演算子とAbsolute-Preserving GRPOフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-01-12T16:26:42Z) - Restoration Score Distillation: From Corrupted Diffusion Pretraining to One-Step High-Quality Generation [82.39763984380625]
Score Distillation (DSD) の原理的一般化である textitRestoration Score Distillation (RSD) を提案する。
RSDは、ぼやけた画像、不完全画像、低解像度画像など、広範囲の汚職タイプに対応している。
自然と科学の両方のデータセットの様々な復元作業において、教師モデルを一貫して上回っている。
論文 参考訳(メタデータ) (2025-05-19T17:21:03Z) - Model Inversion Attacks Through Target-Specific Conditional Diffusion Models [54.69008212790426]
モデル反転攻撃(MIA)は、ターゲット分類器のトレーニングセットからプライベートイメージを再構築することを目的としており、それによってAIアプリケーションにおけるプライバシー上の懸念が高まる。
従来のGANベースのMIAは、GANの固有の欠陥と潜伏空間における最適化の偏りにより、劣った遺伝子的忠実度に悩まされる傾向にある。
これらの問題を緩和するために拡散モデル反転(Diff-MI)攻撃を提案する。
論文 参考訳(メタデータ) (2024-07-16T06:38:49Z) - Soft ascent-descent as a stable and flexible alternative to flooding [6.527016551650139]
我々は,軟化・ポイントワイド機構であるSoftADを提案する。この機構は,降水量と降水量の影響を制限し,洪水の上昇・昇華効果を維持できる。
我々は,より小さな損失一般化ギャップとモデル規範を享受しながら,浸水と競合する分類精度をSoftADが実現できることを実証する。
論文 参考訳(メタデータ) (2023-10-16T02:02:56Z) - Exploiting Diffusion Prior for Real-World Image Super-Resolution [75.5898357277047]
本稿では,事前学習したテキスト・画像拡散モデルにカプセル化された事前知識を視覚的超解像に活用するための新しいアプローチを提案する。
時間認識エンコーダを用いることで、事前学習した合成モデルを変更することなく、有望な復元結果が得られる。
論文 参考訳(メタデータ) (2023-05-11T17:55:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。