論文の概要: CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.27893v1
- Date: Fri, 28 Aug 2026 03:57:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.199671
- Title: CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning
- Title(参考訳): CommerceVibe: デュアルフィードバック強化学習を通じて実行可能なビジュアルコードとしてEコマースの創造物を設計する学習
- Authors: Yajiao Xu, Jin Zhang, Jiangbo Ai, Tao Jiang, Mo Xu, Lina Huang, Chengfu Huo,
- Abstract要約: 高品質なeコマースクリエイティビティは、製品の提供やマーケティングメッセージの伝達に不可欠である。
最近の拡散モデルは、スケーラブルな創造的生成を可能にし、視覚的に魅力的な画像を生成するが、その平坦な出力はしばしば歪んだテキストと一貫性のない製品の詳細を含んでいる。
本稿では、クリエイティブを実行可能なビジュアルコードとして表現し、条件付きHTML/CSSプログラムとして公式を生成するCommerceVibeを提案する。
製品イメージ、設計要件、製品情報から、レンダリング可能、編集可能、再利用可能な創造物を生成する。
- 参考スコア(独自算出の注目度): 7.239203301947036
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality e-commerce creatives are essential for presenting products and conveying marketing messages. Recent diffusion models enable scalable creative generation and produce visually compelling images, but their flattened raster outputs often contain distorted text and inconsistent product details, requiring refinement before deployment. Moreover, without explicit structure, the resulting creatives are difficult to edit and reuse, while complex design requirements remain challenging to encode as verifiable training signals. To address these challenges, we present CommerceVibe, which represents creatives as executable visual code and formulates generation as conditional HTML/CSS program synthesis. Given product images, design requirements, and product information, it produces renderable, editable, and reusable creatives. We further introduce dual-feedback reinforcement learning, in which rule-based feedback evaluates rendered programs for text readability, product visibility, and layout validity, while visual feedback from a vision-language model (VLM) assesses rendered creatives against input specifications across six perceptual and commercial dimensions. Together, these complementary feedback signals improve both constraint satisfaction and perception-dependent quality. We perform supervised fine-tuning (SFT) of Qwen3.5-9B on over 28,000 e-commerce examples, followed by dual-feedback reinforcement learning. On a 1,300-case benchmark, the optimized CommerceVibe model achieves a weighted score of 94.0/100, compared with 87.3 for the SFT-only variant, and outperforms strong external models. Blind evaluations by five e-commerce design experts further validate these improvements. CommerceVibe supports controllable, editable, and scalable e-commerce creative production.
- Abstract(参考訳): 高品質なeコマースクリエイティビティは、製品の提供やマーケティングメッセージの伝達に不可欠である。
最近の拡散モデルは、スケーラブルな創造的生成を可能にし、視覚的に魅力的な画像を生成することができるが、その平坦なラスタ出力は、しばしば歪んだテキストと一貫性のない製品の詳細を含んでいる。
さらに、明示的な構造がなければ、結果の創造物は編集や再利用が難しいが、複雑な設計要件は、検証可能なトレーニング信号としてエンコードすることが難しいままである。
これらの課題に対処するために、クリエイティブを実行可能なビジュアルコードとして表現し、条件付きHTML/CSSプログラム合成として生成するCommerceVibeを提案する。
製品イメージ、設計要件、製品情報から、レンダリング可能、編集可能、再利用可能な創造物を生成する。
さらに、ルールベースのフィードバックは、テキストの可読性、製品の可視性、レイアウトの妥当性を評価すると同時に、視覚言語モデル(VLM)からの視覚的フィードバックは、6つの知覚的および商業的次元にわたる入力仕様に対する創造性を評価する。
これらの相補的なフィードバック信号は、制約満足度と知覚に依存した品質の両方を改善する。
我々は,Qwen3.5-9Bの教師付き微調整(SFT)を28,000以上のeコマース事例で実施し,その後,二重フィードバック強化学習を行った。
1,300ケースのベンチマークでは、最適化されたCommerceVibeモデルが94.0/100の重み付けスコアを達成し、SFTのみの派生モデルでは87.3のスコアを達成し、強力な外部モデルを上回っている。
5人のeコマースデザイン専門家によるブラインド評価は、これらの改善をさらに検証している。
CommerceVibeは、コントロール可能、編集可能、スケーラブルなeコマースクリエイティブプロダクションをサポートする。
関連論文リスト
- Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation [51.52908699287466]
Text-Guided Q-Formerはテキストガイドによる視覚表現学習フレームワークである。
メタデータと探索的なビジュアルストリームを分離し、軽量で信頼性に配慮したデュアルゲートベクトル変調モジュールを導入する。
フルプール検索による大規模な実世界のeコマースデータセットの実験では、TGQ-Formerは強いコネクタベースラインとエンドツーエンドMLLMを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-17T10:20:23Z) - De-rendering, Reasoning, and Repairing Charts with Vision-Language Models [2.3332469289621787]
ルールベースの視覚化リンタは違反をフラグ付けするが、コンテキストを見逃し、意味のある設計変更を示唆しない。
グラフのデレンダリング、自動分析、反復的な改善を組み合わせて、実用的な、解釈可能なフィードバックを提供するフレームワークを紹介します。
論文 参考訳(メタデータ) (2026-02-23T19:16:27Z) - Turning Adversaries into Allies: Reversing Typographic Attacks for Multimodal E-Commerce Product Retrieval [2.0134842677651084]
電子商取引プラットフォームのマルチモーダル製品検索システムは、検索関連性とユーザエクスペリエンスを改善するために、視覚信号とテキスト信号を効果的に組み合わせることに頼っている。
本稿では,関連するテキストコンテンツを製品イメージに直接レンダリングすることで,タイポグラフィー攻撃の論理を逆転させる手法を提案する。
6つの最先端ビジョン基盤モデルを用いて,3つの縦型eコマースデータセット(ニーカー,ハンドバッグ,トレーディングカード)について評価を行った。
論文 参考訳(メタデータ) (2025-11-07T15:24:18Z) - Reinforced Visual Perception with Tools [66.79840157663237]
本稿では,GRPOに基づく新しいRLアルゴリズムを提案する。
本手法は,複数の知覚重度ベンチマークにおいて,最先端の性能を実現する。
我々のReVPT-3BとReVPT-7BはCV-Benchでインストラクションモデルを9.03%、9.44%上回っている。
論文 参考訳(メタデータ) (2025-09-01T17:57:49Z) - Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing [84.16442052968615]
RISEBenchはReasoning-Informed ViSual Editing (RISE)の最初のベンチマークである。
RISEBenchは、時間、因果、空間、論理的推論の4つの主要な推論カテゴリに焦点を当てている。
オープンソースモデルとプロプライエタリモデルの両方を含む,9つの目立った視覚編集モデルを評価する実験を行った。
論文 参考訳(メタデータ) (2025-04-03T17:59:56Z) - A Multimodal In-Context Tuning Approach for E-Commerce Product
Description Generation [47.70824723223262]
マーケティングキーワードを付加した画像から製品記述を生成するための新しい設定を提案する。
本稿では, ModICT という, シンプルで効果的なマルチモーダル・インコンテキスト・チューニング手法を提案する。
実験の結果、ModICTは従来の方法と比較して精度(ルージュ-Lでは最大3.3%)と多様性(D-5では最大9.4%)を著しく改善することが示された。
論文 参考訳(メタデータ) (2024-02-21T07:38:29Z) - Efficient Large-Scale Visual Representation Learning And Evaluation [0.13192560874022083]
大規模なeコマースビジョンアプリケーションにおける課題を解説し、視覚表現を効果的に訓練し、評価し、提供する方法を強調する。
いくつかの下流タスクにおける視覚的表現を評価するアブレーション研究について述べる。
大規模なeコマースプラットフォーム上にデプロイされた機械学習システムの実運用におけるオンライン結果を含める。
論文 参考訳(メタデータ) (2023-05-22T18:25:03Z) - Learning to Decompose Visual Features with Latent Textual Prompts [140.2117637223449]
視覚言語モデルを改善するために,Decomposed Feature Prompting (DeFo)を提案する。
我々の実証研究は、視覚言語モデルを改善する上でDeFoが重要であることを示している。
論文 参考訳(メタデータ) (2022-10-09T15:40:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。