論文の概要: KwaiMind Technical Report
- arxiv url: http://arxiv.org/abs/2609.26375v1
- Date: Tue, 22 Sep 2026 13:21:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.38584
- Title: KwaiMind Technical Report
- Title(参考訳): KwaiMindの技術報告
- Abstract要約: KwaiMindは、一般的な機能とeコマースの専門化を組み合わせた画像編集システムである。
KwaiMindはマルチモーダル拡散変圧器上に構築され、事前訓練と微調整を継続した。
汎用視覚言語判断器とクリックスルー率(CTR)、テキストレンダリング、製品整合性ガイド専門ポリシーのための特別報酬。
- 参考スコア(独自算出の注目度): 16.986789022658982
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Commercial image editing requires product identity preservation, accurate text rendering, and user appeal alongside general editing quality. We present KwaiMind, an image editing system combining general capabilities with e-commerce specialization. An agent-based data engine maintains approximately 1.8 million high-quality editing pairs. Built on a multimodal diffusion transformer, KwaiMind undergoes continued pre-training and supervised fine-tuning, followed by preference optimization and online reinforcement learning. A general-purpose vision-language judge and specialized rewards for click-through rate (CTR), text rendering, and product consistency guide specialized policies, which are consolidated through on-policy distillation. We introduce Ecom-Bench, covering 11 commercial editing tasks with task-specific visual evaluation and CTR-based ranking. KwaiMind achieves the strongest overall scores among evaluated open-source editors on ImgEdit, GEdit, both language splits of REDEdit, and Ecom-Bench visual quality, and the highest aggregate CTR ranking score among compared systems. Offline, CTR-guided optimization increases the proportion of generated images whose predicted CTR exceeds that of the original product image from 12.16% to 37.41%. In an online A/B experiment, CTR-based selection of product main images yields an approximately 2.44% relative increase in actual CTR. These results demonstrate the value of domain-specific data and reward-driven alignment for commercial image editing.
- Abstract(参考訳): 商用画像編集には、製品識別の保存、正確なテキストレンダリング、一般の編集品質とともにユーザへのアピールが必要である。
我々は,一般的な機能とeコマースの専門化を組み合わせた画像編集システムであるKwaiMindを紹介する。
エージェントベースのデータエンジンは、約1.8万の高品質な編集ペアを維持している。
マルチモーダル拡散変換器上に構築されたKwaiMindは、事前訓練と微調整の監督を継続し、続いて好みの最適化とオンライン強化学習を行った。
クリックスルーレート(CTR)、テキストレンダリング、およびオンライン蒸留を通じて統合された製品一貫性ガイド専門ポリシーのための汎用視覚言語判断と特別報酬。
Ecom-Benchを導入し,タスク固有の視覚評価とCTRに基づくランキングを含む11の商用編集タスクについて紹介する。
KwaiMindはImgEdit、GEdit、REDEditの両言語分割、Ecom-Benchのビジュアルクオリティ、比較したシステムの中で最高のCTRランキングスコアで評価されたオープンソースエディタの中で、最も高い総合スコアを達成している。
オフラインでは、CTR誘導最適化は、予測されたCTRが生成した画像の比率を12.16%から37.41%に引き上げる。
オンラインA/B実験では、CTRベースの製品主画像の選択により、実際のCTRの相対的な増加率は2.44%である。
これらの結果は、商用画像編集におけるドメイン固有データの価値と報酬駆動アライメントを示す。
関連論文リスト
- MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing [80.57428909397176]
MIE-Benchは、人間の好みの細かいアノテーションを付加した、最初の大規模多重画像編集ベンチマークである。
MIE-Benchには16タスクに3000の編集インスタンスがあり、それぞれ2つ以上のソースイメージと編集プロンプトが含まれている。
MIEScoreはMultimodal large language model(MLLM)に基づく評価モデルであり、スキル最適化と多次元教師付き微調整によって強化されている。
論文 参考訳(メタデータ) (2026-08-03T10:57:00Z) - When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing [61.80513991207956]
我々は、36のきめ細かいプライバシーカテゴリと65の編集手順をカバーする最初のリカバリ指向ベンチマークであるSPPE(Surrogate-based Privacy-Preserving Editing)を紹介する。
編集性評価のために、ERMAはSRCCで13.9%、PLCCで12.3%向上した。
SPPEとInstructPix2Pixの実験では、両方のタスクが一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-06-05T11:40:03Z) - ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework [58.443783258153786]
大規模で高品質な画像編集データセットをエンドツーエンドに構築するための階層的マルチエージェントフレームワークであるScaleEditorを提案する。
パイプラインは3つの重要なコンポーネントから構成される:ワールド知識注入によるソース画像拡張、適応型マルチエージェント編集命令画像合成、タスク認識データ品質検証機構である。
ScaleEditorを使って、これまでで最大のオープンソースの画像編集データセットであるScaleEdit-12Mをキュレートします。
論文 参考訳(メタデータ) (2026-03-21T04:39:19Z) - Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach [48.01137214342501]
テキスト誘導画像編集手法の体系的評価のためのベンチマークであるTIEditを紹介する。
信頼性の高い主観的評価を得るために、20人の専門家が採用され、307,200人の主観的評価が得られる。
さらに,隠蔽表現の中間層探索により編集品質を推定するLCMベースの評価器であるEditProbeを提案する。
論文 参考訳(メタデータ) (2026-03-20T09:05:10Z) - FireRed-Image-Edit-1.0 Techinical Report [30.973736748818826]
FireRed-Editは、インストラクションイメージ編集のための拡散変換器である。
データの体系的な最適化,トレーニング方法論,評価設計を通じて,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-02-12T17:51:44Z) - CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning [98.98349220451216]
CoEditor++は、編集を"編集する方法"と"編集方法"に分解する、トレーニング不要のフレームワークである。
我々は,CoEditor++が編集タスクと編集タスクの両方において,最先端のパフォーマンスを実現することを示す。
以上の結果から,認知中心型画像編集の可能性が示唆された。
論文 参考訳(メタデータ) (2026-01-31T12:20:46Z) - HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing [38.13162627140172]
HQ-Editは、約20万の編集が可能な高品質な命令ベースの画像編集データセットである。
高品質を確実にするために、多様なサンプルはまずオンラインで収集され、拡張され、次に高品質なディプチチを作るために使用される。
HQ-Editは、細部が豊富で包括的な編集プロンプトを伴う高解像度の画像を編集し、既存の画像編集モデルの能力を大幅に強化する。
論文 参考訳(メタデータ) (2024-04-15T17:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。