論文の概要: Qwen-Image-Flash: Beyond Objective Design
- arxiv url: http://arxiv.org/abs/2606.03746v2
- Date: Wed, 03 Jun 2026 05:16:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-04 17:40:41.638633
- Title: Qwen-Image-Flash: Beyond Objective Design
- Title(参考訳): Qwen-Image-Flash: 客観的デザインを超えて
- Abstract要約: 我々は,学生のパフォーマンスを批判的に形作るトレーニングレシピに焦点をあてて,補完的な視点から数段階の蒸留を再考する。
以上の結果から, 有効数段階蒸留には, 慎重に設計した目的だけでなく, より広範な訓練パイプラインの組織化も必要であることが示唆された。
- 参考スコア(独自算出の注目度): 71.2344349081089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Few-step distillation has become an effective strategy for accelerating advanced visual generative models, yet prior work has largely focused on distillation objectives. In this work, we revisit few-step distillation from a complementary perspective, focusing on the training recipe that critically shapes student performance. Using Qwen-Image-2.0 as a representative case, we systematically investigate three factors in unified text-to-image generation and instruction-guided image editing distillation: data composition, teacher guidance, and task mixture. Our empirical analysis reveals several non-obvious behaviors, which motivate the development of Qwen-Image-Flash. Overall, our results suggest that effective few-step distillation requires not only carefully designed objectives, but also principled organization of the broader training pipeline.
- Abstract(参考訳): 先進的な視覚生成モデルの加速には, 少ない段階の蒸留が有効な戦略となっているが, 先行研究は, 蒸留の目的に重点を置いている。
本研究では,学生のパフォーマンスを批判的に形作るトレーニングレシピに着目し,補完的な視点から数段階の蒸留を再考する。
代表事例としてQwen-Image-2.0を用いて,データ合成,教師指導,タスク混合という,統一されたテキスト・画像生成と指導誘導画像編集の3つの要因を体系的に検討した。
我々の実証分析では、Qwen-Image-Flashの開発を動機付けるいくつかの非回避行動が明らかにされている。
以上の結果から, 実効的な数段階蒸留には, 慎重に設計された目的だけでなく, より広範な訓練パイプラインの組織化も必要であることが示唆された。
関連論文リスト
- UNDO: Understanding Distillation as Optimization [9.100811514331498]
UNDO: Understanding Distillation as Optimization frameworkを紹介します。
各イテレーションは、生徒の学習不足を直接対象とし、教師に調整された強化された合理性を提供する動機を与える。
様々な数学的・常識的推論タスクに関する実証的な評価は、我々の反復蒸留法UNDOが標準の1段階蒸留法を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2025-04-03T12:18:51Z) - Towards Training One-Step Diffusion Models Without Distillation [72.80423908458772]
我々は,教師のスコア管理を完全に禁止する,新しい研修方法のファミリーを紹介する。
教師の重みによる学生モデルの初期化は依然として重要な課題である。
論文 参考訳(メタデータ) (2025-02-11T23:02:14Z) - E$^{2}$GAN: Efficient Training of Efficient GANs for Image-to-Image Translation [69.72194342962615]
拡散モデルからGANを蒸留するプロセスは、より効率的にできるのか?
まず、一般化された特徴を持つベースGANモデルを構築し、微調整により異なる概念に適応し、スクラッチからトレーニングの必要性を排除した。
第2に,ベースモデル全体の微調整を行うのではなく,低ランク適応(LoRA)を簡易かつ効果的なランク探索プロセスで行う。
第3に、微調整に必要な最小限のデータ量を調査し、トレーニング時間を短縮する。
論文 参考訳(メタデータ) (2024-01-11T18:59:14Z) - Understanding the Role of the Projector in Knowledge Distillation [22.698845243751293]
機能マッチングとメートル法学習問題としての知識蒸留の有効性を再考する。
我々は3つの重要な設計決定、すなわち正規化、ソフト最大関数、投影層を検証する。
ImageNetのDeiT-Tiで、77.2%のトップ1の精度を実現しました。
論文 参考訳(メタデータ) (2023-03-20T13:33:31Z) - HomoDistil: Homotopic Task-Agnostic Distillation of Pre-trained
Transformers [49.79405257763856]
本稿では,タスク非依存蒸留に焦点をあてる。
これは、計算コストとメモリフットプリントを小さくして、様々なタスクで簡単に微調整できるコンパクトな事前訓練モデルを生成する。
本稿では, 反復刈り込みによる新規なタスク非依存蒸留法であるHomotopic Distillation (HomoDistil)を提案する。
論文 参考訳(メタデータ) (2023-02-19T17:37:24Z) - Rich Feature Distillation with Feature Affinity Module for Efficient
Image Dehazing [1.1470070927586016]
この作業は、単一イメージのヘイズ除去のためのシンプルで軽量で効率的なフレームワークを導入します。
我々は、ヘテロジニアス知識蒸留の概念を用いて、軽量な事前学習された超解像モデルから豊富な「暗黒知識」情報を利用する。
本実験は, RESIDE-Standardデータセットを用いて, 合成および実世界のドメインに対する我々のフレームワークの堅牢性を示す。
論文 参考訳(メタデータ) (2022-07-13T18:32:44Z) - Cross-modal Contrastive Distillation for Instructional Activity
Anticipation [144.47787959640482]
本研究では,過去を観察し,今後の課題を予測し,教育活動予測の課題を研究することを目的とする。
教示ビデオから抽出された意味情報がないため、これは難しい課題である。
本稿では,視覚的予測タスクを支援するために,関連する外部テキスト知識を活用する新しい知識蒸留フレームワークを提案する。
論文 参考訳(メタデータ) (2022-01-18T04:20:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。