論文の概要: Assessing Open-world Forgetting in Generative Image Model Customization
- arxiv url: http://arxiv.org/abs/2410.14159v1
- Date: Fri, 18 Oct 2024 03:58:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-10-21 14:26:04.264723
- Title: Assessing Open-world Forgetting in Generative Image Model Customization
- Title(参考訳): 生成的画像モデルカスタマイズにおけるオープンワールドフォーミングの評価
- Authors: Héctor Laria, Alex Gomez-Villa, Imad Eddine Marouf, Kai Wang, Bogdan Raducanu, Joost van de Weijer,
- Abstract要約: 新しいクラスで拡散モデルをカスタマイズすると、しばしば意図しない結果につながり、信頼性を損なう。
本研究は,拡散モデルにおけるオープンワールドの忘れ方に関する総合的研究である。
本稿では,機能的正規化に基づく緩和戦略を提案する。
- 参考スコア(独自算出の注目度): 17.219815694562993
- License:
- Abstract: Recent advances in diffusion models have significantly enhanced image generation capabilities. However, customizing these models with new classes often leads to unintended consequences that compromise their reliability. We introduce the concept of open-world forgetting to emphasize the vast scope of these unintended alterations, contrasting it with the well-studied closed-world forgetting, which is measurable by evaluating performance on a limited set of classes or skills. Our research presents the first comprehensive investigation into open-world forgetting in diffusion models, focusing on semantic and appearance drift of representations. We utilize zero-shot classification to analyze semantic drift, revealing that even minor model adaptations lead to unpredictable shifts affecting areas far beyond newly introduced concepts, with dramatic drops in zero-shot classification of up to 60%. Additionally, we observe significant changes in texture and color of generated content when analyzing appearance drift. To address these issues, we propose a mitigation strategy based on functional regularization, designed to preserve original capabilities while accommodating new concepts. Our study aims to raise awareness of unintended changes due to model customization and advocates for the analysis of open-world forgetting in future research on model customization and finetuning methods. Furthermore, we provide insights for developing more robust adaptation methodologies.
- Abstract(参考訳): 拡散モデルの最近の進歩は画像生成能力を著しく向上させた。
しかし、これらのモデルを新しいクラスでカスタマイズすることは、しばしば意図しない結果をもたらし、信頼性を損なう。
我々は,これらの意図しない変更の広い範囲を強調するために,オープンワールド・リフレクションの概念を導入し,クラスやスキルの限られたセットのパフォーマンスを評価することで,十分に研究されているクローズドワールド・リフレクションと対比する。
本研究は,表現のセマンティックドリフトと外観ドリフトに着目した,拡散モデルにおけるオープンワールドの忘れに関する初の包括的研究である。
ゼロショット分類を用いてセマンティックドリフトを解析し、マイナーモデルによる適応であっても、新しく導入された概念をはるかに超越した領域に予測不可能な変化をもたらし、ゼロショット分類の最大60%が劇的に低下することを明らかにする。
また, 外観ドリフトの解析において, 生成内容のテクスチャや色の変化が顕著に観察された。
これらの課題に対処するため,機能正規化に基づく緩和戦略を提案する。
本研究は,モデルカスタマイズによる意図しない変化に対する意識を高めることを目的としており,今後のモデルカスタマイズとファインタニング手法に関する研究におけるオープンワールドの忘れの分析を提唱している。
さらに、より堅牢な適応手法を開発するための洞察を提供する。
関連論文リスト
- A Survey on All-in-One Image Restoration: Taxonomy, Evaluation and Future Trends [67.43992456058541]
画像復元(IR)とは、ノイズ、ぼかし、気象効果などの劣化を除去しながら、画像の視覚的品質を改善する過程である。
従来のIR手法は、一般的に特定の種類の劣化をターゲットとしており、複雑な歪みを伴う現実のシナリオにおいて、その効果を制限している。
オールインワン画像復元(AiOIR)パラダイムが登場し、複数の劣化タイプに順応的に対処する統一されたフレームワークを提供する。
論文 参考訳(メタデータ) (2024-10-19T11:11:09Z) - Data Augmentation via Latent Diffusion for Saliency Prediction [67.88936624546076]
残差予測モデルはラベル付きデータの限られた多様性と量によって制約される。
本研究では,実世界のシーンの複雑さと変動性を保ちながら,自然画像の編集を行うディープ・サリエンシ・予測のための新しいデータ拡張手法を提案する。
論文 参考訳(メタデータ) (2024-09-11T14:36:24Z) - SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models [85.67096251281191]
我々は、ゼロショットスパースミクチャー(SMILE)と呼ばれるモデル融合に対する革新的なアプローチを提案する。
SMILEは、余分なデータやさらなるトレーニングなしに、ソースモデルをMoEモデルにアップスケーリングできる。
画像分類やテキスト生成タスクなど,さまざまなシナリオに対して,フル微調整とLoRA微調整を用いて広範な実験を行う。
論文 参考訳(メタデータ) (2024-08-19T17:32:15Z) - Examining Changes in Internal Representations of Continual Learning Models Through Tensor Decomposition [5.01338577379149]
連続学習(CL)は、逐次学習にまたがる過去の知識の統合を目的としたいくつかの手法の開発を加速させた。
CLモデルのための表現に基づく新しい評価フレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-06T07:52:44Z) - Bridging Generative and Discriminative Models for Unified Visual
Perception with Diffusion Priors [56.82596340418697]
本稿では,豊富な生成前駆体を含む事前学習型安定拡散(SD)モデルと,階層的表現を統合可能な統一型ヘッド(Uヘッド)と,識別前駆体を提供する適応型専門家からなる,シンプルで効果的なフレームワークを提案する。
包括的調査では、異なる時間ステップで潜伏変数に隠された知覚の粒度や様々なU-netステージなど、バーマスの潜在的な特性が明らかになった。
有望な結果は,有望な学習者としての拡散モデルの可能性を示し,情報的かつ堅牢な視覚表現の確立にその意義を定めている。
論文 参考訳(メタデータ) (2024-01-29T10:36:57Z) - Demystifying Variational Diffusion Models [23.601173340762074]
我々は、有向なグラフィカルモデリングと変分ベイズ原理を用いた拡散モデルについて、より簡単に紹介する。
我々の展示は、深い潜伏変数モデルのような基本的な概念から、連続時間拡散に基づくモデリングの最近の進歩まで、包括的な技術的レビューを構成する。
我々は、新しい表記の導入を避けつつ、理解を助けるために、可能な限り精巧な作品で省略された追加の数学的洞察を提供する。
論文 参考訳(メタデータ) (2024-01-11T22:37:37Z) - Diffusion Models for Image Restoration and Enhancement -- A
Comprehensive Survey [96.99328714941657]
本稿では,近年の拡散モデルに基づく画像復元手法について概観する。
我々は、赤外線とブラインド/現実世界の両方で拡散モデルを用いて、革新的なデザインを分類し、強調する。
本稿では,拡散モデルに基づくIRの今後の研究に向けた5つの可能性と課題を提案する。
論文 参考訳(メタデータ) (2023-08-18T08:40:38Z) - Internal Representations of Vision Models Through the Lens of Frames on
Data Manifolds [8.67467876089153]
多様体の接束上のフレームの概念から着想を得た、そのような表現を研究するための新しいアプローチを提案する。
私たちの構成は、ニューラルネットワークフレームと呼ばれ、データポイントの特定の種類の摂動を表すベクトルの集合を組み立てることによって形成されます。
ニューラルフレームを用いて、データポイントの小さな近傍でモデル、層間、特定の変動モードの処理方法について観察する。
論文 参考訳(メタデータ) (2022-11-19T01:48:19Z) - Rethinking Generalization of Neural Models: A Named Entity Recognition
Case Study [81.11161697133095]
NERタスクをテストベッドとして、異なる視点から既存モデルの一般化挙動を分析する。
詳細な分析による実験は、既存のニューラルNERモデルのボトルネックを診断する。
本論文の副産物として,最近のNER論文の包括的要約を含むプロジェクトをオープンソース化した。
論文 参考訳(メタデータ) (2020-01-12T04:33:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。