論文の概要: Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability
- arxiv url: http://arxiv.org/abs/2607.22428v1
- Date: Fri, 24 Jul 2026 15:48:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.17129
- Title: Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability
- Title(参考訳): 芸術のための拡散モデルのアンボックス化:対話型モデル曲げと実践に基づく説明可能性
- Abstract要約: 内部構造が可視化され、操作可能になったとき、大きなモデルでさえ創造的な素材として機能する、と我々は主張する。
このアプローチをモデル曲げと、ComfyUIsノードベースのワークフローに統合されたインタラクティブな(検査)インターフェースでインスタンス化する。
- 参考スコア(独自算出の注目度): 2.7138043802067835
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Explainable AI (XAI) in creative practice can be less about technocentric explanation and more about enabling artists to inspect modify and debug models as part of making Yet largescale texttoimage diffusion systems are typically presented as opaque endtoend tools limiting this kind of material engagement We argue that even large models can function as creative materials when their internal structure is made visible and manipulable To support this we propose a handson approach to explainability centred on experimentation and intervention We instantiate this approach with a model bending and an interactive (inspection) interface integrated into ComfyUIs nodebased workflow including interactive layer selection and intervention controls Through qualitative and quantitative analysis of bending interventions in Stable Diffusion 15 we show how manipulating specific components of a diffusion pipeline produces relatively consistent families of visual effects allowing artists to build practical layerlevel intuition about how different parts of the model shape generated images
- Abstract(参考訳): 創造的な実践における説明可能なAI(XAI)は、技術中心的な説明よりも、アーチストによる修正とデバッギングを作成の一部として可能にすることに関するものである。しかし、大規模なテキストトイメージ拡散システムは、通常、このような素材の関与を制限する不透明なエンドツーエンドツールとして提示される。 たとえ大きなモデルであっても、内部構造が見え、操作可能になったときに創造的な素材として機能する、と我々は主張する。
関連論文リスト
- Guava: An Effective and Universal Harness for Embodied Manipulation [74.34187069605844]
実装された操作能力を4Bオープンソースモデルに蒸留するエンドツーエンドのトレーニングパイプラインを開発した。
結果は、よく設計されたハーネスが、エンボディド操作のためのスケーラブルでモデルに依存しないインターフェースとして機能することを示唆している。
論文 参考訳(メタデータ) (2026-06-16T18:09:26Z) - JODA: Composable Joint Dynamics for Articulated Objects [17.60725863703415]
JODAは、ジョイントレベルダイナミクスを、ジョイントレベルの自由度を越えて構造化された3チャンネルフィールドとして生成するためのフレームワークである。
それは、解釈可能かつ微分可能シミュレーションと互換性のあるコンパクトかつ表現的関数空間を定義する。
JODAは多種多様な関節行動の可塑性かつ制御可能なモデリングを可能にし,推論,編集,最適化のための統一インターフェースを提供する。
論文 参考訳(メタデータ) (2026-05-11T04:02:15Z) - Data-Efficient Brushstroke Generation with Diffusion Models for Oil Painting [60.15416769662556]
そこで本研究では,手書きサンプルの小さなセットから人型ブラシストローク生成を学習する問題について検討する。
Smooth Regularization (SmR) を用いた拡散型フレームワーク StrokeDiff を提案する。
学習したプリミティブをBézierベースの条件付けモジュールで制御可能であることを示す。
論文 参考訳(メタデータ) (2026-03-01T13:42:35Z) - Explainability-in-Action: Enabling Expressive Manipulation and Tacit Understanding by Bending Diffusion Models in ComfyUI [6.349140286855134]
我々は、Sch"onの「反省的行動(reflection-in-action)」と似た、長期的、ハンズオンなエンゲージメントに根ざした説明可能性へのクラフトベースのアプローチを提案する。
生成モデルの異なる部分をインタラクティブに操作することで、アーティストは各コンポーネントが出力にどのように影響するかについての直感を発達させることができることを実証する。
論文 参考訳(メタデータ) (2025-08-10T05:19:30Z) - JADE: Joint-aware Latent Diffusion for 3D Human Generative Modeling [62.77347895550087]
JADEは人体形状の変化を微粒化制御で学習する生成フレームワークである。
私たちの重要な洞察は、人体を骨格構造に分解する共同認識の潜伏表現です。
提案した分解条件下でのコヒーレントで可塑性な人体形状を生成するため,カスケードパイプラインも提案する。
論文 参考訳(メタデータ) (2024-12-29T14:18:35Z) - Interaction as Explanation: A User Interaction-based Method for Explaining Image Classification Models [1.3597551064547502]
コンピュータビジョンでは、説明可能なAI(xAI)手法は「ブラックボックス」問題を緩和しようとする。
従来のxAI手法は、モデル予測に影響を与える入力特徴の可視化に重点を置いている。
本稿では,画像分類モデルのユーザ理解を深めるインタラクションベースのxAI手法を提案する。
論文 参考訳(メタデータ) (2024-04-15T14:26:00Z) - Diffexplainer: Towards Cross-modal Global Explanations with Diffusion Models [51.21351775178525]
DiffExplainerは、言語ビジョンモデルを活用することで、マルチモーダルなグローバルな説明可能性を実現する新しいフレームワークである。
最適化されたテキストプロンプトに条件付けされた拡散モデルを使用し、クラス出力を最大化する画像を合成する。
生成した視覚的記述の分析により、バイアスと突発的特徴の自動識別が可能になる。
論文 参考訳(メタデータ) (2024-04-03T10:11:22Z) - Neural Additive Image Model: Interpretation through Interpolation [0.0]
本稿では,ニューラル加算モデルと拡散オートエンコーダを用いた全体論的モデリング手法を提案する。
本手法は, アブレーション実験において, 複雑な画像効果を正確に同定できることを実証する。
提案モデルの実用性をさらに実証するため,ホスト画像内の特徴的特徴と属性がAirbnbレンタルの価格にどのように影響するかをケーススタディで検討した。
論文 参考訳(メタデータ) (2024-03-06T16:46:07Z) - StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized
Image-Dialogue Data [129.92449761766025]
本稿では,視覚的インストラクションチューニングのための画像と対話を同期的に合成する新しいデータ収集手法を提案する。
このアプローチは生成モデルのパワーを活用し、ChatGPTとテキスト・ツー・イメージ生成モデルの能力とを結合する。
本研究は,各種データセットを対象とした総合的な実験を含む。
論文 参考訳(メタデータ) (2023-08-20T12:43:52Z) - Single Stage Virtual Try-on via Deformable Attention Flows [51.70606454288168]
仮想試行は、ショップ内服と基準人物画像が与えられた写真リアルなフィッティング結果を生成することを目的としている。
マルチフロー推定に変形性アテンションスキームを適用した,変形性アテンションフロー(DAFlow)を新たに開発した。
提案手法は,定性的かつ定量的に最先端の性能を実現する。
論文 参考訳(メタデータ) (2022-07-19T10:01:31Z) - Compositional Visual Generation with Composable Diffusion Models [80.75258849913574]
拡散モデルを用いた構成生成のための代替的な構造的アプローチを提案する。
画像は拡散モデルの集合を構成することで生成され、それぞれが画像の特定のコンポーネントをモデル化する。
提案手法は, トレーニングで見られるものよりもはるかに複雑なシーンを, テスト時に生成することができる。
論文 参考訳(メタデータ) (2022-06-03T17:47:04Z) - Structure-Regularized Attention for Deformable Object Representation [17.120035855774344]
文脈依存のキャプチャは、ディープニューラルネットワークの表現力を改善するのに有用であることが証明されている。
自己注意や非局所操作といったグローバルコンテキストのモデリングに焦点をあてた近年のアプローチは、要素間の制約のないペアワイズ相互作用を可能にすることで、この目標を達成する。
本稿では,データに固有の構造的依存関係をモデル化することにより,コンテキスト利用の恩恵を受けることができる変形可能なオブジェクトの学習表現について考察する。
論文 参考訳(メタデータ) (2021-06-12T03:10:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。