論文の概要: A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms
- arxiv url: http://arxiv.org/abs/2607.03256v1
- Date: Fri, 03 Jul 2026 12:18:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.567048
- Title: A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms
- Title(参考訳): 数ステップ拡散モデルのための分解可能なプローブ:背骨家族と蒸留パラダイム間のプロンプト、潜時、スコア選択性
- Abstract要約: 拡散学生は50~1-8のネットワーク評価からテキスト・ツー・イメージ・推論を減らした。
我々はスカラーを3つの層に沿って制御された摂動を注入する分解可能なプローブで置き換える。
Inception機能に対するブートストラップ中間のBures W22選択率について報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Few-step distilled diffusion students cut text-to-image inference from ~50 to 1-8 network evaluations, but the quality gap is usually summarised by a single FID/CLIP scalar that cannot say which axis of the conditioning response changed, nor whether a behaviour comes from the architecture, the distillation objective, or simply from being a diffusion model. We replace the scalar with a decomposable probe that injects controlled perturbations along three layers (prompt encoder, denoiser input, denoiser output) under three modes (mean, variance, scale) and six strengths, reporting a bootstrap-median Bures W2^2 selectivity ratio on Inception features. Under a single matched estimator across 23 models -- five teachers and 18 distilled students spanning five backbone families (SDXL, SD1.5, SD3.5, PixArt-alpha, FLUX), three architecture classes (UNet, DiT, MMDiT), and five distillation paradigms -- the three layers read three empirically separable factors: the prompt layer is a universal prompt-mean response (a sanity channel, not a discriminator), the latent layer reads the prediction type, and the score layer reads the distillation objective. Our main result: within this sweep, the latent layer is a near-binary detector of rectified-flow backbones. Its ratio exceeds 1 across a sustained low-to-mid band only for rectified-flow models (SD3.5, FLUX); no epsilon-prediction model qualifies. A matched epsilon-prediction control (PixArt-alpha) rules out wide-T5 conditioning, and the fingerprint survives adversarial (ADD) distillation as both teacher and student. Two secondary score-layer findings hold under narrower scopes: a canonical 4-step ADD-vs-rest contrast on the UNet families with a non-ADD baseline, and a CI-separated trajectory-rollout early-strength score spike on both UNet and DiT. All ratios are CI-citable under one estimator; we release the per-cell tables and the estimator.
- Abstract(参考訳): 蒸留拡散学習生は50~1-8のネットワーク評価からテキスト・ツー・イメージの推論を行ったが、品質ギャップは通常、条件付け応答のどの軸が変化したか、その振る舞いがアーキテクチャや蒸留目的、あるいは単に拡散モデルから来たかどうかを判断できない単一のFID/CLIPスカラーによって要約される。
我々はスカラーを3つのモード (平均, 分散, スケール) と6つの強度 (平均, 分散, スケール) で制御された摂動を3つの層に沿って注入する分解可能なプローブに置き換え, ブートストラップ中間のBures W2^2選択比をインセプション特徴に報告した。
5人の教師と18人の蒸留学生(SDXL, SD1.5, SD3.5, PixArt-alpha, FLUX)、3つのアーキテクチャクラス(UNet, DiT, MMDiT)、および5つの蒸留パラダイム(3つの層が経験的に分離可能な3つの要因を読み取ります。
我々の主な成果は、このスイープの中で、潜伏層は、整流後骨のほぼ2分の1の検出器である。
その比は、整流モデル(SD3.5, FLUX)でのみ持続する低中間帯域で1を超える。
一致したEpsilon-prediction Control (PixArt-alpha) は、幅広いT5条件を規定し、指紋は教師と学生の両方が相手の蒸留(ADD)を継続する。
2つの二次スコア層は、非ADDベースラインを持つUNetファミリーの標準4ステップADD-vs-restコントラストと、UNetおよびDiTのCI分離トラジェクトリロールアウト早期スコアスパイクである。
すべての比率は1つの推定器の下でCI-citableであり、セル単位のテーブルと推定器を解放する。
関連論文リスト
- Exact Degeneracy Under Balanced k-Shot Sampling:Consequences for Small-Sample Discriminant Analysis on LLM Embeddings [0.0]
そこで本研究では,k-shotサンプリングのバランスが,小さめの判別式推定器群において,正確かつ証明可能な縮退を誘導することを示した。
次に,凍結埋込に関する少数ショットテキスト分類において,Kernelgression修復フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-09-09T08:13:54Z) - On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging [13.653084100002737]
教師が生徒自身が生成するサンプルを補正するオンライン蒸留は、2つのモデルが同じ言語を話すことを前提にしている。
我々は、Any-OPDについて、任意対の潜流整合発生器間のオンライン蒸留のための最初のフレームワークについて述べる。
論文 参考訳(メタデータ) (2026-08-04T08:23:57Z) - A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks [0.0]
本研究では、このギャップを象徴的推論から神経知覚を分離することで橋渡しするモジュラーでファジィな規則に基づくニューロシンボリック・フレームワークを導入する。
推論のために、DT、特にウェカのJ48アルゴリズムは、接地規則のCODEと重度ラベルに基づいて訓練され、その経路は19の固定IF-THENルールに変換される。
全体として、このフレームワークは、競合するクラスバランスのパフォーマンスと予測されたCODE学位からのトレース可能な推論を組み合わせることで、ルールサポートと重大さのエビデンスを実現している。
論文 参考訳(メタデータ) (2026-07-30T16:33:26Z) - CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning [4.663685189987781]
自己蒸留剤強化学習は、トークンレベルの蒸留損失で軌跡レベルの報酬を増大させる。
一般的なレシピでは、この損失を1つのスカラー、すなわち教師と学生の対数確率のギャップで埋める。
CRAFTは2つの制限に対処する3ピラー・クレジット・アサインメント方式である。
論文 参考訳(メタデータ) (2026-06-28T16:11:47Z) - Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks [1.9800951131982487]
我々はSpecRef(Speculative Refinement)を用いて、ARドラフトからマスク付き拡散言語モデルをウォームスタートする。
We evaluate SpecRef across six benchmarks (HumanEval, MBPP, GSM8K, BBH, ARC-Challenge, HellaSwag) with three distinct evaluation protocol。
これらの観察は、多段階または非自己回帰生成パイプラインに適用され、より診断評価の実践に向けて向けられる。
論文 参考訳(メタデータ) (2026-06-25T18:52:24Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Two-View Accumulation as the Primary Training Lever for Hybrid-Capture Gaussian Splatting: A Variance-Decomposition View of When Gradient Surgery Helps [7.6889618752994595]
ハイブリッドキャプチャーノベルビュー合成は、かなり異なるカメラビューを組み合わせる。
標準3DGSは、ステップ毎に1つのレンダリングビューで30Kイテレーションでトレーニングされている。
本稿では,この発見を予測・説明する分散分解フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T17:45:51Z) - Score Distillation of Flow Matching Models [67.86066177182046]
我々は、Score Identity Distillation (SiD) を事前訓練されたテキスト対画像フローマッチングモデルに拡張する。
SiDは、データフリーとデータアシストの両方の設定で、これらのモデルですぐに使える。
これは、スコア蒸留がテキストと画像のフローマッチングモデルに広く適用されるという最初の体系的な証拠を提供する。
論文 参考訳(メタデータ) (2025-09-29T17:45:48Z) - Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis [65.77083310980896]
本稿では, 実測値と偽測値の間に潜時予測を整列させる適応分布マッチング (ADM) を提案する。
提案手法は,DMD2と比較してSDXLの1ステップ性能に優れ,GPU時間が少ない。
SD3-Medium, SD3.5-Large, CogVideoX に多段階の ADM 蒸留を適用した実験では, 画像と映像の効率的な合成に向けた新しいベンチマークが設定された。
論文 参考訳(メタデータ) (2025-07-24T16:45:05Z) - A Lesson in Splats: Teacher-Guided Diffusion for 3D Gaussian Splats Generation with 2D Supervision [65.33043028101471]
本稿では,2次元監視のみを用いた3次元画像調和拡散モデルの学習フレームワークを提案する。
既存の3D生成モデルは、大規模な3Dデータセットが不足しているため、完全に3Dの監視に依存している。
論文 参考訳(メタデータ) (2024-12-01T00:29:57Z) - Bidirectional Semi-supervised Dual-branch CNN for Robust 3D
Reconstruction of Stereo Endoscopic Images via Adaptive Cross and Parallel
Supervisions [15.879059896662723]
そこで本研究では,教師と生徒の両方の役割を兼ね備えた,2人の学習者との双方向学習手法を提案する。
具体的には、アダプティブ・クロス・スーパービジョン(ACS)とアダプティブ・パラレル・スーパービジョン(APS)の2つの自己スーパービジョンを紹介する。
学習知識は分岐方向(ACSにおける分散誘導)と平行方向(APSにおける分散誘導)の2方向に沿って流れている。
論文 参考訳(メタデータ) (2022-10-15T13:30:41Z) - Point-to-Voxel Knowledge Distillation for LiDAR Semantic Segmentation [74.67594286008317]
本稿では,大きな教師モデルから,LiDARセマンティックセグメンテーションのためのスリムな学生ネットワークへの知識の抽出の問題に対処する。
本稿では,点レベルとボクセルレベルの両方から隠れた知識を伝達するPVDを提案する。
論文 参考訳(メタデータ) (2022-06-05T05:28:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。