論文の概要: Semi-Supervised Conditional Generative Learning through Stochastic Interpolation and Sufficient Representations
- arxiv url: http://arxiv.org/abs/2607.16725v1
- Date: Sat, 18 Jul 2026 09:21:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.235854
- Title: Semi-Supervised Conditional Generative Learning through Stochastic Interpolation and Sufficient Representations
- Title(参考訳): 確率補間と十分表現による半教師付き条件生成学習
- Authors: Changyu Liu, Yuling Jiao, Jian Huang,
- Abstract要約: 条件固有項と低次元潜在表現を組み合わせた半教師付きフレームワークを提案する。
RepGは生成をラベル依存の潜伏サンプリングと高次元再構成の2段階に分解する。
- 参考スコア(独自算出の注目度): 12.299177496689621
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conditional generative modeling remains a challenging problem in semi-supervised settings where labeled data is scarce but unlabeled samples are abundant. To effectively leverage structural information embedded within the unlabeled dataset and compensate for sparse conditioning signals, we propose a semi-supervised framework combining conditional stochastic interpolation with low-dimensional latent representations. RepG decomposes generation into two stages: label-dependent latent sampling and high-dimensional reconstruction. This isolates the supervised learning of conditional dependencies to a low-dimensional space, requiring few labels while utilizing the abundant unlabeled data purely for reconstruction. Theoretically, we establish an error decomposition showing that the Kullback-Leibler divergence of RepG comprises stage-wise estimation errors and a structural bias quantified by conditional mutual information. For deep neural network estimators, we derive non-asymptotic convergence rates proving that RepG significantly improves sample complexity. By confining the supervised estimation burden to the low intrinsic dimension of the latent representation, RepG achieves a strictly faster convergence rate. Complemented by a minimax lower bound, our theoretical results demonstrate that this method effectively mitigates the curse of dimensionality inherent in direct ambient-space generative modeling.
- Abstract(参考訳): ラベル付きデータが少ないがラベル付きサンプルが豊富である半教師付き環境では、条件付き生成モデリングは依然として難しい問題である。
ラベル付きデータセットに埋め込まれた構造情報を効果的に活用し、スパース条件信号の補償を行うため、条件確率補間と低次元潜在表現を組み合わせた半教師付きフレームワークを提案する。
RepGは生成をラベル依存の潜伏サンプリングと高次元再構成の2段階に分解する。
これにより、低次元空間への条件依存の教師付き学習を分離し、ラベルをほとんど必要とせず、大量のラベルのないデータを純粋に再構成するために利用する。
理論的には、RepGのKulback-Leibler分散が段階的推定誤差と条件付き相互情報によって定量化された構造バイアスを含むことを示す誤り分解を確立する。
ディープニューラルネットワーク推定器では、RepGがサンプルの複雑さを大幅に改善することを示す非漸近収束率を導出する。
教師付き推定負荷を潜在表現の低内在次元に収束させることで、RepGは厳格に高速な収束率を達成する。
提案手法は, 直交空間生成モデルに固有の次元の呪いを効果的に軽減するものである。
関連論文リスト
- Provably Learning Diffusion Models under the Manifold Hypothesis: Collapse and Refine [60.669081685261965]
拡散モデルは、顕著な品質で高次元データを生成する。
彼らのトレーニングがいかに効率的にスコア関数を学習するかは理論的には説明がつかないままである。
我々はこの原理をScore-induced Latent Diffusion (SiLD)として定式化する。
論文 参考訳(メタデータ) (2026-05-16T16:51:10Z) - SEED: Targeted Data Selection by Weighted Independent Set [76.68391670109433]
我々はSEEDと呼ばれる堅牢でスケーラブルなデータ選択パイプラインを開発した。
SEEDは、命令チューニング、視覚的命令チューニング、セマンティックセグメンテーションにおける最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-15T07:26:54Z) - Geometrically Constrained Outlier Synthesis [4.254099382808598]
画像分類のためのディープニューラルネットワークは、しばしばアウト・オブ・ディストリビューション(OOD)サンプルに過信を示す。
トレーニング時間正規化フレームワークであるGCOS(Geometrically Constrained Outlier Synthesis)を紹介する。
このフレームワークは自然に共形OOD推論に遷移し、不確かさのスコアを統計的に有効なp値に変換する。
論文 参考訳(メタデータ) (2026-03-09T14:11:47Z) - Robust low-rank estimation with multiple binary responses using pairwise AUC loss [0.0]
複数のバイナリ応答は、多くの現代のデータ分析問題に現れる。
低ランクモデルはタスク間の遅延依存をエンコードする自然な方法を提供する。
既存のバイナリデータの方法は概ね可能性ベースであり、ポイントワイズ分類に重点を置いている。
論文 参考訳(メタデータ) (2026-01-13T15:00:10Z) - SIGMA: Scalable Spectral Insights for LLM Collapse [51.863164847253366]
SIGMA(Spectral Inequalities for Gram Matrix Analysis)は,モデル崩壊のための統一的なフレームワークである。
行列のスペクトル上の決定論的境界を導出するベンチマークを利用することで、SIGMAは表現空間の収縮を追跡するために数学的に基底化された計量を提供する。
我々は、SIGMAが状態への遷移を効果的に捉え、崩壊のメカニズムに関する理論的知見の両方を提供することを示した。
論文 参考訳(メタデータ) (2026-01-06T19:47:11Z) - Modes of Sequence Models and Learning Coefficients [0.6906005491572401]
変換器ネットワークにおける損失ランドスケープの計測可能な特性とデータ中のパターンをリンクするシーケンスモデリングの幾何学的記述を開発する。
局所学習係数の推定値がデータ依存しきい値以下のモードに無関心であることを理論的に示す。
この洞察は、ネットワークパラメータが人口減少の厳格な最小限ではない場合でも、なぜ信頼できるLLC推定値が得られるのかを明らかにする。
論文 参考訳(メタデータ) (2025-04-25T03:38:10Z) - TwinTURBO: Semi-Supervised Fine-Tuning of Foundation Models via Mutual Information Decompositions for Downstream Task and Latent Spaces [10.86297454943578]
本稿では,限られたラベル付きデータに対するトレーニングの課題に対処する,半教師付き微調整フレームワークを提案する。
いくつかのデータセットの実験では、極低ラベル条件下での分類タスクが大幅に改善された。
論文 参考訳(メタデータ) (2025-03-10T20:56:54Z) - Breaking the Spurious Causality of Conditional Generation via Fairness
Intervention with Corrective Sampling [77.15766509677348]
条件生成モデルは、トレーニングデータセットから急激な相関を継承することが多い。
これは別の潜在属性に対して不均衡なラベル条件分布をもたらす。
この問題を緩和するための一般的な2段階戦略を提案する。
論文 参考訳(メタデータ) (2022-12-05T08:09:33Z) - Log-Likelihood Ratio Minimizing Flows: Towards Robust and Quantifiable
Neural Distribution Alignment [52.02794488304448]
そこで本研究では,対数様比統計量と正規化フローに基づく新しい分布アライメント手法を提案する。
入力領域の局所構造を保存する領域アライメントにおいて,結果の最小化を実験的に検証する。
論文 参考訳(メタデータ) (2020-03-26T22:10:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。