論文の概要: Comparing information content of representation spaces for disentanglement with VAE ensembles
- arxiv url: http://arxiv.org/abs/2405.21042v1
- Date: Fri, 31 May 2024 17:33:07 GMT
- ステータス: 処理完了
- システム内更新日: 2024-06-03 13:19:30.819185
- Title: Comparing information content of representation spaces for disentanglement with VAE ensembles
- Title(参考訳): 異方性表現空間の情報内容とVAEアンサンブルの比較
- Authors: Kieran A. Murphy, Sam Dillavou, Dani S. Bassett,
- Abstract要約: Disentanglementは、機械学習を使用してデータセットに関する情報を意味のある断片に分割する試みである。
繰り返し学習の合奏によって学習された情報の断片として,学習チャネルを集合的に研究する。
- 参考スコア(独自算出の注目度): 3.7277730514654555
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Disentanglement is the endeavour to use machine learning to divide information about a dataset into meaningful fragments. In practice these fragments are representation (sub)spaces, often the set of channels in the latent space of a variational autoencoder (VAE). Assessments of disentanglement predominantly employ metrics that are coarse-grained at the model level, but this approach can obscure much about the process of information fragmentation. Here we propose to study the learned channels in aggregate, as the fragments of information learned by an ensemble of repeat training runs. Additionally, we depart from prior work where measures of similarity between individual subspaces neglected the nature of data embeddings as probability distributions. Instead, we view representation subspaces as communication channels that perform a soft clustering of the data; consequently, we generalize two classic information-theoretic measures of similarity between clustering assignments to compare representation spaces. We develop a lightweight method of estimation based on fingerprinting representation subspaces by their ability to distinguish dataset samples, allowing us to identify, analyze, and leverage meaningful structure in ensembles of VAEs trained on synthetic and natural datasets. Using this fully unsupervised pipeline we identify "hotspots" in the space of information fragments: groups of nearly identical representation subspaces that appear repeatedly in an ensemble of VAEs, particularly as regularization is increased. Finally, we leverage the proposed methodology to achieve ensemble learning with VAEs, boosting the information content of a set of weak learners -- a capability not possible with previous methods of assessing channel similarity.
- Abstract(参考訳): Disentanglementは、機械学習を使用してデータセットに関する情報を意味のある断片に分割する試みである。
実際には、これらのフラグメントは表現(部分)空間であり、しばしば変分オートエンコーダ(VAE)の潜在空間内のチャネルの集合である。
絡み合いの評価は、主にモデルレベルで粗い粒度を持つメトリクスを用いるが、このアプローチは情報の断片化の過程を曖昧にすることができる。
本稿では,繰り返し学習の合奏によって学習された情報の断片として,学習チャネルを集約的に研究することを提案する。
さらに,各部分空間間の類似性の尺度が,データ埋め込みの性質を確率分布として無視する先行研究から逸脱する。
代わりに、表現部分空間を、データのソフトクラスタリングを行う通信チャネルとみなし、クラスタリング代入間の類似性に関する2つの古典的な情報理論を一般化し、表現空間を比較する。
本研究では, 指紋表現部分空間に基づく簡易な推定手法を開発し, データセットを識別し, 分析し, 有意義な構造を同定し, 合成データセットと自然データセットを訓練したVAEのアンサンブルに利用できるようにする。
この完全に教師なしのパイプラインを用いて、情報断片の空間における「ホットスポット」を識別する: ほぼ同一の表現部分空間の群は、VAEのアンサンブルに繰り返し現れる。
最後に,提案手法を利用してVAEによるアンサンブル学習を実現し,弱い学習者の集合の情報内容を高める。
関連論文リスト
- Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - What is different between these datasets? [20.706111458944502]
同じ領域の2つのデータセットは異なる分布を示す可能性がある。
本稿では,データセットの比較を行うための解釈可能な手法の汎用的ツールボックスを提案する。
これらの手法は、動作可能で解釈可能な洞察を提供することによって既存の手法を補完する。
論文 参考訳(メタデータ) (2024-03-08T19:52:39Z) - infoVerse: A Universal Framework for Dataset Characterization with
Multidimensional Meta-information [68.76707843019886]
infoVerseは、データセットの特徴付けのための普遍的なフレームワークである。
infoVerseは、様々なモデル駆動メタ情報を統合することで、データセットの多次元特性をキャプチャする。
実世界の3つのアプリケーション(データプルーニング、アクティブラーニング、データアノテーション)において、infoVerse空間で選択されたサンプルは、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2023-05-30T18:12:48Z) - FUNCK: Information Funnels and Bottlenecks for Invariant Representation
Learning [7.804994311050265]
データから不変表現を学習すると主張する一連の関連する情報漏えいとボトルネック問題について検討する。
本稿では,この情報理論の目的である「側情報付き条件付きプライバシ・ファンネル」の新たな要素を提案する。
一般に難解な目的を考慮し、ニューラルネットワークによってパラメータ化された補正変分推論を用いて、抽出可能な近似を導出する。
論文 参考訳(メタデータ) (2022-11-02T19:37:55Z) - Variational Distillation for Multi-View Learning [104.17551354374821]
我々は,多視点表現学習における2つの重要な特徴を利用するために,様々な情報ボトルネックを設計する。
厳密な理論的保証の下で,本手法は,観察とセマンティックラベルの内在的相関の把握を可能にする。
論文 参考訳(メタデータ) (2022-06-20T03:09:46Z) - Discriminative Supervised Subspace Learning for Cross-modal Retrieval [16.035973055257642]
クロスモーダル検索のための識別型教師付き部分空間学習法(DS2L)を提案する。
具体的には、まず、各モダリティ内の意味構造を保存するために、共有セマンティックグラフを構築する。
次に,Hilbert-Schmidt Independence Criterion (HSIC)を導入し,特徴相似性とサンプルの意味相似性との相似性を維持する。
論文 参考訳(メタデータ) (2022-01-26T14:27:39Z) - Learning Conditional Invariance through Cycle Consistency [60.85059977904014]
本稿では,データセットの変動の有意義な要因と独立な要因を識別する新しい手法を提案する。
提案手法は,対象プロパティと残りの入力情報に対する2つの別個の潜在部分空間を含む。
我々は,より意味のある因子を同定し,よりスペーサーや解釈可能なモデルに導く合成および分子データについて実証する。
論文 参考訳(メタデータ) (2021-11-25T17:33:12Z) - Learning Bias-Invariant Representation by Cross-Sample Mutual
Information Minimization [77.8735802150511]
対象タスクが誤用したバイアス情報を除去するために,クロスサンプル対逆脱バイアス法(CSAD)を提案する。
相関測定は, 対向的偏り評価において重要な役割を担い, クロスサンプル型相互情報推定器によって行われる。
我々は,提案手法の最先端手法に対する利点を検証するために,公開データセットの徹底的な実験を行った。
論文 参考訳(メタデータ) (2021-08-11T21:17:02Z) - Integrating Auxiliary Information in Self-supervised Learning [94.11964997622435]
まず、補助情報がデータ構造に関する有用な情報をもたらす可能性があることを観察する。
補助情報に基づいてデータクラスタを構築する。
我々はCl-InfoNCEがデータクラスタリング情報を活用するためのより良いアプローチであることを示した。
論文 参考訳(メタデータ) (2021-06-05T11:01:15Z) - Contrastive analysis for scatter plot-based representations of
dimensionality reduction [0.0]
本稿では,マルチ次元データセットを探索し,クラスタの形成を解釈する手法を提案する。
また,属性がクラスタ形成にどのように影響するかを理解するために使用される統計変数間の関係を視覚的に解釈し,探索する二部グラフも導入する。
論文 参考訳(メタデータ) (2021-01-26T01:16:31Z) - Learning Discrete Structured Representations by Adversarially Maximizing
Mutual Information [39.87273353895564]
本研究では、構造化潜在変数と対象変数の相互情報を最大化することにより、ラベルのないデータから離散的構造化表現を学習する。
我々の重要な技術的貢献は、クロスエントロピー計算の実現可能性のみを前提として、相互情報を的確に見積もることができる敵の目的である。
文書ハッシュに本モデルを適用し,離散およびベクトル量子化変分オートエンコーダに基づいて,現在の最良ベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2020-04-08T13:31:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。