Fugu-MT 論文翻訳(概要): Comparing the information content of probabilistic representation spaces

論文の概要: Comparing the information content of probabilistic representation spaces

arxiv url: http://arxiv.org/abs/2405.21042v2
Date: Mon, 21 Oct 2024 17:50:10 GMT
ステータス: 翻訳完了
システム内更新日: 2024-11-28 17:07:33.116766
Title: Comparing the information content of probabilistic representation spaces
Title（参考訳）: 確率的表現空間の情報内容の比較
Authors: Kieran A. Murphy, Sam Dillavou, Dani S. Bassett,
Abstract要約: 確率的表現空間は、データセットに関する情報を伝達し、トレーニング損失やネットワークアーキテクチャなどの要因の影響を理解するために、そのような空間の情報内容を比較する。ここでは、ポイントベースの比較尺度に基づいて構築する代わりに、ハードクラスタリングに関する文献から古典的な手法に基づいて構築する。本稿では,データセットのサンプルを用いて表現空間をフィンガープリントする手法を提案する。
参考スコア（独自算出の注目度）: 3.7277730514654555
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Probabilistic representation spaces convey information about a dataset, and to understand the effects of factors such as training loss and network architecture, we seek to compare the information content of such spaces. However, most existing methods to compare representation spaces assume representations are points, and neglect the distributional nature of probabilistic representations. Here, instead of building upon point-based measures of comparison, we build upon classic methods from literature on hard clustering. We generalize two information-theoretic methods of comparing hard clustering assignments to be applicable to general probabilistic representation spaces. We then propose a practical method of estimation that is based on fingerprinting a representation space with a sample of the dataset and is applicable when the communicated information is only a handful of bits. With unsupervised disentanglement as a motivating problem, we find information fragments that are repeatedly contained in individual latent dimensions in VAE and InfoGAN ensembles. Then, by comparing the full latent spaces of models, we find highly consistent information content across datasets, methods, and hyperparameters, even though there is often a point during training with substantial variety across repeat runs. Finally, we leverage the differentiability of the proposed method and perform model fusion by synthesizing the information content of multiple weak learners, each incapable of representing the global structure of a dataset. Across the case studies, the direct comparison of information content provides a natural basis for understanding the processing of information.
Abstract（参考訳）: 確率的表現空間は、データセットに関する情報を伝達し、トレーニング損失やネットワークアーキテクチャなどの要因の影響を理解するために、そのような空間の情報内容を比較する。しかし、表現空間を比較する既存の方法のほとんどは、表現が点であると仮定し、確率的表現の分布の性質を無視する。ここでは、ポイントベースの比較尺度に基づいて構築する代わりに、ハードクラスタリングに関する文献から古典的な手法に基づいて構築する。本稿では,ハードクラスタリングの割り当てを比較するための2つの情報理論的手法を一般化し,一般化確率表現空間に適用する。次に、データセットのサンプルを用いて表現空間をフィンガープリントし、通信された情報がほんの一握りのビットである場合に適用可能な、実用的な推定法を提案する。教師なしのゆがみをモチベーション問題とすることで,VAEやInfoGANのアンサンブルにおいて,個々の潜伏次元に繰り返し含まれる情報断片が見つかる。そして、モデルの完全な潜在空間を比較することで、繰り返し実行中にかなりの多様性を持つトレーニング中にポイントがあるにもかかわらず、データセット、メソッド、ハイパーパラメータ間で高度に一貫性のある情報コンテンツを見つけます。最後に,提案手法の微分可能性を活用し,複数の弱い学習者の情報内容を合成することでモデル融合を行う。ケーススタディ全体を通して、情報内容の直接比較は、情報の処理を理解するための自然な基盤を提供する。

関連論文リスト

Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。 DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。 10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文参考訳（メタデータ） (2024-07-20T01:34:13Z)
What is different between these datasets? [20.706111458944502]
同じ領域の2つのデータセットは異なる分布を示す可能性がある。本稿では,データセットの比較を行うための解釈可能な手法の汎用的ツールボックスを提案する。これらの手法は、動作可能で解釈可能な洞察を提供することによって既存の手法を補完する。
論文参考訳（メタデータ） (2024-03-08T19:52:39Z)
Learning Representations without Compositional Assumptions [79.12273403390311]
本稿では,特徴集合をグラフノードとして表現し,それらの関係を学習可能なエッジとして表現することで,特徴集合の依存関係を学習するデータ駆動型アプローチを提案する。また,複数のビューから情報を動的に集約するために,より小さな潜在グラフを学習する新しい階層グラフオートエンコーダLEGATOを導入する。
論文参考訳（メタデータ） (2023-05-31T10:36:10Z)
infoVerse: A Universal Framework for Dataset Characterization with Multidimensional Meta-information [68.76707843019886]
infoVerseは、データセットの特徴付けのための普遍的なフレームワークである。 infoVerseは、様々なモデル駆動メタ情報を統合することで、データセットの多次元特性をキャプチャする。実世界の3つのアプリケーション(データプルーニング、アクティブラーニング、データアノテーション)において、infoVerse空間で選択されたサンプルは、強いベースラインを一貫して上回る。
論文参考訳（メタデータ） (2023-05-30T18:12:48Z)
Inv-SENnet: Invariant Self Expression Network for clustering under biased data [17.25929452126843]
本研究では,各サブ空間におけるデータポイントのクラスタ化を学習しながら,不要な属性(バイアス)を共同で除去する新しいフレームワークを提案する。合成および実世界のデータセットに対する実験結果から,本手法の有効性が示された。
論文参考訳（メタデータ） (2022-11-13T01:19:06Z)
FUNCK: Information Funnels and Bottlenecks for Invariant Representation Learning [7.804994311050265]
データから不変表現を学習すると主張する一連の関連する情報漏えいとボトルネック問題について検討する。本稿では,この情報理論の目的である「側情報付き条件付きプライバシ・ファンネル」の新たな要素を提案する。一般に難解な目的を考慮し、ニューラルネットワークによってパラメータ化された補正変分推論を用いて、抽出可能な近似を導出する。
論文参考訳（メタデータ） (2022-11-02T19:37:55Z)
Leachable Component Clustering [10.377914682543903]
本研究では,非完全データのクラスタリングに対する新たなアプローチとして,リーチ可能なコンポーネントクラスタリングを提案する。提案手法はベイズアライメントを用いてデータ計算を処理し,理論上失われたパターンを収集する。いくつかの人工不完全データセットの実験により、提案手法は、他の最先端アルゴリズムと比較して優れた性能を示すことができることを示した。
論文参考訳（メタデータ） (2022-08-28T13:13:17Z)
Variational Distillation for Multi-View Learning [104.17551354374821]
我々は,多視点表現学習における2つの重要な特徴を利用するために,様々な情報ボトルネックを設計する。厳密な理論的保証の下で,本手法は,観察とセマンティックラベルの内在的相関の把握を可能にする。
論文参考訳（メタデータ） (2022-06-20T03:09:46Z)
Leveraging Ensembles and Self-Supervised Learning for Fully-Unsupervised Person Re-Identification and Text Authorship Attribution [77.85461690214551]
完全ラベル付きデータからの学習は、Person Re-IdentificationやText Authorship Attributionなどのマルチメディアフォレスト問題において困難である。近年の自己教師型学習法は,基礎となるクラスに意味的差異が有る場合に,完全ラベル付きデータを扱う際に有効であることが示されている。本研究では,異なるクラスからのサンプルが顕著に多様性を持っていない場合でも,ラベルのないデータから学習できるようにすることにより,個人再認識とテキストオーサシップの属性に対処する戦略を提案する。
論文参考訳（メタデータ） (2022-02-07T13:08:11Z)
Discriminative Supervised Subspace Learning for Cross-modal Retrieval [16.035973055257642]
クロスモーダル検索のための識別型教師付き部分空間学習法(DS2L)を提案する。具体的には、まず、各モダリティ内の意味構造を保存するために、共有セマンティックグラフを構築する。次に,Hilbert-Schmidt Independence Criterion (HSIC)を導入し,特徴相似性とサンプルの意味相似性との相似性を維持する。
論文参考訳（メタデータ） (2022-01-26T14:27:39Z)
Learning Conditional Invariance through Cycle Consistency [60.85059977904014]
本稿では,データセットの変動の有意義な要因と独立な要因を識別する新しい手法を提案する。提案手法は,対象プロパティと残りの入力情報に対する2つの別個の潜在部分空間を含む。我々は,より意味のある因子を同定し,よりスペーサーや解釈可能なモデルに導く合成および分子データについて実証する。
論文参考訳（メタデータ） (2021-11-25T17:33:12Z)
Learning Debiased and Disentangled Representations for Semantic Segmentation [52.35766945827972]
セマンティックセグメンテーションのためのモデルに依存しない訓練手法を提案する。各トレーニングイテレーションで特定のクラス情報をランダムに除去することにより、クラス間の機能依存を効果的に削減する。提案手法で訓練したモデルは,複数のセマンティックセグメンテーションベンチマークにおいて強い結果を示す。
論文参考訳（メタデータ） (2021-10-31T16:15:09Z)
Learning Bias-Invariant Representation by Cross-Sample Mutual Information Minimization [77.8735802150511]
対象タスクが誤用したバイアス情報を除去するために,クロスサンプル対逆脱バイアス法(CSAD)を提案する。相関測定は, 対向的偏り評価において重要な役割を担い, クロスサンプル型相互情報推定器によって行われる。我々は,提案手法の最先端手法に対する利点を検証するために,公開データセットの徹底的な実験を行った。
論文参考訳（メタデータ） (2021-08-11T21:17:02Z)
Integrating Auxiliary Information in Self-supervised Learning [94.11964997622435]
まず、補助情報がデータ構造に関する有用な情報をもたらす可能性があることを観察する。補助情報に基づいてデータクラスタを構築する。我々はCl-InfoNCEがデータクラスタリング情報を活用するためのより良いアプローチであることを示した。
論文参考訳（メタデータ） (2021-06-05T11:01:15Z)
Contrastive analysis for scatter plot-based representations of dimensionality reduction [0.0]
本稿では,マルチ次元データセットを探索し,クラスタの形成を解釈する手法を提案する。また,属性がクラスタ形成にどのように影響するかを理解するために使用される統計変数間の関係を視覚的に解釈し,探索する二部グラフも導入する。
論文参考訳（メタデータ） (2021-01-26T01:16:31Z)
Relation-Guided Representation Learning [53.60351496449232]
本稿では,サンプル関係を明示的にモデル化し,活用する表現学習手法を提案する。私たちのフレームワークは、サンプル間の関係をよく保存します。サンプルをサブスペースに埋め込むことにより,本手法が大規模なサンプル外問題に対処可能であることを示す。
論文参考訳（メタデータ） (2020-07-11T10:57:45Z)
Learning Discrete Structured Representations by Adversarially Maximizing Mutual Information [39.87273353895564]
本研究では、構造化潜在変数と対象変数の相互情報を最大化することにより、ラベルのないデータから離散的構造化表現を学習する。我々の重要な技術的貢献は、クロスエントロピー計算の実現可能性のみを前提として、相互情報を的確に見積もることができる敵の目的である。文書ハッシュに本モデルを適用し,離散およびベクトル量子化変分オートエンコーダに基づいて,現在の最良ベースラインよりも優れていることを示す。
論文参考訳（メタデータ） (2020-04-08T13:31:53Z)
Learning Unbiased Representations via Mutual Information Backpropagation [36.383338079229695]
特に、モデルによって学習された場合、データのいくつかの属性(バイアス)が一般化特性を著しく損なう可能性がある場合に直面します。本稿では,学習した表現とデータ属性の相互情報を同時に推定し,最小化する,新しいエンドツーエンド最適化手法を提案する。
論文参考訳（メタデータ） (2020-03-13T18:06:31Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。