論文の概要: Generate in Reconstruction Space, Match in Semantic Space: Transport Geometry for One-Step Generation
- arxiv url: http://arxiv.org/abs/2606.00514v1
- Date: Sat, 30 May 2026 04:03:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.502928
- Title: Generate in Reconstruction Space, Match in Semantic Space: Transport Geometry for One-Step Generation
- Title(参考訳): 復元空間における生成, セマンティック空間における整合性: ワンステップ生成のための輸送幾何学
- Abstract要約: 生成モデリングと自己教師付き表現学習(SSL)は、構造的に異なる目的を最適化する。
一段階生成の枠組みにおける生成モデリングにおけるSSLの利点について検討する。
意味的に構造化されたSSL機能空間で計算すると,この目的は非常に効果的であることが分かる。
- 参考スコア(独自算出の注目度): 16.138914735031744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative modeling and self-supervised representation learning (SSL) optimize structurally different objectives: generative training rewards distributional fidelity, while SSL rewards semantic coherence. Yet recent work repeatedly finds that SSL features improve generative training, though the mechanism of this synergy remains unclear. Here, we study the benefits of SSL in generative modeling in the framework of one-step generation where the role of representation is explicit: frozen SSL features are used to match generated samples to real data. We use the Sinkhorn divergence in that feature space, providing a tractable surrogate for the Wasserstein distance, the population-level discrepancy approximated by Fréchet-style evaluation metrics (such as FID). We find that this objective becomes highly effective when computed in a semantically structured SSL feature space (a 39$\times$ reduction in ImageNet FID). We trace this behavior primarily to matching estimation: semantic SSL features that suppress nuisance reconstruction details induce a more compact geometry, making distribution matching more tractable. As a consequence, the best training SSL features need not match the features used by the evaluation metric. In particular, we show that using Inception as the feature extractor can improve FID while degrading matching stability and sample quality, revealing a form of metric hacking. Using extensive experiments on ImageNet, we identify which SSL feature families lead to best generation performance and show that matching stability is a quantitative criterion for selecting them. Code is available at https://github.com/Genentech/semantic-transport-generation.
- Abstract(参考訳): 生成的モデリングと自己教師型表現学習(SSL)は構造的に異なる目的を最適化する。
しかし、最近の研究はSSL機能が生成訓練を改善することを繰り返し見出しているが、このシナジーのメカニズムは未だ不明である。
本稿では,表現の役割が明確である一段階生成の枠組みにおいて,生成モデルにおけるSSLの利点について検討する。
我々は、その特徴空間においてシンクホーンの発散を使い、フレシェ式評価指標(FIDなど)によって近似された人口レベルの差であるワッサーシュタイン距離のトラクタブル・サロゲートを提供する。
意味的に構造化されたSSL機能空間(ImageNet FIDの39$\times$ reduce)で計算すると,この目的は非常に効果的であることが分かる。
我々は、この振る舞いを主にマッチング推定に追従する: ニュアンス再構成の詳細を抑える意味的なSSL機能により、よりコンパクトな幾何学が導き出され、分布マッチングがより魅力的になる。
結果として、SSL機能の最高のトレーニングは、評価基準で使用される機能にマッチする必要はない。
特に,インセプションを特徴抽出器として用いることで,安定度とサンプル品質を低下させながらFIDを改善することができることを示す。
ImageNetで広範な実験を行い、どのSSL機能ファミリが最高の世代パフォーマンスをもたらすかを特定し、一致した安定性がそれらを選択するための定量的基準であることを示す。
コードはhttps://github.com/Genentech/semantic-transport-generation.comで公開されている。
関連論文リスト
- Self-Supervised Representation-Guided Generative Dataset Distillation [55.27114962330541]
自己監督型表現誘導型生成データセット蒸留(SRG)を提案する。
SRGはSSLの幾何学を拡散誘導に変換する。
複数のデータセットとIPC設定で評価された生成ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-04T06:51:45Z) - Probing Geospatial SSL Representations with Environmental Signals [51.908606610432194]
自己教師付き学習(SSL)は、単一のタスクに最適化された表現ではなく、汎用的で転送可能な表現を学ぶように設計されている。
SSL表現は、イメージングプロセスと共変する環境変数との統計的関連を保存しているか?
この問題に対処するために、我々は、物理的に一貫した環境変数のグローバルデータセットである共配置ERA5再解析変数を用いてSSL表現を探索する。
論文 参考訳(メタデータ) (2026-07-06T15:24:25Z) - Learning Sparse Visual Representations via Spatial-Semantic Factorization [37.169502692169196]
自己教師付き学習(SSL)は、意味理解と画像再構成の根本的な対立に直面している。
本稿では,視覚的特徴を意味概念とその空間分布の低ランクな製品に分解するフレームワークSTELLARを紹介する。
この分解された形の下で16個のスパーストークンが同時に高品質な再構成(2.60 FID)をサポートし、高密度バックボーンのセマンティック性能(79.10% ImageNet精度)に適合することを示す。
論文 参考訳(メタデータ) (2026-02-02T10:12:17Z) - Semantic Concentration for Self-Supervised Dense Representations Learning [103.10708947415092]
イメージレベルの自己教師型学習(SSL)は大きな進歩を遂げているが、パッチの密度の高い表現を学ぶことは依然として難しい。
この研究は、画像レベルのSSLが暗黙のセマンティックな集中を伴って過分散を避けることを明らかにしている。
論文 参考訳(メタデータ) (2025-09-11T13:12:10Z) - On the Discriminability of Self-Supervised Representation Learning [38.598160031349686]
自己教師付き学習(SSL)は、最近、様々な視覚的タスクで顕著な成功を収めた。
しかし、差別性という点では、SSLは依然として教師あり学習(SL)と同等ではない。
本稿では,異なるクラスの特徴が十分に分離されていない「群集問題」について論じる。
論文 参考訳(メタデータ) (2024-07-18T14:18:03Z) - Benchmark for Uncertainty & Robustness in Self-Supervised Learning [0.0]
セルフ・スーパーバイザード・ラーニングは現実世界のアプリケーション、特に医療や自動運転車のようなデータ・ハングリーな分野に不可欠である。
本稿では Jigsaw Puzzles, Context, Rotation, Geometric Transformations Prediction for vision や BERT や GPT for Language Task など,SSL メソッドの変種について検討する。
我々のゴールは、実験から出力されたベンチマークを作成し、信頼性のある機械学習で新しいSSLメソッドの出発点を提供することです。
論文 参考訳(メタデータ) (2022-12-23T15:46:23Z) - Improving Self-Supervised Learning by Characterizing Idealized
Representations [155.1457170539049]
与えられたデータ拡張に不変なタスクに対して必要かつ十分な条件を証明します。
対照的に、我々のフレームワークは、従来の手法に対して単純だが重要な改善を規定している。
非コントラスト学習では、私たちのフレームワークを使って、シンプルで斬新な目的を導き出します。
論文 参考訳(メタデータ) (2022-09-13T18:01:03Z) - GSMFlow: Generation Shifts Mitigating Flow for Generalized Zero-Shot
Learning [55.79997930181418]
Generalized Zero-Shot Learningは、目に見えないクラスから見えないクラスに意味的な知識を移すことで、目に見えないクラスと見えないクラスの両方から画像を認識することを目的としている。
生成モデルの利点を生かして、見学したクラスから学んだ知識に基づいて、現実的な見知らぬサンプルを幻覚させることは、有望な解決策である。
本研究では,複数の条件付きアフィン結合層からなるフローベース生成フレームワークを提案する。
論文 参考訳(メタデータ) (2022-07-05T04:04:37Z) - InsCLR: Improving Instance Retrieval with Self-Supervision [30.36455490844235]
最近開発されたSimCLRやMoCoのような自己教師付き(SSL)学習手法を用いた微調整では,インスタンス検索の性能が向上しないことがわかった。
この問題を克服するために,テキストインスタンスレベルのコントラストに基づいたSSLメソッドであるInsCLRを提案する。
InsCLRは、インスタンス検索における最先端のSSLメソッドと同じような、あるいはそれ以上のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2021-12-02T16:21:27Z) - Self-Supervised Learning of Graph Neural Networks: A Unified Review [50.71341657322391]
ラベルなしサンプルを多用する新たなパラダイムとして,自己教師型学習が登場している。
SSLを用いたグラフニューラルネットワーク(GNNs)のトレーニング方法の統一レビューを提供します。
gnnに対するssl手法の処理は,様々な手法の類似性と相違に光を当て,新しい手法やアルゴリズムの開発段階を定めている。
論文 参考訳(メタデータ) (2021-02-22T03:43:45Z) - Interventional Few-Shot Learning [88.31112565383457]
本稿では,新しいFew-Shot Learningパラダイム,Interventional Few-Shot Learningを提案する。
コードはhttps://github.com/yue-zhongqi/ifsl.comで公開されている。
論文 参考訳(メタデータ) (2020-09-28T01:16:54Z) - Information Bottleneck Constrained Latent Bidirectional Embedding for
Zero-Shot Learning [59.58381904522967]
本稿では,密な視覚-意味的結合制約を持つ埋め込み型生成モデルを提案する。
視覚空間と意味空間の両方の埋め込みパラメトリック分布を校正する統合潜在空間を学習する。
本手法は, 画像のラベルを生成することにより, トランスダクティブZSL設定に容易に拡張できる。
論文 参考訳(メタデータ) (2020-09-16T03:54:12Z) - Semi-supervised learning objectives as log-likelihoods in a generative
model of data curation [32.45282187405337]
データキュレーションの生成モデルにおいて、SSLの目的をログライクな形式として定式化する。
おもちゃのデータにベイジアンSSLの証明を与える。
論文 参考訳(メタデータ) (2020-08-13T13:50:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。