論文の概要: Sphere Encoder 2
- arxiv url: http://arxiv.org/abs/2610.02208v1
- Date: Thu, 01 Oct 2026 17:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.376568
- Title: Sphere Encoder 2
- Title(参考訳): 球エンコーダ2
- Abstract要約: Sphereは、高次元の潜在球からランダム点を復号して画像を生成するオートエンコーダである。
両制約に対処し,オートエンコーダの高速化と簡易性を維持しつつ,画像生成品質を大幅に向上させる。
- 参考スコア(独自算出の注目度): 45.87142901878699
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sphere Encoder is an autoencoder that generates images by decoding random points from a high-dimensional latent sphere. We identify two limitations of the original formulation that reduce its generation quality. First, random points concentrate near the equator relative to the pole on an encoded latent, but the training rotation never reaches this region, leaving a gap that limits one-step generation. Second, training for generation with pixel-wise reconstruction loss encourages the decoder to average over plausible images, producing blurry images that lack high-frequency details. We present Sphere Encoder 2 to address both limitations, substantially improving image generation quality while maintaining the speed and simplicity of a autoencoder. Models are released at \href{https://github.com/kaiyuyue/sphere2}{github.com/kaiyuyue/sphere2}.
- Abstract(参考訳): 球エンコーダ(Sphere Encoder)は、高次元の潜在球からランダム点を復号して画像を生成するオートエンコーダである。
生成品質を低下させるオリジナル定式化の2つの限界を同定する。
第一に、ランダムな点は、符号化された潜水線の極に対する赤道付近に集中するが、トレーニングの回転はこの領域に到達せず、1段階の生成を制限するギャップを残している。
第二に、画素単位の再構成損失による生成のためのトレーニングは、デコーダが可視画像よりも平均的に処理し、高周波の詳細を欠いたぼやけた画像を生成する。
両制限に対処し,オートエンコーダの高速化と簡易性を維持しつつ,画像生成品質を大幅に向上させる。
モデルは \href{https://github.com/kaiyuyue/sphere2}{github.com/kaiyuyue/sphere2} でリリースされる。
関連論文リスト
- FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders [43.315583868805355]
機能選択をエンコーダ層のランダムなサブセット上でのトレーニングに置き換えるFuseRegを導入する。
DINOv3-LのImageNet-256では、1つのFuseRegデコーダがリトレーニングなしでフル、スパース、シングルレイヤのフュージョンから再構成される。
両方のステージにFuseRegを適用することで、非ガイダンスgFIDもDiT-Baseで29%削減される。
論文 参考訳(メタデータ) (2026-09-25T17:59:59Z) - Efficient Image Synthesis with Sphere Latent Encoder [9.381297061959112]
整合性や平均フローに基づく手法によってサンプリングステップの数を著しく削減するなど,画像生成は急速に進展している。
Sphereは,数ステップで高品質なイメージを生成する,最近の代替手段だ。
我々は、このフレームワークを固定された事前訓練された画像エンコーダと、完全に球形潜在空間で訓練された独立した潜在聴覚モデルに分離する。
In Animal-Faces, Oxford-Flowers and ImageNet-1K datasets, our method are significantlyforms Sphere in generation quality and inference speed。
論文 参考訳(メタデータ) (2026-05-15T04:03:06Z) - Image Generation with a Sphere Encoder [52.086777706390706]
Sphereは、単一のフォワードパスで画像を生成することができる効率的な生成フレームワークである。
我々のアプローチは、球面潜在空間に一様にマッピングするエンコーダと、ランダム潜在ベクトルを画像空間にマッピングするデコーダを学習することで機能する。
論文 参考訳(メタデータ) (2026-02-16T18:59:57Z) - DiffCom: Decoupled Sparse Priors Guided Diffusion Compression for Point Clouds [54.96190721255167]
ロスシー圧縮は、ポイントクラウドをストレージの潜在ポイントに変換するためのオートエンコーダに依存している。
本稿では,特に低レベルにおいて高い復元品質を実現するための拡散型フレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-21T05:41:35Z) - Towards Accurate Image Coding: Improved Autoregressive Image Generation
with Dynamic Vector Quantization [73.52943587514386]
既存のベクトル量子化(VQ)ベースの自己回帰モデルは、2段階生成パラダイムに従う。
画像領域を可変長符号に符号化する動的量子化VAE(DQ-VAE)を提案する。
論文 参考訳(メタデータ) (2023-05-19T14:56:05Z) - 3D-Aware Encoding for Style-based Neural Radiance Fields [50.118687869198716]
我々は、入力画像をNeRFジェネレータの潜時空間に投影する反転関数を学び、潜時符号に基づいて原画像の新しいビューを合成する。
2次元生成モデルのGANインバージョンと比較して、NeRFインバージョンは、1)入力画像の同一性を維持するだけでなく、2)生成した新規なビューにおいて3D一貫性を確保する必要がある。
スタイルベースNeRFインバージョンのための2段階エンコーダを提案する。
論文 参考訳(メタデータ) (2022-11-12T06:14:12Z) - Crosslink-Net: Double-branch Encoder Segmentation Network via Fusing
Vertical and Horizontal Convolutions [58.71117402626524]
医用画像分割のための新しいダブルブランチエンコーダアーキテクチャを提案する。
1)正方形畳み込みカーネルによる特徴の識別をさらに改善する必要があるため,非正方形および水平畳み込みカーネルの利用を提案する。
実験では,4つのデータセット上でのモデルの有効性を検証した。
論文 参考訳(メタデータ) (2021-07-24T02:58:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。