論文の概要: dRAE: Representation Autoencoder with Hyper-Spherical Codes
- arxiv url: http://arxiv.org/abs/2607.22148v1
- Date: Fri, 24 Jul 2026 09:47:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.096234
- Title: dRAE: Representation Autoencoder with Hyper-Spherical Codes
- Title(参考訳): dRAE:超球面符号を用いた表現オートエンコーダ
- Authors: Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye,
- Abstract要約: 本研究の目的は,高次元視覚表現を識別し,言語モデルとのギャップを埋めることである。
既存の量子化手法はコードブックの崩壊に悩まされ、セマンティックコヒーレンスを維持しながらスケールに失敗する。
角ルーティングによる特徴量から意味内容を分離する超球面量子化(HSQ)を提案する。
- 参考スコア(独自算出の注目度): 46.51476423608179
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this work, we aim to discretize the high-dimensional visual representations to bridge the gap with language models - a non-trivial challenge, as existing quantization methods suffer from codebook collapse, failing to scale while preserving semantic coherence. We identify the root cause as metric mismatch: standard Euclidean codebook objectives are fundamentally misaligned with the anisotropic geometry of representation space, leading to codebook embeddings with high-variance magnitude scales and uneven angular distributions that hinder scalability. To address this, we propose Hyper-Spherical Quantization (HSQ), which decouples semantic content from feature magnitude via angular routing, preventing code assignment from being dominated by scale rather than meaning. The resulting discrete Representation Autoencoder (dRAE) achieves high-fidelity reconstruction while preserving semantic integrity and supporting scalable codebook budget. Extensive experiments demonstrate consistent performance gains as the vocabulary size scales to 131{,}072, along with 100\% codebook utilization, simplified training pipeline, and strong performance across understanding and generation tasks.
- Abstract(参考訳): 本研究では,既存の量子化手法がコードブックの崩壊に悩まされ,セマンティックコヒーレンスを保ちながらスケールしないため,言語モデルとのギャップを埋めるため,高次元の視覚表現を識別することを目的とする。
標準ユークリッド符号ブックの目的は、表現空間の異方的幾何学と根本的には一致せず、高分散スケールのコードブック埋め込みや、拡張性を阻害する角分布の均一な分布をもたらす。
この問題に対処するため,超球面量子化 (HSQ) を提案する。
結果として生成された離散表現オートエンコーダ(dRAE)は、セマンティックな整合性を保持し、スケーラブルなコードブック予算をサポートするとともに、高忠実な再構築を実現する。
大規模な実験では、語彙サイズが131{,}072にスケールすると同時に、100\%のコードブックの利用、簡易なトレーニングパイプライン、理解と生成タスク間の強いパフォーマンスなど、一貫したパフォーマンス向上が示されている。
関連論文リスト
- HiTokSR: A Coarse-to-Fine Tokenizer with Hierarchical Codebooks for High-Fidelity Real-World Image Super-Resolution [2.4519602914420475]
階層的なトークン予測フレームワークであるHiTokSRを提案する。
この結果から,HiTokSRは品質と再現性の両方において最先端の性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2026-05-31T11:02:58Z) - Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting [21.127727991498244]
Zero-shot Object counting (ZSOC) は、視覚的な見本を必要とせず、テキスト記述によって指定された任意のカテゴリのオブジェクトを列挙することを目的としている。
既存の手法では、微粒な量認識の欠如に悩まされ、粗い検索タスクとして数えられることが多い。
我々は,ロバストな空間的アンダーラインキャストアンダーラインアグリゲーションとアンダーラインインプリンダーラインを相乗化する新しいフレームワークであるtextbfQICAを提案する。
論文 参考訳(メタデータ) (2026-03-17T05:32:09Z) - SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation [64.29376407025768]
Neighbor Cross Entropy Minimization (SNCE)は、大容量の離散画像生成装置の最適化課題に対処するために設計された、新しいトレーニング目標である。
我々は,クラス条件のImageNet-256生成,大規模テキスト・画像合成,画像編集タスクについて実験を行った。
その結果,SNCEは標準のクロスエントロピー目標と比較してコンバージェンス速度と全体の生成品質を著しく向上することがわかった。
論文 参考訳(メタデータ) (2026-03-16T11:44:11Z) - VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction [83.50898344094153]
VQRAEは、イメージ理解のための連続的セマンティック機能と、統一トークン化器内での視覚生成のためのトークンを生成する。
デザインは、多モーダル理解、離散トークンの能力を維持するために、無視可能な意味情報を可能にする。
VQRAEは、視覚的理解、生成、再構築のベンチマークで競合性能を示す。
論文 参考訳(メタデータ) (2025-11-28T17:26:34Z) - Exploiting Discriminative Codebook Prior for Autoregressive Image Generation [54.14166700058777]
トークンベースの自己回帰画像生成システムは、まずトークンインデックスのシーケンスをコードブックでトークン化し、次にこれらのシーケンスを自己回帰パラダイムでモデル化する。
自己回帰生成モデルはインデックス値のみに基づいて訓練されるが、豊富なトークン類似性情報を含むコードブックにエンコードされた前者は利用されない。
近年の研究では、トークン上に単純なk平均クラスタリングを行い、コードブックを減らした生成モデルのトレーニングを容易にすることで、これを先に組み込もうとしている。
k-meansの代替として、差別的コードブック先駆者(DCPE)を提案する。
論文 参考訳(メタデータ) (2025-08-14T15:00:00Z) - UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation [5.286124283204446]
大規模でセマンティックに整合し、安定した視覚的トークン化を可能にするケースケードコードブックフレームワークであるUniCode$2$を提案する。
数百万のSigLIPシーケンスの埋め込みをクラスタ化することにより、500Kエントリのコードブックを構築します。
UniCode2は、さまざまなベンチマークで強力なパフォーマンスを提供し、安定性、セマンティクス、モジュール性を犠牲にすることなく、ビジュアルトークン空間をスケールできることを実証している。
論文 参考訳(メタデータ) (2025-06-25T07:57:09Z) - SGC-VQGAN: Towards Complex Scene Representation via Semantic Guided Clustering Codebook [9.993066868670283]
本稿では,SGC-VQGANをセマンティックオンラインクラスタリング法で導入し,一貫性セマンティックラーニングによるトークンセマンティクスを強化する。
提案手法は時間空間的に一貫したセマンティック・コードブックを構築し,コードブックの崩壊問題と不均衡なトークン・セマンティクスに対処する。
論文 参考訳(メタデータ) (2024-09-09T23:12:43Z) - Disentanglement via Latent Quantization [60.37109712033694]
本研究では,組織化された潜在空間からの符号化と復号化に向けた帰納的バイアスを構築する。
本稿では,基本データレコーダ (vanilla autoencoder) と潜時再構成 (InfoGAN) 生成モデルの両方に追加することで,このアプローチの広範な適用性を実証する。
論文 参考訳(メタデータ) (2023-05-28T06:30:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。