論文の概要: HoloByte: Continuous Hyperspherical Distillation for Tokenizer-Free Modeling
- arxiv url: http://arxiv.org/abs/2603.16917v1
- Date: Tue, 10 Mar 2026 20:35:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-19 18:32:57.25288
- Title: HoloByte: Continuous Hyperspherical Distillation for Tokenizer-Free Modeling
- Title(参考訳): HoloByte: トケナイザーフリーモデリングのための超球面連続蒸留
- Abstract要約: TextbfHoloByte: 連続超球形蒸留を利用した厳密なトークンフリーフレームワークを紹介する。
ホロバイトは離散バイト列を固定容量チャンクに分割し、連続で厳密な有界超球面多様体に射影する。
これらの結果から, 連続超球形蒸留は語彙内配列モデリングの数学的に厳密で, 計算学的に抽出可能な基礎として確立された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sequence modeling universally relies on discrete subword tokenization to circumvent the $\mathcal{O}(N^2)$ computational intractability of native byte-level attention. However, this heuristic quantization imposes artificial morphological boundaries, enforces vocabulary dependence, and fractures the continuity of the optimization landscape. To resolve this dichotomy, we introduce \textbf{HoloByte}: a strictly tokenizer-free framework utilizing Continuous Hyperspherical Distillation. HoloByte partitions discrete byte sequences into fixed-capacity chunks and projects them into a continuous, strictly bounded hyperspherical manifold via an invertible, dimension-preserving orthogonal rotation operator. This spatial superposition allows a macroscopic transformer to operate exclusively on compressed continuous representations, formally reducing the exact attention time complexity from $\mathcal{O}(N^2D)$ to $\mathcal{O}\left( \frac{N^2}{W^2}D + ND^2 \right)$. A localized causal micro-decoder subsequently unbinds these representations to compute exact byte-level distributions. To govern this continuous trajectory, we propose a dual-objective formulation incorporating a mathematically precise Holographic Latent Mean Squared Error, which strictly bounds the gradient and guarantees asymptotic stability. Theoretically, we derive the minimal embedding dimension $D = Ω(W \ln |\mathcal{V}|)$ required to ensure error-free discrete recovery from the continuous manifold. Empirically, under strictly matched parameter constraints, HoloByte is systematically outperforming a comparable discrete Byte-Pair Encoding (BPE) baseline. These results establish Continuous Hyperspherical Distillation as a mathematically rigorous and computationally tractable foundation for vocabulary-invariant sequence modeling. The code is available at https://github.com/VladimerKhasia/HoloByte
- Abstract(参考訳): シークエンスモデリングは、ネイティブバイトレベルの注意の$\mathcal{O}(N^2)$計算の難しさを回避するために、離散的なサブワードトークン化に依存している。
しかし、このヒューリスティック量子化は、人工的な形態境界を課し、語彙依存を強制し、最適化景観の連続性を破る。
この二分法を解決するために、連続超球形蒸留を利用した厳密なトークン化のないフレームワークである「textbf{HoloByte}」を紹介した。
ホロバイトは離散バイト列を固定容量チャンクに分割し、それを可逆、次元保存直交回転作用素を通じて連続で厳密な有界超球面多様体に射影する。
この空間的重ね合わせにより、マクロ変換器は圧縮された連続表現のみに作用し、正確に注意時間複雑性を$\mathcal{O}(N^2D)$から$\mathcal{O}\left( \frac{N^2}{W^2}D + ND^2 \right)$に縮める。
その後、局所化された因果マイクロデコーダがこれらの表現をアンバインドして、正確なバイトレベルの分布を計算する。
この連続軌道を決定するために、数学的に精密なホログラフィック潜在平均正方形誤差を組み込んだ二重目的形定式化を提案し、勾配を厳密に拘束し、漸近安定性を保証する。
理論的には、連続多様体から誤差のない離散的回復を保証するために必要となる最小埋め込み次元 $D = Ω(W \ln |\mathcal{V}|)$ を導出する。
経験的に、厳密なパラメータ制約の下では、HoloByteは、同等の離散Byte-Pair Encoding (BPE)ベースラインを体系的に上回っている。
これらの結果は、連続超球形蒸留を語彙不変配列モデリングのための数学的に厳密で計算的に抽出可能な基礎として確立する。
コードはhttps://github.com/VladimerKhasia/HoloByteで入手できる。
関連論文リスト
- Constrained Online Learning with Noisy Constraint Values [55.29259818039367]
一般的な実現可能性の下では、我々のLEDGERアルゴリズムは、期待される損失$O(sqrt T)と期待される予算違反$O(sqrtTlog(eT))を達成します。
スレーター条件、フィードバックチャネル間の独立性、絶対的制約値境界は不要である。
論文 参考訳(メタデータ) (2026-09-07T01:38:41Z) - Discretization and Statistical Consistency of Functional Flow Matching [0.0]
有限ランク再構成の強い一貫した列に対して、有限条件速度目標の強い$L2$収束を証明した。
学習フローに対して、集団重ね合わせ経路に直接結合すると、終端ワッサーシュタイン境界が得られる。
論文 参考訳(メタデータ) (2026-08-05T07:05:47Z) - Near-Optimal Mode Scaling for Finite-Dimensional Boson Sampling via Lie-Algebraic Leakage Bounds [0.8594140167290097]
物質ベースのプラットフォーム上のボソンサンプリングは、有限次元局所ヒルベルト空間におけるボゾンモードの符号化を必要とする。
コンパクトリー群の既約表現に対する非相互作用サンプリングのための統一的なフレームワークを開発する。
我々は遷移行列のガウスモデルにおいて、そのスペクトルノルムが以前のスピンベースエミュレーションの$O(n)$最悪の場合よりも$tildeO(stn)$に集中していることを証明する。
論文 参考訳(メタデータ) (2026-07-13T15:36:29Z) - What Does a Discrete Diffusion Model Learn? [71.03603607324338]
離散拡散モデルは、デノイザ、スコア比、ブリッジプラグイン予測器などを学ぶ。
まず, 連続時間マルコフ連鎖 (CTMC) ELBO の任意のノイズ発生過程に対する厳密な導出から始める。
すべてのアイデンティティは、正確に解けるモデル上で近似なしで数値的に検証される。
論文 参考訳(メタデータ) (2026-07-06T17:56:11Z) - Is Spurious Correlation Removal Always Learnable? [56.28155520961125]
不変学習は、構造が統計的に識別可能であっても失敗することがある。
ブラックボックスサンプリング可能な教師付きスパースリカバリプリミティブの下では、実証可能な多次元環境が存在する。
合成および実際のデータセットは、予測されたギャップと遷移を示し、単純な多様性診断を動機付ける。
論文 参考訳(メタデータ) (2026-06-11T05:49:43Z) - Towards Scalable Persistence-Based Topological Optimization [44.16669776030478]
永続性に基づく位相最適化は、点クラウド $X の部分集合 mathbbRd$ を $L(X) = ell(mathrmDgm(X))$ という形の目的を最小化することによって変形する。
実際、最適化は2つの結合した問題によって制限される: 永続ホモロジーは典型的にはサブサンプル上で計算され、結果として生じる位相勾配は非常にスパースであり、非ゼロ更新を受けるアンカーポイントはわずかである。
論文 参考訳(メタデータ) (2026-05-09T15:47:20Z) - BASIS: Balanced Activation Sketching with Invariant Scalars for "Ghost Backpropagation" [0.0]
正確なバックプロパゲーションに必要な活性化メモリは、ネットワーク深さ、コンテキスト長、特徴次元と線形にスケールする。
本稿では,活性化メモリをバッチ次元とシーケンス次元から完全に分離する効率的なバックプロパゲーションアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-05T20:38:25Z) - A Lindblad-Pauli Framework for Coarse-Grained Chaotic Binary-State Dynamics [0.0]
我々は、駆動ダッフィング発振器の粗粒度左/右の統計情報を2時間2$密度行列表現に埋め込む2状態フレームワークを開発した。
対角状態の場合、GKSL力学は古典的な二状態方程式に還元される。
我々は閉形式解、明示的なクラウス表現、時間的一階マルコフ仮定の実用的な診断を導出する。
論文 参考訳(メタデータ) (2025-12-19T03:27:05Z) - Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling [87.34677262370924]
標準離散拡散モデルは、吸収[MASK]トークンにそれらをマッピングすることで、すべての観測されていない状態を同一に扱う。
これは'インフォメーション・ヴォイド'を生成します。そこでは、偽のトークンから推測できるセマンティック情報は、デノイングステップの間に失われます。
連続的拡張離散拡散(Continuously Augmented Discrete Diffusion)は、連続的な潜在空間における対拡散で離散状態空間を拡大するフレームワークである。
論文 参考訳(メタデータ) (2025-10-01T18:00:56Z) - Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs [56.237917407785545]
本稿では,円滑なベルマン作用素を持つ連続空間マルコフ決定過程(MDP)の一般クラスにおいて,$varepsilon$-optimal Policyを学習する問題を考察する。
我々のソリューションの鍵となるのは、調和解析のアイデアに基づく新しい射影技術である。
我々の結果は、連続空間 MDP における2つの人気と矛盾する視点のギャップを埋めるものである。
論文 参考訳(メタデータ) (2024-05-10T09:58:47Z) - Learning with Norm Constrained, Over-parameterized, Two-layer Neural Networks [54.177130905659155]
近年の研究では、再生カーネルヒルベルト空間(RKHS)がニューラルネットワークによる関数のモデル化に適した空間ではないことが示されている。
本稿では,有界ノルムを持つオーバーパラメータ化された2層ニューラルネットワークに適した関数空間について検討する。
論文 参考訳(メタデータ) (2024-04-29T15:04:07Z) - Quantum state tomography via non-convex Riemannian gradient descent [13.100184125419691]
本研究では,kappa$のスケール依存性を改善する量子状態トモグラフィースキームを導出する。
この改良は、非多様体勾配(RGD)アルゴリズムの適用によるものである。
超高速収束とほぼ最適誤差境界の理論的結果は数値的な結果と相関する。
論文 参考訳(メタデータ) (2022-10-10T14:19:23Z) - Softmax-free Linear Transformers [90.83157268265654]
視覚変換器(ViT)は、視覚知覚タスクの最先端を推し進めている。
既存の手法は理論的に欠陥があるか、視覚認識に経験的に効果がないかのいずれかである。
我々はSoftmax-Free Transformers (SOFT) のファミリーを提案する。
論文 参考訳(メタデータ) (2022-07-05T03:08:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。