論文の概要: Token Geometry
- arxiv url: http://arxiv.org/abs/2607.01455v2
- Date: Tue, 07 Jul 2026 07:29:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:42.958482
- Title: Token Geometry
- Title(参考訳): トークン幾何学
- Abstract要約: 言語モデルは、テーブルとLMheadがそれらの間の読み取り/書き込みインターフェースとして機能し、離散シンボルよりも連続的なプログラムを学習する。
我々は、AdamのO(2VD) VRAMの代わりに、OV + D) VRAMを強く埋め込む代わりに、RLとLMを埋め込む軽量なEmberを紹介する。
その結果, 軌道は1次元パラメータ数で勾配となり, 人気パラメータに対抗できることが判明した。
- 参考スコア(独自算出の注目度): 2.538209532048867
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models learn continuous programs over discrete symbols, with the embedding table and LM-head acting as the read/write interface between them. We show that this interface has gradient geometry distinct from dense hidden weights which can be exploited to improve the Pareto frontier across supervised finetuning, RL, and pretraining, while only utilizing kilobytes of optimizer state. We introduce Ember, a lightweight optimizer for embedding and LM-head matrices that utilizes O(V + D) VRAM, instead of Adam's O(2VD), and forgoes the need to shard both token table optimizer states. We provide empirical evidence that Ember scales effectively across batch size and parameter count. We show that the optimization trajectory of tokens can be well described by a simple 1D ray, counter to the popular belief that neural net parameters navigate a heavily nonconvex landscape. We provide a principled view on the surprisingly narrow space of optimizers that suffice for Transformer training. Finally, we open-source our distributed Ember implementation that merges cleanly with existing ZeRO/FSDP setups to support further research at https://github.com/katop1234/ember
- Abstract(参考訳): 言語モデルは、個別のシンボルの上に連続的なプログラムを学習し、埋め込みテーブルとLMヘッドがそれらの間の読み取り/書き込みインターフェースとして機能する。
このインタフェースは, 教師付きファインタニング, RL, プレトレーニングによるパレートフロンティアの改善に利用でき, かつ, キロバイトのオプティマイザ状態のみを活用することができる。
我々は、AdamのO(2VD)の代わりにO(V + D) VRAMを利用する埋め込みおよびLMヘッド行列を軽量に最適化するEmberを紹介し、両方のトークンテーブルオプティマイザステートをシャードする必要性を回避した。
Emberがバッチサイズとパラメータ数で効果的にスケールするという実証的な証拠を提供する。
トークンの最適化軌道は、ニューラルネットワークパラメータが非常に非凸な風景をナビゲートするという一般的な信念に反する、単純な1D線によってうまく記述できることを示す。
トランスフォーマーのトレーニングに十分な、驚くほど狭いオプティマイザの空間に関する原則的な見解を提供する。
最後に、既存のZeRO/FSDPセットアップときれいにマージして、https://github.com/katop1234/emberでさらなる研究をサポートする分散Ember実装をオープンソース化しました。
関連論文リスト
- Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference [45.663066206650115]
分割推論はしばしば非現実的であり、機密テキストの推論をサードパーティプロバイダにプッシュする。
我々は、軽量な正規化変更を通じて、正確に$mathrmO(d)$-equivariantであるトランスフォーマー変種であるConjFormerを紹介した。
論文 参考訳(メタデータ) (2026-06-15T09:31:24Z) - Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models [80.50996301430108]
スパースチューニングは、下流タスクに最も関係のある重みだけを調整することで、顕著なパフォーマンスを達成する。
上述の制限を克服する一段法SNELLAを提案する。
SNELLAは低メモリ使用量でSOTA性能を達成する。
論文 参考訳(メタデータ) (2025-10-28T03:39:18Z) - FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language Models [49.397861654088636]
低次元空間へのSVD/QRベースの勾配射影を近似する2段階の手順を提案する。
当社の戦略はランタイムの高速化とメモリ使用量の削減を,さまざまなモデルサイズで最大25%削減できることが示されています。
論文 参考訳(メタデータ) (2025-05-23T14:37:00Z) - Unified Gradient-Based Machine Unlearning with Remain Geometry Enhancement [29.675650285351768]
深層ニューラルネットワークのプライバシーと信頼性を高めるために、機械学習(MU)が登場した。
近似MUは大規模モデルの実用的手法である。
本稿では,最新の学習方向を暗黙的に近似する高速スローパラメータ更新手法を提案する。
論文 参考訳(メタデータ) (2024-09-29T15:17:33Z) - Locally Adaptive Neural 3D Morphable Models [38.38400553022714]
本稿では、3Dメッシュの生成と操作を学習するフレームワークであるLocally Adaptive Morphable Model (LAMM)を紹介する。
非常に効率的な計算グラフにより、我々のネットワークは、以前の手法で必要とされるメモリのごく一部でトレーニングできる。
さらに、より高度な編集操作のためのプリミティブとして局所幾何学制御を活用し、微分関数のセットを示す。
論文 参考訳(メタデータ) (2024-01-05T18:28:51Z) - ScatterFormer: Efficient Voxel Transformer with Scattered Linear Attention [13.36619701679949]
ウィンドウベースのトランスフォーマーは、安価な注意計算でコンテキスト認識表現をキャプチャすることで、大規模クラウド理解において優れている。
既存のメソッドは、ウィンドウ内のボクセルを広範囲のソートとパディング操作を通じて固定長のシーケンスにグループ化する。
ScatterFormerは、異なるウィンドウにまたがるvoxelに直接、単一のシーケンスとして注意を向ける最初の方法です。
論文 参考訳(メタデータ) (2024-01-01T02:29:59Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z) - Fine-Tuning Language Models with Just Forward Passes [92.04219196752007]
微調整言語モデル(LM)は、様々な下流タスクで成功したが、LMのサイズが大きくなるにつれて、バックプロパゲーションは大量のメモリを必要とする。
本稿では,メモリ効率の高いゼロソーダ(MeZO)を提案する。
論文 参考訳(メタデータ) (2023-05-27T02:28:10Z) - Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model [89.8764435351222]
分散を低減した行列生成のために, WTA-CRS と呼ばれる新しい非バイアス推定系を提案する。
我々の研究は、チューニング変換器の文脈において、提案した推定器が既存のものよりも低い分散を示すという理論的および実験的証拠を提供する。
論文 参考訳(メタデータ) (2023-05-24T15:52:08Z) - Monarch: Expressive Structured Matrices for Efficient and Accurate
Training [64.6871423399431]
大規模なニューラルネットワークは多くのドメインで優れているが、トレーニングや微調整は高価である。
計算やメモリ要件を減らすための一般的なアプローチは、重み付け行列を構造化行列に置き換えることである。
ハードウェア効率のよい行列(Monarch)のクラスを提案する。
論文 参考訳(メタデータ) (2022-04-01T17:37:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。