論文の概要: Measuring Optimal Transport in Transformer Depth
- arxiv url: http://arxiv.org/abs/2609.00748v1
- Date: Tue, 01 Sep 2026 05:27:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.402693
- Title: Measuring Optimal Transport in Transformer Depth
- Title(参考訳): 変圧器深さの最適輸送測定
- Authors: Alexandre Quemy,
- Abstract要約: トレーニングされたネットワークが、最適な転送方法として、最も低コストで、各トークンと最適な宛先をペアリングするマップに沿って、このクラウドを移動するかどうかを問う。
Pythia-160m と Pythia-410m の両方を連続層雲間の正確な割り当てで測定する。
最後の層では、どちらのモデルも、ピチア410mの最適コストとピチア160mのわずかに高い価格で、最適なトランスポートマップが送信するトークンを移動させる。
- 参考スコア(独自算出の注目度): 51.736723807086385
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A transformer carries each token's state from layer to layer, and the whole vocabulary carried together forms a cloud that moves with depth. We ask whether a trained network moves this cloud the way optimal transport would: at the cheapest cost, and along the map that pairs each token with its optimal destination. We measure both on Pythia-160m and Pythia-410m, with an exact assignment between consecutive layer clouds, a measured sampling floor, calibration on couplings known to be optimal, and a split of the cost into the common shift of the cloud and the token-specific moves. At the last layer, both models move their tokens where the optimal-transport map sends them, at the optimal cost for Pythia-410m and slightly above it for Pythia-160m. At the first layer they do not. In between, single layers can be judged on cost at only two of ten transitions, and blocks of several layers move the cloud at close to the optimal cost. The agreement at the last layer is much weaker at initialisation (0.64 against 0.86) and grows with training.
- Abstract(参考訳): トランスは各トークンの状態を層から層へと運び、ボキャブラリ全体は深度で動く雲を形成する。
トレーニングされたネットワークが、最適な転送方法として、最も低コストで、各トークンと最適な宛先をペアリングするマップに沿って、このクラウドを移動するかどうかを問う。
我々は,Pythia-160m と Pythia-410m を,連続層雲,測定されたサンプリングフロア,最適であることが知られている結合のキャリブレーション,およびコストを,雲とトークン固有の動きの共通シフトに分割して測定する。
最後の層では、どちらのモデルも、ピチア410mの最適コストとピチア160mのわずかに高い価格で、最適なトランスポートマップが送信するトークンを移動させる。
第一層ではそうではない。
中間では、単一のレイヤを10のトランジションのうち2つのコストで判断することができ、複数のレイヤのブロックが最適なコストでクラウドを移動させる。
最後の層での合意は、初期化(0.64対0.86)がより弱く、訓練とともに成長する。
関連論文リスト
- Belief Propagation-based Disentanglers for Tensor Network State Preparation [0.0]
テンソルネットワーク状態のクラスを作成するための量子回路合成法を開発した。
問題は独立で、厳密に局所的で、古典的な変分最適化に還元される。
この手法は、古典的なテンソルネットワーク状態をハードウェアに転送することで、量子応用の新しい可能性を開く。
論文 参考訳(メタデータ) (2026-08-22T10:26:02Z) - WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing [25.894439782435825]
トランスフォーマーでは、各層は独自の深さで生成されたKVを通してのみ過去のトークンに出席する。
すべての注意層を過去のトークンのすべてのレイヤから表現に接続するWhiteMatterを提案する。
論文 参考訳(メタデータ) (2026-08-19T03:24:51Z) - Solar Open 2 Technical Report [96.21161740206544]
長距離エージェントタスク用に構築された250B-A15B Mixture-of-Experts言語モデルであるSolar Open 2を提案する。
エージェント全体の軌道を単一のコンテキストで保持するために、Solar Open 2は1Mの窓に達する。
ドメインスペシャリスト12人を、目的に構築されたシナリオで訓練し、それらを単一のモデルに統合します。
論文 参考訳(メタデータ) (2026-07-22T12:08:41Z) - Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction [24.266851703305004]
Viベースの天気予報モデルは、近くの大気グリッドポイントが時間とともに同様の値や領域を含む場合であっても、すべての空間トークンにわたって計算を適用する。
パラメータフリーなプラグインルーティングモジュールであるSparse-Reslimを導入する。
ERA5の解像度は0.25textdegree標準と2つのモデルファミリ、決定論的トランスフォーマーと拡散モデルまでで、Sparse-Reslimは評価変数の予測精度を著しく向上し、コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-07-02T23:43:01Z) - Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers [91.02299679350834]
Diffusion Transformer (DiTs) は最先端の生成性能を提供するが、シークエンス長の2次トレーニングコストは大規模な事前訓練を不当に高価にする。
本稿では,高効率拡散変換器のためのスパース-デンス残差核融合法を提案する。
論文 参考訳(メタデータ) (2025-10-24T19:29:55Z) - Transformer tricks: Precomputing the first layer [0.0]
このマイクロペーパーは、RoPEでトランスフォーマーの推論を高速化するトリックを記述している。
第1変圧器層の大部分をプリ計算できるため、レイテンシがわずかに小さく、コスト対トーケンが低くなる。
論文 参考訳(メタデータ) (2024-02-20T21:34:56Z) - FIT: Far-reaching Interleaved Transformers [15.302386132016496]
本稿では,自己アテンションと適応計算を効率よく行うトランスフォーマーアーキテクチャを提案する。
ローカルレイヤは各グループ内のデータトークンで動作し、グローバルレイヤはより小さな潜在トークンで動作します。
FITは6400$times$6400イメージや16GBのメモリ容量で(パッチトークン化後の)160Kトークンなど、ギガビットスケールのデータをエンドツーエンドでトレーニングする可能性を示している。
論文 参考訳(メタデータ) (2023-05-22T03:56:44Z) - EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder [60.52613206271329]
本稿では,冷凍CLIP変換器を用いて高品質のクラウドモデルをトレーニングするための textbfEfficient textbfPoint textbfCloud textbfLearning (EPCL) を提案する。
我々のEPCLは、2D-3Dデータをペア化せずに画像の特徴と点雲の特徴を意味的に整合させることで、2Dと3Dのモダリティを接続する。
論文 参考訳(メタデータ) (2022-12-08T06:27:11Z) - Gradient-based Weight Density Balancing for Robust Dynamic Sparse
Training [59.48691524227352]
スパースニューラルネットワークをゼロからトレーニングするには、接続自体と同時にコネクションを最適化する必要がある。
トレーニング中に各レイヤ間の接続は複数回最適化されるが、各レイヤの密度は通常一定である。
我々は、すべての層に重みを分散するテクニックであるGlobal Gradient-based Redistributionを提案する。
論文 参考訳(メタデータ) (2022-10-25T13:32:09Z) - FLOT: Scene Flow on Point Clouds Guided by Optimal Transport [82.86743909483312]
本稿では,点雲上のシーンフローを推定するFLOT法を提案する。
グラフマッチングに関する最近の研究に触発されて、最適な輸送手段からツールを借りてこれらの対応を見つける方法を構築した。
私たちの主な発見は、FLOTは、合成および実世界のデータセット上で、最も優れた既存の方法と同様に、実行可能であることです。
論文 参考訳(メタデータ) (2020-07-22T00:15:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。