論文の概要: Generalization Bounds on Optimal Control for Transformer Training and Wasserstein Distributional Robustness
- arxiv url: http://arxiv.org/abs/2607.27975v1
- Date: Thu, 30 Jul 2026 10:22:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.509568
- Title: Generalization Bounds on Optimal Control for Transformer Training and Wasserstein Distributional Robustness
- Title(参考訳): 変圧器訓練とワッサーシュタイン分布ロバストネスの最適制御に関する一般化境界
- Authors: Kağan Akman, Naci Saldi, Serdar Yüksel,
- Abstract要約: 我々は、データセットを経験的入出力尺度のペアの確率法則とみなし、トレーニング問題を有限水平マルコフ制御問題と解釈することができる。
同じ機械がトレーニング問題の分布的に頑健な制御を定式化し、Transformerの一般化とWassersteinの分布的に頑健な最適化を接続することを示す。
- 参考スコア(独自算出の注目度): 8.564319625930894
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We derive finite-sample generalization bounds for Transformers trained with dynamic programming recursions. Building on the doubly lifted, measure-valued formulation of Transformer dynamics, we view data sets as probability laws on pairs of empirical input-output measures, allowing us to interpret the training problem as a finite-horizon Markovian control problem. We then analyze a quantized model, derived by quantizing the state, action, and measure-state spaces, and derive explicit finite-sample generalization bounds using concentration inequalities for empirical laws on finite metric spaces together with a Lipschitz stability estimate for the value function. These bounds are transferred to the base model at the cost of an explicit approximation error. Finally, we show that the same machinery yields a distributionally robust control formulation of the training problem, connecting Transformer generalization to Wasserstein distributionally robust optimization.
- Abstract(参考訳): 動的プログラム再帰を訓練した変換器に対して有限サンプル一般化境界を導出する。
2重に持ち上げられた測度値のトランスフォーマーダイナミクスの定式化に基づいて、我々はデータセットを経験的インプットアウトプット尺度のペアの確率法則とみなし、トレーニング問題を有限水平マルコフ制御問題と解釈することができる。
次に、状態、作用、測度状態空間の量子化から導かれる量子化モデルを解析し、有限距離空間上の経験則の濃度不等式と値関数のリプシッツ安定性推定値を用いて明示的な有限サンプル一般化境界を導出する。
これらの境界は、明示的な近似誤差を犠牲にしてベースモデルに転送される。
最後に、同じ機械がトレーニング問題の分布的にロバストな制御定式化をもたらし、トランスフォーマーの一般化とワッサーシュタインの分布的にロバストな最適化を接続することを示す。
関連論文リスト
- Reachability and asymptotics of Gaussian Transformer dynamics [2.669398324965473]
大規模言語モデルを利用した機械学習アーキテクチャであるTransformerを通じて,データの伝播を定式化する。
ガウス分布が誘導流れに沿ってちょうどガウス分布であることを示す。
我々は、所定のガウスモーメントの到達可能性問題としてトランスフォーマーの表現能力を再構成する。
論文 参考訳(メタデータ) (2026-05-29T07:51:03Z) - An Optimal Control Approach To Transformer Training [7.136933021609078]
重要な構造的制約を尊重するトランスフォーマートレーニングに対する厳密な最適制御理論アプローチを開発する。
確率測度に引き上げることによって、完全に観測されたマルコフ決定過程(MDP)が生成されることを示す。
トランスフォーマーを訓練するために,状態空間,確率測度,行動空間を定量化することにより,昇降型MDPの3次元量子化訓練手順を提案する。
論文 参考訳(メタデータ) (2026-03-10T12:17:48Z) - Stability and Generalization of Push-Sum Based Decentralized Optimization over Directed Graphs [55.77845440440496]
プッシュベースの分散通信は、情報交換が非対称である可能性のある通信ネットワークの最適化を可能にする。
我々は、グラディエント・プッシュ(SGP)アルゴリズムのための統一的な一様安定性フレームワークを開発する。
重要な技術的要素は、2つの量に束縛された不均衡認識の一般化である。
論文 参考訳(メタデータ) (2026-02-24T05:32:03Z) - Variational Entropic Optimal Transport [67.76725267984578]
本稿では,ドメイン翻訳問題に対する変分エントロピー最適輸送(VarEOT)を提案する。
VarEOTは、補助正の正規化子上のトラクタブルな一般化として、log-partition $log mathbbE[exp(cdot)$の正確な変分再構成に基づいている。
合成データと画像と画像の変換に関する実験は、競争力のあるか、あるいはより良い翻訳品質を示す。
論文 参考訳(メタデータ) (2026-02-02T15:48:44Z) - Stochastic Control Methods for Optimization [0.0]
ユークリッド設定では、正規化制御問題の問題を解析する。
大域的な測度では、マスターフィールド問題によって特徴づけられる正規化された平均場問題を定式化する。
論文 参考訳(メタデータ) (2026-01-03T17:55:26Z) - Closed-Loop Transformers: Autoregressive Modeling as Iterative Latent Equilibrium [0.6820746164515952]
閉ループ予測の原理を導入し、自己整合平衡に達するまで、モデルが反復的に潜在表現を洗練することを要求する。
この原理をEquilibrium Transformerとしてインスタンス化し,標準トランス層をEquilibrium Refinement Moduleで拡張する。
バイナリパリティタスクに関する予備実験では、チャレンジシーケンスの平均改善率は+3.28%で、標準トランスフォーマーがランダムなパフォーマンスに近づくと+8.07%に達する。
論文 参考訳(メタデータ) (2025-11-26T20:02:59Z) - Transformers Are Universally Consistent [14.904264782690639]
ソフトマックスに基づく非線形アテンションを備えたトランスフォーマーは,最小二乗の回帰処理を行う場合,一様に整合性を示す。
我々は経験的誤差の上限を導出し、この条件下では$mathcalO(t-1/2d)$の証明可能な速度で減衰し、$t$は入力トークンの数を表し、$d$は埋め込み次元を表す。
論文 参考訳(メタデータ) (2025-05-30T12:39:26Z) - Unveiling the Statistical Foundations of Chain-of-Thought Prompting Methods [59.779795063072655]
CoT(Chain-of-Thought)の促進とその変種は、多段階推論問題を解決する効果的な方法として人気を集めている。
統計的推定の観点からCoTのプロンプトを解析し,その複雑さを包括的に評価する。
論文 参考訳(メタデータ) (2024-08-25T04:07:18Z) - Gaussian Process-based Min-norm Stabilizing Controller for
Control-Affine Systems with Uncertain Input Effects and Dynamics [90.81186513537777]
本稿では,この問題の制御・アフィン特性を捉えた新しい化合物カーネルを提案する。
この結果の最適化問題は凸であることを示し、ガウス過程に基づく制御リャプノフ関数第二次コーンプログラム(GP-CLF-SOCP)と呼ぶ。
論文 参考訳(メタデータ) (2020-11-14T01:27:32Z) - Learning Likelihoods with Conditional Normalizing Flows [54.60456010771409]
条件正規化フロー(CNF)はサンプリングと推論において効率的である。
出力空間写像に対する基底密度が入力 x 上で条件づけられた CNF について、条件密度 p(y|x) をモデル化する。
論文 参考訳(メタデータ) (2019-11-29T19:17:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。