論文の概要: SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization
- arxiv url: http://arxiv.org/abs/2605.08809v1
- Date: Sat, 09 May 2026 08:59:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.899093
- Title: SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization
- Title(参考訳): SimReg: 類似性正規化の埋め込みによる事前トレーニングのパフォーマンス向上
- Authors: Yan Sun, Guoxia Wang, Jinle Zeng, JiaBin Yang, Shuai Li, Li Shen, Dacheng Tao, DianHai Yu, Haifeng Wang,
- Abstract要約: SimRegは埋め込み類似性正規化損失であり、各シーケンス内で同じ基幹ラベルを持つトークン表現をより類似させる。
分析の結果, この機構は多分類マージンを増大させ, より効率的な分類を可能にした。
- 参考スコア(独自算出の注目度): 55.63565289584336
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pretraining large language models (LLMs) with next-token prediction has led to remarkable advances, yet the context-dependent nature of token embeddings in such models results in high intra-class variance and inter-class similarity, thus hindering the efficiency of representation learning. While similarity-based regularization has demonstrated benefit in supervised fine-tuning and classification tasks, its application and efficacy in large-scale LLM pretraining remains underexplored. In this work, we propose the SimReg, an embedding similarity regularization loss that explicitly encourages token representations with the same ground-truth label within each sequence to be more similar, while enforcing separation from different-label tokens via a contrastive loss. Our analysis reveals that this mechanism introduces gains by enlarging multi-classification margins, thereby enabling more efficient classification. Extensive experiments across dense and Mixture-of-Experts (MoE) architectures demonstrate that SimReg consistently accelerates training convergence by over 30% and improves average zero-shot downstream performance by over 1% across standard benchmarks. Further ablation studies and analyses offer practical insights into hyperparameter tuning and loss effectiveness.
- Abstract(参考訳): 大規模言語モデル (LLM) を次点予測で事前学習することは、顕著な進歩をもたらしたが、そのようなモデルにおけるトークン埋め込みの文脈依存的な性質は、高いクラス内分散とクラス間類似性をもたらし、表現学習の効率を損なう。
類似性に基づく正規化は、教師付き微調整および分類タスクの利点を示しているが、大規模LLM事前訓練におけるその適用と有効性は未検討のままである。
そこで本研究では,SimRegを提案する。SimRegは,コントラッシブ・ロスによる異なるラベルのトークンの分離を図りながら,各シーケンス内で同じ基底構造ラベルを持つトークン表現をより類似させる,埋め込み類似性正規化損失である。
分析の結果, この機構は多分類マージンを増大させ, より効率的な分類を可能にした。
密集型および混合型(MoE)アーキテクチャにわたる大規模な実験により、SimRegはトレーニング収束を30%以上加速し、標準ベンチマークで平均ゼロショットダウンストリームパフォーマンスを1%以上改善している。
さらなるアブレーション研究と分析は、ハイパーパラメータチューニングと損失効率に関する実践的な洞察を提供する。
関連論文リスト
- Reducing Class-Wise Performance Disparity via Margin Regularization [82.81746960548382]
ディープニューラルネットワークは、クラスバランスのデータでトレーニングされた場合でも、クラスレベルでの精度において大きな違いを示すことが多い。
本稿では,性能格差低減のためのMargin Regularization for Performance Disparity Reduction (MR$2$)を提案する。
分析の結果,クラスごとの機能変動がエラーにどのように寄与するかが明らかとなり,ハードクラスに対するより大きなマージンの利用が動機となった。
論文 参考訳(メタデータ) (2026-01-30T12:56:08Z) - Mixture-of-Experts Models in Vision: Routing, Optimization, and Generalization [0.0]
画像分類設定におけるMoEの挙動について検討し、予測性能、専門家の活用、一般化に着目した。
我々は、CIFAR10データセット上の密度、SoftMoE、SparseMoE分類器を、同等のモデルキャパシティで比較する。
どちらのMoE変種も、正規化によるバランスの取れた専門家の利用を維持しながら、密度の高いベースラインよりもわずかに高い検証精度を達成する。
DenseとSparseMoEは、全てのモデルが同等の一般化性能を達成しているにもかかわらず、同様の曲率状態にあるのに対して、SoftMoEはこれらの指標によってよりシャープさを示す。
論文 参考訳(メタデータ) (2026-01-21T14:22:25Z) - Exploring Structural Degradation in Dense Representations for Self-supervised Learning [84.52554180480037]
自己教師付き学習(SSL)における直感的な現象を観察する。
我々は、この現象を自己教師付きDense Degradation(SDD)と呼び、16の最先端SSLメソッドに一貫した存在を示す。
本稿では,クラス関連尺度と有効次元尺度からなるDense Expression Structure Estimator (DSE)を紹介する。
論文 参考訳(メタデータ) (2025-10-20T08:40:16Z) - NDCG-Consistent Softmax Approximation with Accelerated Convergence [67.10365329542365]
本稿では,ランキングの指標と直接一致した新たな損失定式化を提案する。
提案したRG損失を高効率な Alternating Least Squares (ALS) 最適化手法と統合する。
実世界のデータセットに対する実証的な評価は、我々のアプローチが同等または上位のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-06-11T06:59:17Z) - A Statistical Theory of Contrastive Learning via Approximate Sufficient Statistics [29.162540474549473]
我々はデータ拡張に基づくコントラスト学習を解析するための新しい理論フレームワークを開発した。
我々は,SimCLRなどのコントラスト損失を最小化すれば,ほぼ十分エンコーダが得られることを示す。
論文 参考訳(メタデータ) (2025-03-21T21:07:18Z) - Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies [4.617955187293867]
自動音声アセスメント(ASA)の新しい正規化手法として重み付きベクトルランク付け類似性(W-RankSim)を導入する。
W-RankSimは、類似したクラスに対して出力層内の重み付きベクトルに近づき、類似したラベルを持つ特徴ベクトルは徐々に互いに近づき合うことを示唆している。
本稿では,SSLと手作り機能を組み合わせたハイブリッドモデルを提案する。
論文 参考訳(メタデータ) (2024-06-16T09:55:21Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - RelationMatch: Matching In-batch Relationships for Semi-supervised Learning [11.423755495373907]
半教師付き学習は、少ないラベル付きデータと豊富なラベル付きデータを活用するための重要なアプローチとして登場した。
本稿では, 行列クロスエントロピー(MCE)損失関数を用いて, バッチ内でのリレーショナル一貫性を明示的に強化する新しいSSLフレームワークであるRelationMatchを提案する。
論文 参考訳(メタデータ) (2023-05-17T17:37:48Z) - Improving Music Performance Assessment with Contrastive Learning [78.8942067357231]
本研究では,既存のMPAシステムを改善するための潜在的手法として,コントラスト学習について検討する。
畳み込みニューラルネットワークに適用された回帰タスクに適した重み付きコントラスト損失を導入する。
この結果から,MPA回帰タスクにおいて,コントラッシブ・ベースの手法がSoTA性能に適合し,超越できることが示唆された。
論文 参考訳(メタデータ) (2021-08-03T19:24:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。