論文の概要: Technical Report of TeleChat2, TeleChat2.5 and T1
- arxiv url: http://arxiv.org/abs/2507.18013v3
- Date: Tue, 29 Jul 2025 10:30:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-07-30 12:52:36.824519
- Title: Technical Report of TeleChat2, TeleChat2.5 and T1
- Title(参考訳): TeleChat2, TeleChat2.5, T1の技術報告
- Abstract要約: 最新のTeleChatモデルについて紹介する: textbfTeleChat2, textbfTeleChat2.5, textbfT1。
モデルアーキテクチャの最小限の変更にもかかわらず、新しいシリーズは、強化されたトレーニング戦略によって、大幅なパフォーマンス向上を達成する。
- 参考スコア(独自算出の注目度): 40.94556337267851
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce the latest series of TeleChat models: \textbf{TeleChat2}, \textbf{TeleChat2.5}, and \textbf{T1}, offering a significant upgrade over their predecessor, TeleChat. Despite minimal changes to the model architecture, the new series achieves substantial performance gains through enhanced training strategies in both pre-training and post-training stages. The series begins with \textbf{TeleChat2}, which undergoes pretraining on 10 trillion high-quality and diverse tokens. This is followed by Supervised Fine-Tuning (SFT) and Direct Preference Optimization (DPO) to further enhance its capabilities. \textbf{TeleChat2.5} and \textbf{T1} expand the pipeline by incorporating a continual pretraining phase with domain-specific datasets, combined with reinforcement learning (RL) to improve performance in code generation and mathematical reasoning tasks. The \textbf{T1} variant is designed for complex reasoning, supporting long Chain-of-Thought (CoT) reasoning and demonstrating substantial improvements in mathematics and coding. In contrast, \textbf{TeleChat2.5} prioritizes speed, delivering rapid inference. Both flagship models of \textbf{T1} and \textbf{TeleChat2.5} are dense Transformer-based architectures with 115B parameters, showcasing significant advancements in reasoning and general task performance compared to the original TeleChat. Notably, \textbf{T1-115B} outperform proprietary models such as OpenAI's o1-mini and GPT-4o. We publicly release \textbf{TeleChat2}, \textbf{TeleChat2.5} and \textbf{T1}, including post-trained versions with 35B and 115B parameters, to empower developers and researchers with state-of-the-art language models tailored for diverse applications.
- Abstract(参考訳): 最新のTeleChatモデルについて紹介する: \textbf{TeleChat2}, \textbf{TeleChat2.5}, \textbf{T1}。
モデルアーキテクチャの最小限の変更にもかかわらず、新しいシリーズはトレーニング前の段階とトレーニング後の段階の両方でトレーニング戦略を強化することで、大幅なパフォーマンス向上を実現している。
シリーズは10兆の高品質で多様なトークンを事前訓練する \textbf{TeleChat2} から始まる。
これに続き、Supervised Fine-Tuning (SFT) と Direct Preference Optimization (DPO) が続く。
\textbf{TeleChat2.5} と \textbf{T1} は、コード生成と数学的推論タスクのパフォーマンスを向上させるために、強化学習(RL)と合わせて、ドメイン固有のデータセットと連続的な事前トレーニングフェーズを組み込むことでパイプラインを拡張する。
textbf{T1} 変種は複雑な推論のために設計され、長いチェーン・オブ・ソート(CoT)推論をサポートし、数学とコーディングの大幅な改善を示す。
対照的に、 \textbf{TeleChat2.5} は速度を優先し、高速な推論を提供する。
textbf{T1} と \textbf{TeleChat2.5} のフラッグシップモデルはいずれも115B パラメータを持つ高密度トランスフォーマーベースのアーキテクチャであり、オリジナルの TeleChat と比較して推論と一般的なタスク性能の大幅な進歩を示している。
特に、 \textbf{T1-115B} は OpenAI の o1-mini や GPT-4o といったプロプライエタリモデルよりも優れていた。
私たちは、35Bと115Bパラメータのトレーニング後のバージョンを含む、公開リリースの \textbf{TeleChat2}, \textbf{TeleChat2.5} と \textbf{T1} を公開し、開発者や研究者に様々なアプリケーションに適した最先端の言語モデルを提供する。
関連論文リスト
- JustRL: Scaling a 1.5B LLM with a Simple RL Recipe [45.42398283391072]
単段トレーニングは、2つの1.5B推論モデルで最先端のパフォーマンスを達成する。
トレーニングは、通常介入を動機づける崩壊や台地を伴わない4000以上のステップに対して、滑らかで単調な改善を示す。
論文 参考訳(メタデータ) (2025-12-18T15:21:25Z) - TPTT: Transforming Pretrained Transformers into Titans [0.0]
トランスフォーマーベースの大規模言語モデル(LLM)は、多くの自然言語処理タスクにおいて強力なパフォーマンスを実現している。
本稿では,リニアライズドアテンション(LiZA)と内部メモリゲーティングによる事前学習型トランスフォーマーの拡張を目的としたTPTTを提案する。
Llama-1B, OlMoE-1B-7B, Qwen2.5-1.5B, Gemma3-270m, OpenELM-1.3B, Mistral-7Bなどの事前訓練モデルでTPTTを評価した。
論文 参考訳(メタデータ) (2025-06-21T10:06:07Z) - T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT [73.10972809774039]
本稿では,強化学習を利用した新たな推論型テキスト・画像生成モデルであるT2I-R1を提案する。
ベースラインモデルであるJanus-Proに推論戦略を適用することで、T2I-CompBenchを13%改善し、WISEベンチマークを19%改善し、優れた性能を実現した。
論文 参考訳(メタデータ) (2025-05-01T17:59:46Z) - FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models [28.351652568849286]
我々は,効率的なトレーニングとCoT推論を実現するために,段階的コンテキストスケーリングを備えたカリキュラムRLフレームワークであるFastCuRLを提案する。
実験の結果、FastCuRL-1.5B-V3は5つの競合レベルのベンチマークで最先端の推論モデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-03-21T16:35:31Z) - Systems and Algorithms for Convolutional Multi-Hybrid Language Models at Scale [68.6602625868888]
本稿では,2つの簡単な観測に基づいて,畳み込み型マルチハイブリッドアーキテクチャを提案する。
ハイブリッドモデルのオペレータは、インコンテキストリコール、マルチトークンリコール、圧縮などのトークン操作タスクにカスタマイズできる。
我々は、最適化されたトランスフォーマーの1.2倍から2.9倍、以前の世代のハイブリッドの1.1倍から1.4倍の速さでエンドツーエンドを訓練する。
論文 参考訳(メタデータ) (2025-02-25T19:47:20Z) - Qwen2.5-1M Technical Report [72.09755998661568]
コンテクスト長を100万トークンまで拡張する一連のモデルであるQwen2.5-1Mを紹介する。
我々の推論フレームワークを活用することで、Qwen2.5-1Mモデルは驚くべき3倍から7倍のプリフィルスピードアップを達成する。
論文 参考訳(メタデータ) (2025-01-26T03:47:25Z) - mFabric: An Efficient and Scalable Fabric for Mixture-of-Experts Training [21.5342833453912]
Mixture-of-Expert (MoE) モデルは、Emphexperts という名前の異なるモデルをtoken ベースで選択的に活性化することで、従来のモデルより優れている。
このゲート計算は、事前に決められない動的通信を生成し、分散トレーニングプロセスの間、静電的な既存のGPUインターコネクトに挑戦する。
我々は,分散MoEトレーニングを取り入れたトポロジ再構成をアンロックする,mFabricと呼ばれる第一種システムを提案する。
論文 参考訳(メタデータ) (2025-01-07T16:19:40Z) - Markovian Transformers for Informative Language Modeling [0.9642500063568188]
CoT(Chain-of-Thought)推論は、しばしば言語モデルの根底にある決定プロセスを忠実に反映しない。
我々は、CoTを「マルコフ」言語モデルにおいて因果的に必要としており、中間のCoTを通して次のトークン予測を分解し、元のプロンプトとは無関係に将来のトークンを予測するよう訓練する。
論文 参考訳(メタデータ) (2024-04-29T17:36:58Z) - Textbooks Are All You Need II: phi-1.5 technical report [55.6940110946465]
我々は、新しい13億のパラメータモデル textbfphi-1.5を作成し、5倍のモデルに匹敵する自然言語タスクのパフォーマンスを実現した。
textbfphi-1.5はより大きな言語モデルの特徴の多くを示している。
我々はこれらの緊急トピックに関するさらなる研究を促進するために textbfphi-1.5 をオープンソース化した。
論文 参考訳(メタデータ) (2023-09-11T14:01:45Z) - CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers [53.224004166460254]
本稿では,視覚言語変換のための一般的なアクセラレーションフレームワークであるクロスガイド・アンサンブル・オブ・トークン(CrossGET)を紹介する。
CrossGETは推論中にリアルタイムでトークンを適応的に結合し、計算コストを大幅に削減する。
画像テキスト検索、視覚的推論、画像キャプション、視覚的質問応答など、様々な視覚言語タスクの実験が行われている。
論文 参考訳(メタデータ) (2023-05-27T12:07:21Z) - Dual-Level Decoupled Transformer for Video Captioning [15.193977761440404]
ビデオキャプションは、ビデオの意味概念を理解し、記述文を生成することを目的としている。
MathcalD2$はデュアルレベルの視覚分離型トランスフォーマーパイプラインである。
emph(i)をビデオ時間表現に用い,その過程を「第1空間時間」パラダイムに分離する。
論文 参考訳(メタデータ) (2022-05-06T06:37:07Z) - DSEE: Dually Sparsity-embedded Efficient Tuning of Pre-trained Language
Models [152.29364079385635]
事前訓練されたモデルが大きくなればなるほど、微調整のプロセスは時間がかかり、計算コストがかかる可能性がある。
本稿では,重み更新と最終モデルの重み付けに先立って,疎度を活用することで,資源・パラメータ効率の微調整を行うフレームワークを提案する。
提案するフレームワークは,Dually Sparsity-Embeded Efficient Tuning (DSEE)と呼ばれ,パラメータ効率のよい微調整とリソース効率の推論という2つの重要な目標を達成することを目的としている。
論文 参考訳(メタデータ) (2021-10-30T03:29:47Z) - Scale Efficiently: Insights from Pre-training and Fine-tuning
Transformers [57.931830650323]
本稿では,事前学習および微調整型変圧器によるスケーリングの洞察について述べる。
モデルのサイズだけでなく、モデル形状が下流の微調整に重要であることを示す。
再設計したモデルにより、下流の微調整品質が向上する。
論文 参考訳(メタデータ) (2021-09-22T12:29:15Z) - NT5?! Training T5 to Perform Numerical Reasoning [0.8827543048499855]
テキスト上の数値推論(NRoT)は、既存の事前学習目標ではうまく対処できないユニークな課題を提示します。
T5マルチタスクフレームワークを複数の数値推論データセットでトレーニングすることで、手動で分割機能を設計することなく、難易度を高めることができることを示した。
論文 参考訳(メタデータ) (2021-04-15T08:34:44Z) - Switch Transformers: Scaling to Trillion Parameter Models with Simple
and Efficient Sparsity [35.84448624327473]
MoEルーティングアルゴリズムを簡略化し、通信コストと計算コストを削減して直感的に改善されたモデルを設計する。
我々は、初めて低精度(bfloat16)フォーマットで、大きなスパースモデルを訓練できることを示した。
我々は,t5-base と t5-large に基づいてモデルを設計し,同じ計算資源で事前学習速度を最大7倍向上させる。
論文 参考訳(メタデータ) (2021-01-11T16:11:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。