論文の概要: Introducing LongCat-Flash-Thinking: A Technical Report
- arxiv url: http://arxiv.org/abs/2509.18883v2
- Date: Fri, 07 Nov 2025 11:10:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-10 21:00:44.511726
- Title: Introducing LongCat-Flash-Thinking: A Technical Report
- Title(参考訳): LongCat-Flash-Thinkingの紹介 - テクニカルレポート
- Abstract要約: LongCat-Flash-ThinkingはオープンソースのMixture-of-Experts (MoE)推論モデルである。
高度な能力は、巧妙に製作された訓練プロセスを通じて育成される。
LongCat-Flash-Thinkingは、複雑な推論タスクのスイート上で、オープンソースモデル間の最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 116.75498493511026
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present LongCat-Flash-Thinking, an efficient 560-billion-parameter open-source Mixture-of-Experts (MoE) reasoning model. Its advanced capabilities are cultivated through a meticulously crafted training process, beginning with long Chain-of-Thought (CoT) data cold-start and culminating in large-scale Reinforcement Learning (RL). We first employ a well-designed cold-start training strategy, which significantly enhances the reasoning potential and equips the model with specialized skills in both formal and agentic reasoning. Then, a core innovation is our domain-parallel training scheme, which decouples optimization across distinct domains (e.g., STEM, Code, Agentic) and subsequently fuses the resulting expert models into a single, nearly Pareto-optimal model. This entire process is powered by our Dynamic ORchestration for Asynchronous rollout (DORA) system, a large-scale RL framework that delivers a greater than threefold training speedup over synchronous methods on tens of thousands of accelerators. As a result, LongCat-Flash-Thinking achieves state-of-the-art performance among open-source models on a suite of complex reasoning tasks. The model exhibits exceptional efficiency in agentic reasoning, reducing average token consumption by 64.5% (from 19, 653 to 6, 965) on AIME-25, without degrading task accuracy. We release LongCat-Flash-Thinking to promote further advances in reasoning systems and agentic AI research.
- Abstract(参考訳): 提案するLongCat-Flash-Thinkingは,オープンソースのMixture-of-Experts(MoE)推論モデルである。
その先進的な能力は、CoT(Chain-of-Thought)データから始まり、大規模強化学習(RL)において、細心の注意を要する訓練プロセスを通じて育成される。
まず, 推論能力を大幅に向上させ, 形式的およびエージェント的推論の双方において, 専門的なスキルを持つモデルを装備する, 優れた冷間開始訓練戦略を採用する。
これは、異なるドメイン(例えば、STEM、コード、エージェント)で最適化を分離し、その結果のエキスパートモデルを、ほぼパレート最適化モデルに融合させるものです。
このプロセス全体は、数万のアクセラレータ上で同期メソッドよりも3倍以上のトレーニングスピードアップを提供する大規模なRLフレームワークであるDynamic Orchestration for Asynchronous Rollout (DORA)システムによって実現されています。
結果として、LongCat-Flash-Thinkingは、複雑な推論タスクのスイート上で、オープンソースモデル間の最先端のパフォーマンスを達成する。
このモデルはエージェント推論において例外的な効率を示し、平均トークン消費量をAIME-25上で64.5%削減する(633年6月19日から965年6月6日まで)。
我々はLongCat-Flash-Thinkingをリリースし、推論システムとエージェントAI研究のさらなる進歩を促進する。
関連論文リスト
- LongCat-Flash-Thinking-2601 Technical Report [134.89732115690705]
LongCat-Flash-Thinking-2601はオープンソースのMixture-of-Experts (MoE)推論モデルである。
LongCat-Flash-Thinking-2601は、幅広いエージェントベンチマーク上で、オープンソースモデル間の最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-01-23T13:20:09Z) - LongCat-Flash-Omni Technical Report [131.47284063481922]
LongCat-Flash-Omniは5600億のパラメータを持つオープンソースのOmni-modalモデルである。
LongCat-Flash-Omniは強力なunimodal機能を維持しながら、包括的なマルチモーダル機能を実現する。
低レイテンシのリアルタイムオーディオ・ビジュアルインタラクションを実現する。
論文 参考訳(メタデータ) (2025-10-31T21:58:15Z) - LongCat-Flash Technical Report [165.64670448930875]
LongCat-Flashは、560ビリオンパラメータのMixture-of-Experts (MoE)言語モデルである。
計算効率と高度なエージェント能力の両方のために設計されている。
30日以内に20兆トークン以上のモデルトレーニングを完了し、100トークン/秒 (TPS) 以上の推論を0.70パーセントのアウトプットトークンで達成しました。
論文 参考訳(メタデータ) (2025-09-01T10:05:45Z) - KAT-V1: Kwai-AutoThink Technical Report [50.84483585850113]
Kwaipilot-AutoThink (KAT) はオープンソースの40B大言語モデルであり、推論集約タスクにおける過大な問題に対処するために開発された。
KATはタスクの複雑さに基づいて推論モードと非推論モードを動的に切り替える。
また、GRPOフレームワークに中間管理を組み込んだ強化学習アルゴリズムであるStep-SRPOを提案する。
論文 参考訳(メタデータ) (2025-07-11T04:07:10Z) - LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training [32.575669924032276]
強化学習(RL)は、大規模言語モデル(LLM)の能力向上のための訓練後の最も効果的なアプローチとなっている。
本稿では,LlamaRLについて述べる。LlamaRLは大規模LLMの効率的なトレーニングに最適化された,完全に分散された非同期RLフレームワークである。
論文 参考訳(メタデータ) (2025-05-29T22:14:15Z) - Scaling Laws for Native Multimodal Models [53.490942903659565]
我々は、ネイティブマルチモーダルモデルのアーキテクチャ設計を再考し、広範なスケーリング法の研究を行う。
我々の調査では、早期核融合アーキテクチャよりも後期核融合アーキテクチャに固有の利点は示されていない。
モデルにMixture of Experts(MoEs)を組み込むことで、モデルがモダリティ固有の重みを学習し、性能を著しく向上できることを示す。
論文 参考訳(メタデータ) (2025-04-10T17:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。