論文の概要: A.X K2 Technical Report
- arxiv url: http://arxiv.org/abs/2608.30181v1
- Date: Mon, 31 Aug 2026 03:04:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.205337
- Title: A.X K2 Technical Report
- Title(参考訳): A.X K2技術報告
- Authors: Cheolseung Baek, Dhammiko Arya, Eunki Kim, Gun Song, Gyoungeun Han, Hyunho Yang, Hyunjun Eun, Jin Kim, Junyoung Park, Juyun Wee, Minki Hong, Minkyung Park, Minsang Kim, Minsoo Kang, SaeRom Kim, Sangjin Kim, Sangyeol Lee, Seojin Lee, Seokhwan Jo, Seokyoung Hong, Seongho Choi, Seonghye Cho, Seongmin Ok, Sereimony Sek, Seungmo Cho, Seungsik Kim, Singon Kim, Sohee Park, Sooyeon Park, Subin Yi, Sungbin Yoon, Sungeun Lee, Sung Jun Cheon, Sungwan Kim, Sunwoo Lee, Tae Yoon Kim, Wonbeom Jang, Yohan Ra, Yong-jin Han, Youngjin Kim, Youngrang Kim, Yujin Kang, Yujin Lee,
- Abstract要約: 我々は、強調アプリケーションのための高性能基盤として、スクラッチから訓練された言語モデルであるA.X K2を紹介する。
A.X K2はA.X K1を30ポイント以上改善している。
A.X K2は強力なオープンウェイトベースラインに対して競争力があり、数学や韓国語のベンチマークでそれらをマッチングまたは超える。
- 参考スコア(独自算出の注目度): 16.892621349469206
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce A.X K2, a 688B-parameter Mixture-of-Experts (MoE) language model trained from scratch as a high-performance foundation for \emph{agentic} applications. Trained on approximately 8.5T tokens---fewer than its predecessor, A.X K1---on a smaller but higher-quality mixture with substantially expanded agentic and software-engineering data, it nonetheless improves over A.X K1 across the board, by over 30 percentage points on some benchmarks, reflecting large gains in token efficiency. To support long contexts efficiently, we introduce Sparse Gated Attention (SGA), which combines sparse attention with gated attention, and adopt Gated Norm (GN) to stabilize large-scale training. SGA is trained natively at 128K through a \emph{sparse} indexer warmup that optimizes the indexer against its own sparse top-$k$ selection rather than the dense attention distribution, making adaptation markedly cheaper: each query reads only 2,048 positions, yet long-context quality is unchanged and A.X K2 scores 94.6 on RULER out to 256K. The outlier suppression of GN in turn keeps 4-bit NVFP4 serving within one point of FP8 accuracy. A simple yet effective Think-Fusion recipe further lets users switch between thinking and non-thinking modes within a single unified model. Extensive evaluations show that A.X K2 performs competitively against strong open-weight baselines, matching or exceeding them on math and Korean-language benchmarks.
- Abstract(参考訳): A.X K2は、688Bパラメータの混合(MoE)言語モデルで、スクラッチから訓練され、emph{agentic}アプリケーションのための高性能な基盤となっている。
約8.5Tのトークンで訓練されており、前世代のA.X K1よりも小さいが、エージェントとソフトウェアエンジニアリングのデータが大幅に拡張された高品質の混合物であるにもかかわらず、一部のベンチマークでは30ポイント以上改善され、トークン効率が大きく向上した。
長時間の文脈を効果的に支援するために,スパース注意とゲート注意を組み合わせたスパースゲート注意(SGA)を導入し,Gated Norm(GN)を採用して大規模トレーニングの安定化を図る。
SGAは128Kでネイティブにトレーニングされている。これはインデクサを、集中したアテンション分布ではなく、自身のスパースのトップ-$k$選択に対して最適化する。
4ビットのNVFP4はFP8の精度の1ポイント以内で機能する。
シンプルだが効果的なThink-Fusionのレシピにより、ユーザーは単一の統一モデルの中で思考モードと非思考モードを切り替えることができる。
大規模な評価では、A.X K2は強力なオープンウェイトベースラインに対して競争力があり、数学や韓国のベンチマークでそれらをマッチングまたは超越している。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Improved Large Language Diffusion Models [115.83169414681767]
8Bマスク付き拡散言語モデルである EmphiLLaDA について検討した。
iLLaDAは、事前トレーニングと教師付き微調整(SFT)、12Tトークンへの事前トレーニング、および12エポックのための25Bトークン命令コーパスの微調整を通じて、マスク付き拡散目標を維持している。
論文 参考訳(メタデータ) (2026-06-24T02:51:36Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - Extending Puzzle for Mixture-of-Experts Reasoning Models with Application to GPT-OSS Acceleration [17.929617807312635]
推論に焦点をあてたLLMは、より長い推論トレースを生成することで応答品質を向上させるが、追加のトークンはサービスコストを劇的に向上させる。
トレーニング後のニューラルネットワーク検索(NAS)フレームワークであるPuzzleを拡張して,gpt-oss-puzzle-88Bを生成する。
提案手法は,不均一なMoEエキスパートプルーニング,ウィンドウアテンションによるフルコンテキストアテンションの選択的置き換え,キャリブレーションスケールによるFP8 KV-cache量子化,トレーニング後の強化学習を併用して精度を回復する。
論文 参考訳(メタデータ) (2026-02-12T13:36:19Z) - Gated Sparse Attention: Combining Computational Efficiency with Training Stability for Long-Context Language Models [0.0]
Gated Sparse Attention (GSA)はスパースとゲートの双方の利点を実現するアーキテクチャである。
GSAは、有界で解釈可能な選択スコアを生成するシグモイドアクティベーションを備えたゲート雷インデクサを組み込んでいる。
論文 参考訳(メタデータ) (2026-01-12T20:33:39Z) - K-EXAONE Technical Report [76.23621600385238]
K-EXAONEはLG AI Researchが開発した大規模多言語言語モデルである。
256Kのコンテキストウィンドウをサポートし、韓国語、英語、スペイン語、ドイツ語、日本語、ベトナム語をカバーしている。
我々はK-EXAONEを、推論、エージェント、一般、韓国語、多言語能力にまたがる総合的なベンチマークスイートで評価した。
論文 参考訳(メタデータ) (2026-01-05T02:30:59Z) - EdgeJury: Cross-Reviewed Small-Model Ensembles for Truthful Question Answering on Serverless Edge Inference [0.0]
EdgeJuryは、真実性と堅牢性を改善する軽量アンサンブルフレームワークです。
TruthfulQA (MC1)では、EdgeJuryの精度は76.2%である。
200-question adversarial EdgeCasesセットでは、EdgeJuryは+48.2%の利得を得る。
論文 参考訳(メタデータ) (2025-12-29T14:48:40Z) - Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2 [3.309291427648113]
HuaweiのopenPangu-Embeded-1BとopenPangu-Embeded-7Bは3つの異なるChain-of-Thought(CoT)推論パラダイムを統合している。
これらのCoTモードではメモリとレイテンシのオーバーヘッドが大きくなり、Ascend NPUへの実践的なデプロイが困難になる。
本稿では、FP16計算をより効率的な整数算術に変換する低ビット量子化を利用して、これらの計算制約に対処する。
論文 参考訳(メタデータ) (2025-12-29T10:50:23Z) - Kimi K2: Open Agentic Intelligence [118.78600121345099]
Kimi K2は32億の活性化パラメータと1兆の総パラメータを持つ大きな言語モデルである。
MuonClipに基づいて、K2は15.5兆のトークンで事前訓練され、損失のスパイクはゼロだった。
Kimi K2は、オープンソース非思考モデルの間で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-28T05:35:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。