論文の概要: PLaMo-100B: A Ground-Up Language Model Designed for Japanese Proficiency
- arxiv url: http://arxiv.org/abs/2410.07563v2
- Date: Tue, 22 Oct 2024 09:06:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-10-31 16:16:17.235838
- Title: PLaMo-100B: A Ground-Up Language Model Designed for Japanese Proficiency
- Title(参考訳): PLaMo-100B:日本語の習熟度に配慮した基礎言語モデル
- Abstract要約: PLaMo-100Bは,日本語の習熟度を考慮した大規模言語モデルである。
モデルは2兆トークンを使用してゼロからトレーニングされた。
ベンチマーク評価の結果,PLaMo-100Bは特に日本語のタスクにおいて良好に機能することが示唆された。
- 参考スコア(独自算出の注目度): 4.122864669557465
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce PLaMo-100B, a large-scale language model designed for Japanese proficiency. The model was trained from scratch using 2 trillion tokens, with architecture such as QK Normalization and Z-Loss to ensure training stability during the training process. Post-training techniques, including Supervised Fine-Tuning and Direct Preference Optimization, were applied to refine the model's performance. Benchmark evaluations suggest that PLaMo-100B performs well, particularly in Japanese-specific tasks, achieving results that are competitive with frontier models like GPT-4. The base model is available at https://huggingface.co/pfnet/plamo-100b.
- Abstract(参考訳): PLaMo-100Bは,日本語の習熟度を考慮した大規模言語モデルである。
モデルは、トレーニングプロセス中にトレーニング安定性を確保するために、QK正規化やZ-Lossといったアーキテクチャを用いて、2兆トークンを使用して、ゼロからトレーニングされた。
Supervised Fine-Tuning や Direct Preference Optimization などのポストトレーニング手法をモデルの性能改善に応用した。
ベンチマーク評価の結果,PLaMo-100Bは特に日本語固有のタスクにおいて,GPT-4のようなフロンティアモデルと競合する結果が得られることが示唆された。
ベースモデルはhttps://huggingface.co/pfnet/plamo-100bで公開されている。
関連論文リスト
- Cost of Reasoning in non-English Languages: A Case Study on Japanese [16.295305195753723]
推論言語モデル (Reasoning Language Models, RLMs) は、英語で推論すると最も優れた性能を発揮する。
本研究では,Qwen-3-Swallow-8Bの日本語版であるQwen-3-Swallow-8Bを開発した。
本研究では,日本文化ベンチマークの学習モデルの評価を行い,モデルの性能がベースラインモデルよりも悪いことを検証した。
論文 参考訳(メタデータ) (2026-07-11T04:30:43Z) - PLaMo 2 Technical Report [9.166942912957724]
本研究では,サンバをベースとしたハイブリッドアーキテクチャを特徴とする,日本語を対象とする大規模言語モデルであるPLaMo 2を紹介する。
PLaMo 2モデルは、日本語のベンチマークで最先端の結果を達成し、命令追従、言語流速、日本語特有の知識において、同様の大きさのオープンモデルよりも優れている。
論文 参考訳(メタデータ) (2025-09-05T08:17:59Z) - Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs [111.69640966866059]
ミキチャー・オブ・エキスパート(MoE)と1兆近いパラメータを持つ疎大言語モデル(LLM)が、最も有能な言語モデルの領域を支配している。
本稿では,Ascend NPU上でそのようなスケールを利用するレシピを明らかにすることを目的としている。
主な目的は、動的スパースモデル構造下でのコンピューティングリソースのより良い使用と、実際のハードウェアで期待されるパフォーマンス向上の実現である。
論文 参考訳(メタデータ) (2025-05-07T15:46:36Z) - Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs [123.25404278506585]
135億のパラメータと高密度トランスフォーマーモジュールを持つ大規模言語モデル(LLM)であるPangu Ultraについて述べる。
このような大規模トレーニングを効率的に行うためには,8,192個のAscend NPUと一連のシステム最適化を用いる。
我々の調査では、Ascend NPUは1000億以上のパラメータを持つ高密度モデルを効率的かつ効果的に訓練できることを示した。
論文 参考訳(メタデータ) (2025-04-10T15:41:51Z) - Kanana: Compute-efficient Bilingual Language Models [9.597618914676106]
カナナ(Kanana)は、韓国語のパフォーマンスと英語の競争性能を超越した二言語モデルである。
このレポートでは、計算効率が良いが競争力のあるモデルを実現するために、事前学習で使用されるテクニックについて詳述している。
本報告では, 埋め込み, 検索拡張生成, 関数呼び出しなど, 特定のシナリオへの言語モデル適応に有効なアプローチについて詳述する。
論文 参考訳(メタデータ) (2025-02-26T08:36:20Z) - LLäMmlein: Compact and Competitive German-Only Language Models from Scratch [3.7160688974577156]
我々は、2つのドイツ専用デコーダモデル、LL"aMmlein 120Mと1Bを作成し、それらをスクラッチから透過的に公開し、トレーニングデータとともに、ドイツのNLP研究コミュニティが使用できるようにしました。
モデルトレーニングには、広範なデータ前処理、カスタムなドイツのトークン化器の作成、トレーニング自体、および様々なベンチマークの最終モデルの評価など、いくつかの重要なステップが含まれていた。
論文 参考訳(メタデータ) (2024-11-17T20:44:34Z) - Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial Robustness [52.9493817508055]
我々は,モデルがゼロショットの逆方向のロバスト性を高めるために,事前訓練されたモデル誘導逆方向の微調整(PMG-AFT)を提案する。
私たちのアプローチは、平均8.72%のクリーンな精度を継続的に改善します。
論文 参考訳(メタデータ) (2024-01-09T04:33:03Z) - Look Ma, Only 400 Samples! Revisiting the Effectiveness of Automatic
N-Gram Rule Generation for Spelling Normalization in Filipino [0.0]
フィリピンのNLPアプリケーションの開発には、オンラインテキストをモデルで処理する能力が不可欠である。
自動ルール抽出によるN-Gram + Damerau Levenshtein距離モデルを提案する。
論文 参考訳(メタデータ) (2022-10-06T04:41:26Z) - GLM-130B: An Open Bilingual Pre-trained Model [56.694470924635624]
我々は,130億のパラメータを持つバイリンガル(英語と中国語)事前学習言語モデルであるGLM-130Bを紹介する。
100Bスケールのモデルを少なくとも GPT-3 (davinci) と同程度にオープンソース化し、そのようなスケールのモデルがどのように事前訓練されるかを明らかにする試みである。
論文 参考訳(メタデータ) (2022-10-05T17:34:44Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z) - Efficient Large Scale Language Modeling with Mixtures of Experts [61.45159383372181]
エキスパート層(MoE)の混合により、条件付き計算による言語モデルの効率的なスケーリングが可能になる。
本稿では, 自己回帰型 MoE 言語モデルが, 広範囲な環境下での高密度モデルと比較して, どのようにスケールするかを示す実験的検討を行った。
論文 参考訳(メタデータ) (2021-12-20T17:05:11Z) - Scalable and Efficient MoE Training for Multitask Multilingual Models [55.987536562357086]
我々は,MoEモデルを数兆のパラメータに効率的にスケールできるシステムを開発した。
また,MoEサンプルの効率を向上させるための新たなトレーニング手法を提案し,時間効率を向上させるために専門家の刈り取り戦略を活用する。
50言語で100億のパラメータで訓練されたモデルは、機械翻訳(MT)および多言語自然言語生成タスクにおける最先端のパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2021-09-22T00:57:46Z) - Pronoun-Targeted Fine-tuning for NMT with Hybrid Losses [6.596002578395152]
我々は,訓練された機械翻訳モデルの微調整に使用する条件付き生成-識別ハイブリッド損失のクラスを導入する。
我々は、追加データを用いることなく、文レベルと文脈モデルの両方のモデル性能を改善する。
文レベルモデルではWMT14とIWSLT13の両テストセットで0.5BLEUの改善が見られた。
我々の文脈モデルは WMT14 De-En テストセットにおいて 31.81 から 32 BLEU に改善され、IWSLT13 De-En では 32.10 から 33.13 に改善された。
論文 参考訳(メタデータ) (2020-10-15T10:11:40Z) - FiSSA at SemEval-2020 Task 9: Fine-tuned For Feelings [2.362412515574206]
本稿では,スペイン語と英語の混在するソーシャルメディアデータを用いた感情分類手法を提案する。
単言語モデルと多言語モデルの両方を標準微調整法を用いて検討する。
2段階の微調整により、ベースモデルよりも感情分類性能が向上するが、大規模多言語XLM-RoBERTaモデルではF1スコアが最適である。
論文 参考訳(メタデータ) (2020-07-24T14:48:27Z) - Recipes for Adapting Pre-trained Monolingual and Multilingual Models to
Machine Translation [50.0258495437314]
機械翻訳(MT)における事前学習モデルの微調整において、凍結パラメータの利点と欠点と新しいパラメータの追加について検討する。
BARTでは、モデルパラメータの大部分を凍結し、追加の位置埋め込みを追加することで、最高のパフォーマンスを得ることができます。
mBARTでは、ほとんどの言語ペアがエンコーダで、ほとんどのデコーダはフリーズして、素早い微調整のパフォーマンスにマッチするか、向上します。
論文 参考訳(メタデータ) (2020-04-30T16:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。