論文の概要: From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference
- arxiv url: http://arxiv.org/abs/2607.24585v1
- Date: Mon, 27 Jul 2026 15:51:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.486196
- Title: From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference
- Title(参考訳): データからデバイスへ: ELMOD : モバイル推論のための効率的なドイツ語2.7B言語モデル
- Authors: Darina Gold, Alexander Schwirjow, Viktor Haag, Viktor Hangya, Joel Schlotthauer, Fabian Küch, Luzian Hahn,
- Abstract要約: 資源制約のあるハードウェア上で効率的な推論を行うためのコンパクト (2.7B) な言語モデル ELMOD を提案する。
我々は、形態的変化、複合化、そして正書法を扱う英語指向のものと異なる、ドイツ固有のデータ前処理スイートを開発した。
- 参考スコア(独自算出の注目度): 35.976547580375176
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present ELMOD - Efficient Language Model for On-Device Deployment - a compact (2.7B) German language model designed for efficient inference on resource-constrained hardware. ELMOD was trained on a limited computational budget (55k H100 GPU hours) using exclusively publicly available data. We developed a suite of German-specific data pre-processing, which differ from English-oriented counterparts in their handling of morphological variation, compounding, and orthographic conventions. Furthermore, we introduced a quality filtering and rephrasing step, which increased the instructional quality of the data, improved performance during the annealing phase, and reduced overall compute requirements. Thanks to our architectural model and data choices, including prefiltering, our educational-quality filtering and rephrasal to raise the educational-quality, ELMOD is the strongest performer in its size class (<3B), matching the performance of 7B-parameter models in German.
- Abstract(参考訳): ELMOD - オンデバイスデプロイのための効率的な言語モデル - リソース制約のあるハードウェア上での効率的な推論のために設計されたコンパクトな(2.7B)ドイツの言語モデルを提案する。
ELMODは、限られた計算予算(55k H100 GPU時間)で、公開データのみを使用して訓練された。
我々は、形態的変化、複合化、そして正書法を扱う英語指向のものと異なる、ドイツ固有のデータ前処理スイートを開発した。
さらに,データの品質を向上し,アニール時の性能を改善し,全体の計算要求を低減させる品質フィルタリングとリフレージングのステップも導入した。
私たちのアーキテクチャモデルとデータ選択のおかげで、事前フィルタリング、教育品質のフィルタリング、そして教育品質を上げるための言い換えのおかげで、ELMODは、ドイツの7Bパラメーターモデルのパフォーマンスに匹敵する、そのサイズクラス(3B)で最強のパフォーマーである。
関連論文リスト
- Adapting Where It Matters: Depth-Aware Adaptation for Efficient Multilingual Speech Recognition in Low-Resource Languages [11.808922632545874]
我々は多言語自動音声認識モデルを分析し、U字型適応パターンを明らかにする。
本稿では,各レイヤの役割に応じて適応能力を割り当てる,深層対応モデル適応フレームワークDAMAを提案する。
Damaは、最先端の精度とトレーニング可能なパラメータを80%削減し、極端なデータ不足下で29%のエラー削減を実現し、ベースラインよりもメモリ、トレーニング時間、計算効率を大幅に改善する。
論文 参考訳(メタデータ) (2026-02-01T04:18:31Z) - Improving LLMs for Machine Translation Using Synthetic Preference Data [0.0]
比較的少ないデータ資源を用いて,機械翻訳において汎用的な命令をいかに改善できるかを考察する。
Slovene大言語モデルを用いて、優先度最適化(DPO)を用いたGaMSBインストラクトモデルを改善する。
我々は2つのLLM、GaMSBInstructとEuroLLM-9BInstructを使って、英語のウィキペディア記事を翻訳することでトレーニングを作成した。
ベースラインモデルと比較して、微調整されたモデルは、ウィキペディアの記事の翻訳でCOMETのスコアが0.04と0.02に達した。
論文 参考訳(メタデータ) (2025-08-20T14:24:16Z) - Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs [111.69640966866059]
ミキチャー・オブ・エキスパート(MoE)と1兆近いパラメータを持つ疎大言語モデル(LLM)が、最も有能な言語モデルの領域を支配している。
本稿では,Ascend NPU上でそのようなスケールを利用するレシピを明らかにすることを目的としている。
主な目的は、動的スパースモデル構造下でのコンピューティングリソースのより良い使用と、実際のハードウェアで期待されるパフォーマンス向上の実現である。
論文 参考訳(メタデータ) (2025-05-07T15:46:36Z) - Aleph-Alpha-GermanWeb: Improving German-language LLM pre-training with model-based data curation and synthetic data generation [6.6723686572805185]
本稿では,モデルに基づくフィルタリング手法と合成データ生成を組み合わせたドイツ語データセットパイプラインを提案する。
パイプラインを使用して、大規模なドイツの事前トレーニングデータセットであるAleph-Alpha-GermanWebを作成します。
MMMLUを含むドイツ語のベンチマークの比較では、FineWeb2だけでAleph-Alpha-GermanWebのパフォーマンスが大幅に向上している。
論文 参考訳(メタデータ) (2025-04-24T17:23:46Z) - How to Learn a New Language? An Efficient Solution for Self-Supervised Learning Models Unseen Languages Adaption in Low-Resource Scenario [72.02391485962127]
音声認識(ASR)における音声自己監視学習(SSL)モデルの性能向上
低リソース言語 ASR では、事前訓練された言語と低リソース言語のドメインミスマッチ問題に遭遇する。
これらの問題に対処するためのアダプタに基づく従来型の効率的な微調整手法を拡張した。
論文 参考訳(メタデータ) (2024-11-27T10:51:00Z) - ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets [106.7760874400261]
本稿では、事前訓練されたSSLと教師付き音声モデルを評価するための新しいベンチマークであるML-SUPERB2.0を提案する。
ML-SUPERBのセットアップよりも性能が向上するが、性能は下流モデル設計に依存している。
また、言語とデータセットのパフォーマンスに大きな違いがあることから、よりターゲットを絞ったアプローチの必要性も示唆されている。
論文 参考訳(メタデータ) (2024-06-12T21:01:26Z) - Efficient Speech Translation with Pre-trained Models [13.107314023500349]
本研究では,事前学習モデルに基づいて,ケースドとエンド・ツー・エンドの音声翻訳システムを構築するための効率的な手法を検討する。
エンド・ツー・エンドのモデルはカスケードモデルよりも優れた翻訳性能を示すが、この技術の適用はエンド・ツー・エンドのトレーニングデータの追加の必要性に制限がある。
論文 参考訳(メタデータ) (2022-11-09T15:07:06Z) - Unsupervised Paraphrasing with Pretrained Language Models [85.03373221588707]
教師なし環境で,事前学習した言語モデルを用いて高品質なパラフレーズを生成する訓練パイプラインを提案する。
提案手法は,タスク適応,自己スーパービジョン,動的ブロッキング(Dynamic Blocking)という新しい復号アルゴリズムから構成される。
提案手法は,Quora Question PairとParaNMTの両方のデータセット上で,最先端の性能を達成できることを示す。
論文 参考訳(メタデータ) (2020-10-24T11:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。