論文の概要: LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language
- arxiv url: http://arxiv.org/abs/2605.09015v1
- Date: Sat, 09 May 2026 15:54:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.021609
- Title: LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language
- Title(参考訳): LLiMba: Sardinian on a Single GPU -- 3B言語モデルを消滅したロマンス言語に適用する
- Abstract要約: LLiMbaは、Qwen2.5-3B-Instructを継続事前訓練(CPT)により適応した3BパラメータSardinian-readyモデルである。
コーパスには1150万個のサルデーニャ文字の LSC,Logudorese,Campidanese のトークンが含まれており,ぼやけたレジスタに対するリプレイとして,関連するロマンス文字の 2.4万個のトークンが拡張されている。
一致した条件下では、フル微調整、LoRA r64、rsLoRA r128、rsLoRA r256、DoRA r256の5つのSFT構成を比較する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sardinian, a Romance language with roughly one million speakers, has minimal presence in modern NLP. Commercial services do not support it, and current language models do not produce it reliably. We present LLiMba, a 3B parameter Sardinian-ready model adapted from Qwen2.5-3B-Instruct through continued pretraining (CPT) and supervised fine-tuning (SFT) on a single 24 GB consumer GPU. The corpus contains 11.5 million tokens of Sardinian spanning LSC, Logudorese, and Campidanese, augmented with 2.4 million tokens of related Romance text as replay against register blurring. After CPT the model reaches a perplexity of 6.76 on held out Sardinian and outperforms the base across all six FLORES-200 directions. We compare five SFT configurations under matched conditions: full fine-tuning, LoRA r64, rsLoRA r128, rsLoRA r256, and DoRA r256. rsLoRA r256 wins on every direction into Sardinian, reaching 28.5 BLEU from English against 17.3 after CPT and 21.0 with full fine-tuning. The rank ablation places r128 between LoRA r64 and rsLoRA r256 on BLEU but reveals failure modes invisible to the metric, including leakage across scripts no other variant produces. LoRA r64 retains less factual content from SFT than configurations at higher rank and produces more confident fabrications, though all methods fabricate on content absent from training. DoRA r256 yields the smallest gap between training and evaluation but the worst factual accuracy. The findings indicate that adapter capacity matters more than the choice among LoRA variants for adapting a Romance pretrained base to a low resource Romance target, that stronger regularization is not uniformly beneficial, and that translation metrics smoothly order configurations whose qualitative behavior differs categorically. Perplexity comparisons across scripts must account for byte fallback tokenization, which deflates the metric for scripts other than Latin.
- Abstract(参考訳): 約100万人の話者を持つロマンス語であるサルデーニャ語は、現代のNLPではほとんど存在していない。
商用サービスはそれをサポートしておらず、現在の言語モデルはそれを確実に生産していない。
本稿では,Qwen2.5-3B-Instructをベースとした3BパラメータSardinian-readyモデルであるLLiMbaを提案する。
コーパスには1150万のサルデーニャ文字の LSC, Logudorese, Campidanese のトークンが含まれており、レジスタのぼやけに対するリプレイとして、関連するロマンス文字の 2.4万のトークンが拡張されている。
CPT後、モデルはサルデーニャ語で6.76の難易度に達し、6つのFLORES-200方向すべてでベースを上回っている。
一致した条件下では、フル微調整、LoRA r64、rsLoRA r128、rsLoRA r256、DoRA r256の5つのSFT構成を比較する。
rsLoRA r256はサルデーニャの全ての方向で勝利し、CPT後17.3で英語から28.5BLEU、フル微調整で21.0で勝利した。
ランクアブレーションでは、LORA r64とrsLoRA r256の間のr128をBLEUに配置するが、他の変種が生成しないスクリプト間のリークを含む、メトリクスに見えない障害モードを明らかにする。
LoRA r64 は SFT のコンテントを上位のコンフィグレーションよりも低く保ち、信頼性の高いコンフィグレーションを生成する。
DoRA r256は、トレーニングと評価の間の最小のギャップを得るが、最悪の事実精度を得る。
この結果から,ローマンス事前学習ベースを低資源のロマンスターゲットに適応するためのLoRA変種の選択よりも,より強い正規化が一様に有用でないこと,質的振る舞いが異なる構成をスムーズに順序付けできることが示唆された。
スクリプト間のパープレキシティ比較は、ラテン語以外のスクリプトのメトリックを宣言するバイトフォールバックトークン化を考慮しなければならない。
関連論文リスト
- Bekko Embedding: Parameter-Efficient Multilingual Retrieval with Ultra-Compact Encoders [0.0]
以下はBekko Embeddingの最小モデルであるBekko-embedding-v1-a8mで、8Mのアクティブパラメータ (AP) 以下である。
MMTEB Multilingual v2 Retrievalでは、多言語e5ファミリーとBGE-M3(APの40倍)の上に56.2得点する。
高品質のbekko-embedding-v1-a25m (わずか25M AP)は、gte-multilingual-baseと同等の57.5mに達し、Multilingual NanoBEIR (14言語)がこの傾向を確認している。
論文 参考訳(メタデータ) (2026-07-28T01:13:37Z) - Procedural Knowledge Is Not Low-Rank: Why LoRA Fails to Internalize Multi-Step Procedures [1.6214121783846343]
我々は,LoRAが効率の優位性を維持するランクにおいて,完全な微調整に間に合わないことを示す。
発見は、手続き的なタスクが完全な微調整にかなり足りていないことを証明している。
論文 参考訳(メタデータ) (2026-05-23T17:06:02Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - Polyglot-Lion: Efficient Multilingual ASR for Singapore via Balanced Fine-Tuning of Qwen3-ASR [1.7802147489386628]
本稿ではシンガポールの言語景観に合わせたコンパクトな多言語自動音声認識(ASR)モデルであるPolyglot-Lionを紹介する。
提案手法は,Qwen3-ASR-0.6BとQwen3-ASR-1.7Bを公開音声コーパスのみに微調整することで得られる。
4つの言語にまたがる12のベンチマークで、Polyglot-Lion-1.7Bは平均エラーレート14.85に達し、MERaLiON-2-10B-ASR (14.32)と競合する。
推論スループットはMERaLiONの0.10 s/sampleより約20倍速い
論文 参考訳(メタデータ) (2026-03-17T07:09:42Z) - Parameter-Efficient Fine-Tuning for Low-Resource Languages: A Comparative Study of LLMs for Bengali Hate Speech Detection [0.0]
本稿では,LoRAとQLoRAを用いたベンガルヘイトスピーチ検出におけるPEFT(Efficient Fine-Tuning)の最初の応用について述べる。
BD-SHSデータセットには50,281の注釈付きコメントが記載されている。
Llama-3.2-3Bは92.23%、Mistral-7Bは88.94%、Gemma-3-4Bは80.25%だった。
論文 参考訳(メタデータ) (2025-10-19T20:03:22Z) - Faster Than SVD, Smarter Than SGD: The OPLoRA Alternating Update [50.36542772932594]
Low-Rank Adaptation (LoRA) は、凍結重量の上の低ランク更新を学習することで、大きなモデルを微調整する。
ローランクプロジェクションによる完全なトレーニング(SVDLoRA)とLoRAファインチューニングの間にはまだギャップがあり、LoRAのステップをさらに改善できることを示している。
論文 参考訳(メタデータ) (2025-09-24T10:32:50Z) - Vuyko Mistral: Adapting LLMs for Low-Resource Dialectal Translation [0.0]
本稿では,ウクライナのフツル方言に大規模な言語モデルを適用するための最初の取り組みを紹介する。
我々は、9852語対標準ウクライナ語の文対と7320語の単語マッピングの辞書の並列コーパスを作成しました。
論文 参考訳(メタデータ) (2025-06-09T10:30:35Z) - Large Language Diffusion Models [93.26422905620008]
大規模言語モデル(LLM)は自己回帰モデル(ARM)に依存していると考えられている。
我々は,事前学習および教師付き微調整パラダイムの下で,ゼロから学習した拡散モデルであるLLaDAを紹介する。
一般的なタスクや数学、コードなどに関する広範なベンチマークを通じて、LLaDAは強力なスケーラビリティを示し、自己構築されたARMベースラインと互換性のあるパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-02-14T08:23:51Z) - PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning? [3.9018931027384056]
本研究では,SLM(Small Generative Language Model)のドメイン特化事前学習が,ドメイン特化トークン化とCoT(Chain-of-Thought)命令の微調整が競合性能に与える影響について検討した。
パラマヌ・ガニータ(Paramanu-Ganita)は2億8800万のパラメータを持つ新規デコーダのみのオートレグレッシブSLMを数学で紹介する。
論文 参考訳(メタデータ) (2024-04-22T17:55:56Z) - SiRA: Sparse Mixture of Low Rank Adaptation [63.926732717719354]
我々は「スパース」計算を活用することの重要性について検討し、低ランクのスパース混合SiRAを提案する。
具体的には、各専門家が処理できるトークンの最大数を制限するキャパシティ制限付きの、トップ$k$のエキスパートルーティングを強制する。
論文 参考訳(メタデータ) (2023-11-15T18:15:37Z) - LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models [67.58275666573496]
LongLoRAは、トレーニング済みの大規模言語モデルのコンテキストサイズを拡張する、効率的な微調整アプローチである。
7B/13Bから70BまでのLlama2モデル上での各種タスクに対する実験結果が強かった。
論文 参考訳(メタデータ) (2023-09-21T17:59:11Z) - LACoS-BLOOM: Low-rank Adaptation with Contrastive objective on 8 bits
Siamese-BLOOM [2.9327503320877457]
意味的に意味のある単語の埋め込みを生成するために最適化された多言語大言語モデルである8ビットのSiamese-BLOOMを提案する。
文類似度分類のために,スケーラブルアダプタ(LoRA)と8ビットAdamでBLOOMを微調整する。
実験の結果,LACoS-BLOOMからの学習した埋め込みの質は,モデルパラメータの数とラベルなしトレーニングデータの量に比例することがわかった。
論文 参考訳(メタデータ) (2023-05-10T18:26:42Z) - ParroT: Translating during Chat using Large Language Models tuned with
Human Translation and Feedback [90.20262941911027]
ParroTはチャット中の翻訳機能を強化し、規制するフレームワークである。
具体的には、ParroTは、翻訳データを命令フォロースタイルに書き換える。
本稿では,ParroTモデルを微調整するための3つの命令タイプを提案する。
論文 参考訳(メタデータ) (2023-04-05T13:12:00Z) - LoRA: Low-Rank Adaptation of Large Language Models [71.75808607987281]
Low-Rank Adaptation (LoRA)はトレーニング済みモデルの重みを凍結し、トレーニング可能な階数分解をTransformerアーキテクチャの各層に注入する。
GPT-3では、LoRAはトレーニング可能なパラメータの数を1万倍に減らし、計算ハードウェアの要求をフル微調整の3倍に削減できる。
論文 参考訳(メタデータ) (2021-06-17T17:37:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。