論文の概要: Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion
- arxiv url: http://arxiv.org/abs/2604.18106v1
- Date: Mon, 20 Apr 2026 11:24:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.831746
- Title: Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion
- Title(参考訳): マルチソース動的ロジット融合による高効率低リソース言語適応
- Authors: Chen Zhang, Jiuheng Lin, Zhiyuan Liao, Yansong Feng,
- Abstract要約: TriMixはテスト時のロジット融合フレームワークで、3つの異なるソースからの能力のバランスをとる。
データと計算効率が良く、LRLのタスクアノテーションは必要ありません。
- 参考スコア(独自算出の注目度): 20.033024612866004
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Adapting large language models (LLMs) to low-resource languages (LRLs) is constrained by the scarcity of task data and computational resources. Although Proxy Tuning offers a logit-level strategy for introducing scaling effects, it often fails in LRL settings because the large model's weak LRL competence might overwhelm the knowledge of specialized smaller models. We thus propose TriMix, a test-time logit fusion framework that dynamically balances capabilities from three different sources: LRL competence from a continually pretrained small model, task competence from high-resource language instruction tuning, and the scaling benefits of large models. It is data- and compute-efficient, requiring no LRL task annotations, and only continual pretraining on a small model. Experiments across four model families and eight LRLs show that TriMix consistently outperforms single-model baselines and Proxy Tuning. Our analysis reveals that prioritizing the small LRL-specialized model's logits is crucial for success, challenging the prevalent large-model-dominant assumption.
- Abstract(参考訳): 大規模言語モデル(LLM)を低リソース言語(LRL)に適応することは,タスクデータや計算資源の不足によって制約される。
Proxy Tuningは、スケーリング効果を導入するためのロジットレベルの戦略を提供するが、大きなモデルの弱いLRL能力が特別な小さなモデルの知識を圧倒する可能性があるため、LRL設定では失敗することが多い。
そこで我々は,3つのソースから動的に能力のバランスをとるテスト時ロジット融合フレームワークであるTriMixを提案する。
データと計算効率が良く、LRLのタスクアノテーションは必要ありません。
4つのモデルファミリと8つのLRLでの実験では、TriMixはシングルモデルベースラインとプロキシチューニングを一貫して上回っている。
解析の結果,小型LRL特化モデルのロジットの優先順位付けは成功に不可欠であることが判明した。
関連論文リスト
- Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories [33.872433985210876]
視覚-言語-アクション(VLA)モデルの事前訓練には、多種多様な高品質な操作軌跡が必要となる。
本稿では,VLA事前学習のための複数の異なる高精度な行動パターンを生成するDiscover,Lea rn,Reinforceを提案する。
ダウンストリームのタスクスイートに適応すると、VLAモデルは、同じサイズの標準RLデータセットでトレーニングされたデータセットよりも、多様なRLデータで事前訓練された。
論文 参考訳(メタデータ) (2025-11-24T07:54:49Z) - Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratch [63.40752011615843]
ツール強化言語モデルのトレーニングは、複雑なタスクの能力を高めるための有望なアプローチとして登場した。
規則に基づく強化学習のための動的一般化誘導型報酬設計を提案する。
本研究では,SFTモデルとRL-with-SFTモデルと比較して7%以上の性能向上を実現していることを示す。
論文 参考訳(メタデータ) (2025-11-02T16:33:45Z) - Reinforcement Learning Fine-Tunes a Sparse Subnetwork in Large Language Models [0.0]
強化学習(Reinforcement Learning, RL)の微調整では、モデルのパラメータの大部分を更新する必要があると仮定されることが多い。
我々はこの現象をRLにより引き起こされるパラメータ更新空間と呼ぶ。
このスパースサブネットワークのみを微調整することで、完全なモデル性能が回復し、完全に微調整されたモデルとほぼ同じパラメータが得られることを示す。
論文 参考訳(メタデータ) (2025-07-23T01:02:17Z) - Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning [93.00629872970364]
強化学習(Reinforcement Learning, RL)は, 複雑な推論タスクにおいて, 言語モデルの性能向上のための主要なパラダイムとなっている。
SPARKLE(SPARKLE)は、3つの重要な次元にわたるRLの効果を詳細に解析するフレームワークである。
我々は、RL信号と混合品質の推論トレースを産出しない難題が、依然としてトレーニングに有効であるかどうかを調査する。
論文 参考訳(メタデータ) (2025-06-05T07:53:59Z) - RAST: Reasoning Activation in LLMs via Small-model Transfer [33.32587030836428]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なアプローチとなっている。
大規模にRLを適用することは、潜在的にリソース集約であり、複数のモデルコピーと広範なGPUワークロードを必要とします。
本稿では、RL学習モデルからRL学習モデルからより大規模なモデルにRL誘導確率調整を注入することにより、推論挙動を伝達する簡易かつ効果的なRASTを提案する。
論文 参考訳(メタデータ) (2025-05-30T17:57:08Z) - Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining [74.83412846804977]
強化学習(RL)に基づく微調整は、訓練後の言語モデルにおいて重要なステップとなっている。
数理推論のためのRLファインタニングを、スクラッチから完全にトレーニングモデルを用いて体系的にエンドツーエンドに研究する。
論文 参考訳(メタデータ) (2025-04-10T17:15:53Z) - Unlocking the Potential of Model Merging for Low-Resource Languages [66.7716891808697]
大規模言語モデルを新しい言語に適応させるには、通常、継続事前訓練(CT)と、教師付き微調整(SFT)が含まれる。
我々は低リソース言語の代替としてモデルマージを提案し、異なる機能を持つモデルを追加トレーニングなしで単一のモデルに組み合わせる。
Llama-2-7Bをベースとした実験により、モデルマージはタスク解決能力の低い低リソース言語に対して、極めて少ないデータを持つシナリオにおいて、CT-then-SFTよりも優れていることが実証された。
論文 参考訳(メタデータ) (2024-07-04T15:14:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。