論文の概要: CantoneseLLM v2: Reasoning in a Low-Resource Language
- arxiv url: http://arxiv.org/abs/2609.06970v1
- Date: Mon, 07 Sep 2026 03:08:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:58:38.774925
- Title: CantoneseLLM v2: Reasoning in a Low-Resource Language
- Title(参考訳): CantoneseLLM v2: 低リソース言語での推論
- Authors: Tsz Chung Cheng, Chung Shing Cheng, Chaak Ming Lau, Cheuk Hei Chong,
- Abstract要約: カントン語は広く話されているが、手書きのデータでは低リソースである。
我々は,Qwen3 8B と 30B-A3B をモデルとした CantoneseLLM v2 を開発した。
- 参考スコア(独自算出の注目度): 0.8166364251367626
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cantonese is widely spoken but remains low-resource in written data, with no large corpus of native Cantonese reasoning traces available for model training. We develop and release CantoneseLLM v2, comprising models based on Qwen3 8B and 30B-A3B. The models are trained through CPT on 784 million Cantonese and Hong Kong-related tokens, chat-vector merging, SFT, DPO, and RLVR. Evaluation across the training stages shows that chat-vector merging transfers instruction following but preserves the donor model's reasoning language, while SFT with limited Cantonese reasoning data substantially shortens or removes reasoning traces and reduces benchmark performance. DPO restores the reasoning-block format, particularly for the 8B model, but recovers only part of the lost performance. The RLVR training with Cantonese language and Traditional Chinese scripts as multiplicative constraints introduced Cantonese language alignment and restored the lost performance. The 30B-A3B model reaches 73.16 on HKCanto-Eval, within 1.20 points of its merged checkpoint, while retaining the Cantonese reasoning behaviour absent from that checkpoint. We release the model checkpoints, the training environments, and a thirteen-year Traditional Chinese Common Crawl dataset. The models can be accessed at https://huggingface.co/collections/hon9kon9ize/cantonesellm-v20
- Abstract(参考訳): カントン語は広く話されているが、手書きのデータでは依然として低リソースであり、モデルトレーニングで利用可能なカントン語の起源の大規模なコーパスは存在しない。
我々は,Qwen3 8B と 30B-A3B をモデルとした CantoneseLLM v2 を開発した。
これらのモデルは、CPTを通じて、7億8400万のカントンと香港関連のトークン、チャットベクターのマージ、SFT、DPO、RLVRでトレーニングされている。
トレーニング段階にわたる評価では、チャットベクターのマージは命令に従うが、ドナーモデルの推論言語を保存する。
DPOは、特に8Bモデルのために、推論ブロックフォーマットを復元するが、失われたパフォーマンスの一部を回復する。
カントン言語と伝統的な中国語のスクリプトによるRLVRトレーニングは、カントン言語のアライメントを導入し、失われたパフォーマンスを回復させた。
30B-A3BモデルはHKCanto-Eval上で73.16に達し、統合されたチェックポイントから1.20ポイント以内に到達する。
モデルチェックポイント、トレーニング環境、13年にわたる伝統的な中国のコモンクローリングデータセットをリリースする。
モデルはhttps://huggingface.co/collections/hon9kon9ize/cantonesellm-v20でアクセスできる。
関連論文リスト
- Do Cantonese-Adapted Language Models Better Predict Cantonese Reading? A Cross-Model Eye-Tracking Evaluation [9.253073076886182]
CKIP GPT-2 Tinyと軽量カントン適応JED351誘導体,Qwen2.5-7BとカントンLLM-7Bの比較を行った。
目的は, 語彙素因, POS素因, エントロピー, エントロピー低下であった。
結果は、より広範なカントン固有の訓練が、より強力な予測適合と結びつくことを示唆している。
論文 参考訳(メタデータ) (2026-09-02T06:24:34Z) - Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models [62.054835560934066]
Next Concept Predictionは、Next Token Predictionの上に構築された、ジェネレーティブな事前学習パラダイムである。
我々のモデルであるConceptLMは、ベクトル量子化を用いて隠れ状態の定量化を行い、概念語彙を構築する。
13のベンチマークの結果、NCPは従来のトークンレベルのモデルよりも一貫したパフォーマンス向上をもたらすことが示された。
論文 参考訳(メタデータ) (2026-02-09T18:33:31Z) - \textsc{CantoNLU}: A benchmark for Cantonese natural language understanding [2.6328168463115684]
我々は、カントン自然言語理解(NLU)のベンチマークであるtextsctextbfCantoNLUを紹介する。
このベンチマークは、単語感覚の曖昧さ、言語判断、言語検出、自然言語推論、感情分析、音声の一部タグ付け、依存性解析を含む、構文と意味論をカバーする7つのタスクにまたがる。
結果から, カントン適応モデルの方が総合的に優れ, 単言語モデルの方が構文的タスクにおいて優れていたことが示唆された。
論文 参考訳(メタデータ) (2025-10-23T15:47:27Z) - HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs [0.0]
HKCanto-Evalベンチマークは、カントン言語理解タスクにおける大きな言語モデルを評価するために設計されている。
香港固有の文化的・言語的なニュアンスを統合し、現実的なシナリオで言語モデルを評価するための堅牢な枠組みを提供する。
その結果,プロプライエタリなモデルは一般にオープンウェイトモデルより優れているが,カントン固有の言語的・文化的知識を扱う上では,大きな制限が残っていることが示唆された。
論文 参考訳(メタデータ) (2025-03-16T10:26:24Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - Textless Speech-to-Speech Translation With Limited Parallel Data [51.3588490789084]
PFBはテキストレスのS2STモデルをトレーニングするためのフレームワークで、数十時間の並列音声データしか必要としない。
3つのドメインで英語、ドイツ語、マラティー語、英語の翻訳をトレーニングし、評価する。
論文 参考訳(メタデータ) (2023-05-24T17:59:05Z) - Making Large Language Models Better Reasoners with Step-Aware Verifier [49.16750018427259]
DIVERSE(Diverse Verifier on Reasoning Step)は、言語モデルの推論能力をさらに強化する新しいアプローチである。
最新の言語モデルであるcode-davinci 上で DIVERSE を評価し,8つの推論ベンチマークのうち6つで新たな最先端結果が得られることを示す。
論文 参考訳(メタデータ) (2022-06-06T03:38:36Z) - Automatic Speech Recognition Datasets in Cantonese Language: A Survey
and a New Dataset [85.52036362232688]
私たちのデータセットは、香港のCandoneseオーディオブックから収集された、73.6時間のクリーンな読み上げ音声と書き起こしとの組み合わせで構成されています。
哲学、政治、教育、文化、ライフスタイル、家族の領域を組み合わせて、幅広いトピックをカバーしている。
MDCC と Common Voice zh-HK にマルチデータセット学習を適用することで,強力で堅牢な Cantonese ASR モデルを作成する。
論文 参考訳(メタデータ) (2022-01-07T12:09:15Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。