論文の概要: Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung
- arxiv url: http://arxiv.org/abs/2607.08362v1
- Date: Thu, 09 Jul 2026 11:20:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.507869
- Title: Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung
- Title(参考訳): ベトナムの高地、デルタ、海岸を横切るエコー:Cham、Khmer、Tay-Nungのための多言語コーパス
- Abstract要約: Cham、Khmer、Tay-Nungは、スクリプト、ベトナムの接触、標準化において大きく異なっている。
これらの言語の最初のコーパスとベンチマークであるCKTNを紹介する。
既存の多言語エンコーダがこれらの言語を著しく断片化することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vietnam's ethnic minority languages are almost absent from the field of Natural Language Processing (NLP), and the challenge goes beyond data scarcity: Cham, Khmer, and Tay-Nung differ sharply in script, Vietnamese contact, and standardization, conditions under which standard multilingual adaptation can learn the wrong signals. We introduce CKTN, the first corpus and benchmark for these languages (44,367 documents, 24M subword tokens), spanning continued pretraining, category classification, and summary-document retrieval. We show that existing multilingual encoders severely fragment these languages, and that common adaptation metrics can mislead: models may lower language-modeling loss or excel at lexical-overlap retrieval while still failing at semantic generalization across documents. We address this with a script-aware adaptation recipe - vocabulary augmentation combined with calibrated replaced-token pretraining - that prevents the discriminator from exploiting trivial script mismatches. The result is an encoder with substantially less fragmentation and the strongest classification performance among evaluated models, exposing the limits of lexical-overlap retrieval as an evaluation signal.
- Abstract(参考訳): ベトナムの少数民族言語は、自然言語処理(NLP)の分野にほとんど欠落しており、その課題はデータの不足を越えている。
これらの言語の最初のコーパスとベンチマークであるCKTN(44,367の文書、24Mのサブワードトークン)、継続事前学習、カテゴリ分類、要約文書検索について紹介する。
既存の多言語エンコーダはこれらの言語を著しく断片化しており、共通適応指標は誤解を招く可能性がある。
スクリプト対応適応レシピ – 語彙拡張とキャリブレーションされたリプレーストケン事前学習 – で対処することで,識別者が自明なスクリプトミスマッチを悪用するのを防ぐことができる。
その結果, フラグメンテーションが著しく少なく, 評価されたモデルの中で最強の分類性能を有するエンコーダが, 語彙オーバラップ検索の限界を評価信号として明らかにした。
関連論文リスト
- Tokenizing Crosslingual Homographs [8.254230288283258]
多言語言語モデルは、限られた数のトークン単位内で複数の言語を表現するために、共有サブワード語彙に依存している。
我々はこの制限を言語間ホモグラフと偽の友人を通して検討する。
そこで本稿では,共有語彙単語の初期文字を置き換える言語固有の文字を用いた,単純なトークン化レベル介入を提案する。
論文 参考訳(メタデータ) (2026-07-20T08:37:31Z) - LANGSAE EDITING: Improving Multilingual Information Retrieval via Post-hoc Language Identity Removal [34.73949500194166]
多言語埋め込みは、セマンティクスと共に言語アイデンティティをエンコードする。
本稿では,プール埋め込みを訓練したポストホックスパースオートエンコーダであるLangSAE EDIINGを提案する。
複数の言語にわたる実験では、ランキング品質と言語間カバレッジが一貫して改善されている。
論文 参考訳(メタデータ) (2026-01-08T09:36:41Z) - Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation [50.93756215410832]
本稿では,デコード時にトークンをフィルタリングする軽量なプラグインソリューションであるLanguage Confusion Gate (LCG)を紹介する。
LCGは、標準調整自己蒸留を用いて訓練され、適切な言語ファミリーを予測し、必要に応じてマスクを適用する。
論文 参考訳(メタデータ) (2025-10-20T14:02:37Z) - Prompt Engineering Using GPT for Word-Level Code-Mixed Language Identification in Low-Resource Dravidian Languages [0.0]
インドのような多言語社会では、テキストはしばしばコードミキシングを示し、異なる言語レベルで現地の言語と英語をブレンドする。
本稿では,Dravidian言語における単語レベルのLI課題への対処を目的とした,共有タスクのプロンプトベース手法を提案する。
本研究では,GPT-3.5 Turboを用いて,大言語モデルが単語を正しいカテゴリに分類できるかどうかを検証した。
論文 参考訳(メタデータ) (2024-11-06T16:20:37Z) - Understanding and Mitigating Language Confusion in LLMs [76.96033035093204]
我々は,既存の英語および多言語プロンプトを用いた15の型的多様言語の評価を行った。
Llama Instruct と Mistral のモデルでは,言語的混乱の度合いが高いことがわかった。
言語混乱は,数発のプロンプト,多言語SFT,選好調整によって部分的に緩和できることがわかった。
論文 参考訳(メタデータ) (2024-06-28T17:03:51Z) - Soft Language Clustering for Multilingual Model Pre-training [57.18058739931463]
本稿では,インスタンスを条件付きで符号化するためのフレキシブルガイダンスとして,コンテキスト的にプロンプトを検索するXLM-Pを提案する。
我々のXLM-Pは、(1)言語間における言語不変および言語固有知識の軽量なモデリングを可能にし、(2)他の多言語事前学習手法との容易な統合を可能にする。
論文 参考訳(メタデータ) (2023-06-13T08:08:08Z) - Romanization-based Large-scale Adaptation of Multilingual Language
Models [124.57923286144515]
大規模多言語事前学習言語モデル (mPLMs) は,NLPにおける多言語間移動のデファクトステートとなっている。
我々は、mPLMをローマン化および非ロマン化した14の低リソース言語コーパスに適用するためのデータとパラメータ効率の戦略を多数検討し、比較した。
以上の結果から, UROMAN をベースとしたトランスリテラルは,多くの言語で高い性能を達成できることがわかった。
論文 参考訳(メタデータ) (2023-04-18T09:58:34Z) - Leveraging Adversarial Training in Self-Learning for Cross-Lingual Text
Classification [52.69730591919885]
本稿では,ラベル保存型入力摂動の最大損失を最小限に抑える半教師付き対向学習法を提案する。
多様な言語群に対する文書分類と意図分類において,有効性が著しく向上するのを観察する。
論文 参考訳(メタデータ) (2020-07-29T19:38:35Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。