論文の概要: ConlangBench: Exploring Language Knowledge and Learning in LLMs through Diverse Constructed Languages
- arxiv url: http://arxiv.org/abs/2608.03505v2
- Date: Wed, 05 Aug 2026 01:59:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.256566
- Title: ConlangBench: Exploring Language Knowledge and Learning in LLMs through Diverse Constructed Languages
- Title(参考訳): ConlangBench:多言語構成言語によるLLMにおける言語知識と学習の探索
- Authors: Jinhong Jeong, Seungyeop Yi, Sangah Lee, Youngjae Yu,
- Abstract要約: ConlangBenchは、大規模言語モデルの評価とトレーニングのための最初の大規模ベンチマークである。
我々は21M以上のコンラング-英語並列文対(20の非エスペラント・コンラングにまたがる430K対を含む)と321K語彙のエントリを収集した。
ConlangBenchのトレーニングはまた、モデルが十分な並列コーパスが利用可能な8つのコンラングすべてを学ぶことができることを示している。
- 参考スコア(独自算出の注目度): 21.243559466259004
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Constructed languages (conlangs) are intentionally created human languages with a rich tradition of linguistic creativity. Despite their potential for studying language learning in large language models (LLMs), existing conlangs remain largely underexplored in LLM research. We present ConlangBench, the first large-scale benchmark for evaluating and training LLMs on 21 existing conlangs. We collect over 21M conlang-English parallel sentence pairs (including 430K pairs across the 20 non-Esperanto conlangs) and 321K vocabulary entries. In bidirectional translation experiments, we find that models perform better on a posteriori conlangs, whose vocabularies are derived from natural languages, reflecting the design characteristics of conlangs. Training on ConlangBench also shows that models can learn all eight conlangs for which sufficient parallel corpora are available, while their learning curves vary depending on how the conlangs were created. Our findings suggest that conlangs provide a unique testbed for investigating how LLMs acquire low-resource languages.
- Abstract(参考訳): 構築された言語(コンラング)は、言語創造性の豊かな伝統を持つ故意に作られた人間の言語である。
大規模言語モデル(LLM)における言語学習の可能性を秘めているが、既存のコンラングはLLM研究においてほとんど未発見のままである。
提案するConlangBenchは,21のコンラング上でLLMを評価し,トレーニングするための,最初の大規模ベンチマークである。
我々は21M以上のコンラング-英語並列文対(20の非エスペラント・コンラングにまたがる430K対を含む)と321K語彙のエントリを収集した。
双方向翻訳実験では, 語彙が自然言語から派生した後行コンラングにおいて, モデルの性能が向上し, コンラングの設計特性が反映されることがわかった。
ConlangBenchのトレーニングはまた、モデルが十分な並列コーパスが利用可能な8つのコンラングすべてを学ぶことができる一方で、その学習曲線がコンラングの生成方法によって異なることを示している。
この結果から,LLMが低リソース言語をいかに獲得するかを調査するために,コンラングがユニークなテストベッドを提供する可能性が示唆された。
関連論文リスト
- One ruler to measure them all: Benchmarking multilingual long-context language models [31.669282956425658]
我々は26言語にわたる長文言語モデルを評価するために設計された多言語ベンチマークONERULERを提案する。
英語は、長文タスク(26語中6位)における最高のパフォーマンス言語ではなく、ポーランド語が最上位言語として登場した。
異なる言語で命令とコンテキストが現れる言語間シナリオでは、命令言語によってパフォーマンスが最大20%変動する。
論文 参考訳(メタデータ) (2025-03-03T19:12:48Z) - Randomly Sampled Language Reasoning Problems Elucidate Limitations of In-Context Learning [9.75748930802634]
機械学習の性能を向上させるために,テキスト内学習の能力について検討する。
非常に単純なドメインを考える: 単純な言語タスクにおける次のトークン予測。
この課題において LLM は n-gram モデルに一様に劣ることがわかった。
論文 参考訳(メタデータ) (2025-01-06T07:57:51Z) - Dictionary Insertion Prompting for Multilingual Reasoning on Multilingual Large Language Models [52.00446751692225]
textbfDictionary textbfInsertion textbfPrompting (textbfDIP) という,新規かつシンプルで効果的な方法を提案する。
非英語のプロンプトを提供する際、DIPは単語辞書を調べ、単語の英語のプロンプトをLLMのプロンプトに挿入する。
そして、英語へのより良い翻訳とより良い英語モデル思考のステップを可能にし、明らかにより良い結果をもたらす。
論文 参考訳(メタデータ) (2024-11-02T05:10:50Z) - Understanding and Mitigating Language Confusion in LLMs [76.96033035093204]
我々は,既存の英語および多言語プロンプトを用いた15の型的多様言語の評価を行った。
Llama Instruct と Mistral のモデルでは,言語的混乱の度合いが高いことがわかった。
言語混乱は,数発のプロンプト,多言語SFT,選好調整によって部分的に緩和できることがわかった。
論文 参考訳(メタデータ) (2024-06-28T17:03:51Z) - The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language Variants [80.4837840962273]
私たちは122の言語変種にまたがるデータセットであるBelebeleを紹介します。
このデータセットは、高、中、低リソース言語におけるテキストモデルの評価を可能にする。
論文 参考訳(メタデータ) (2023-08-31T17:43:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。