論文の概要: What Kind of Language is Easy to Language-Model Under Curriculum Learning?
- arxiv url: http://arxiv.org/abs/2604.26844v1
- Date: Wed, 29 Apr 2026 16:09:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.483557
- Title: What Kind of Language is Easy to Language-Model Under Curriculum Learning?
- Title(参考訳): カリキュラム学習下の言語モデルにとって、どのような言語が簡単か?
- Abstract要約: 多くの証明された言語は特徴の共通の構成を共有しており、類型的に非常に稀から非常に一般的な特徴の組み合わせのスペクトルを形成している。
一つの中心的な疑問は、そのようなタイプ的傾向を予測できる条件と、そのようなパターンを再現するのに言語モデルの学習バイアスが十分であるかどうかである。
この研究は、LMの帰納バイアスとの相互作用を研究するために、そのような分析(LMの学習シナリオ)に1つの次元性を加える。
- 参考スコア(独自算出の注目度): 9.692115036534187
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many of the thousands of attested languages share common configurations of features, creating a spectrum from typologically very rare (e.g., object-verb-subject word order) or impossible languages to very common combinations of features (e.g., subject-object-verb word order). One central question is under what conditions such typological tendencies can be predicted, and specifically whether the learning bias of language models (LMs) is sufficient to reproduce such patterns. In this study, we add one dimensionality to such analysis -- the learning scenario for LMs -- to explore its interaction with the inductive bias of LMs. Specifically, as a first study, we examine the effect of curriculum learning (CL), as a developmentally motivated learning scenario, i.e., starting with simpler sentences rather than randomly-ordered input. We expand existing LM-based exploration (El-Naggar et al., 2025a,b) with a simple CL variant and find that CL substantially impacts the apparent inductive bias of LMs.
- Abstract(参考訳): 何千もの証明された言語の多くは、特徴の共通の構成を共有しており、類型的に非常に稀な(例えば、オブジェクト・バーブ・サブジェクト語順)または不可能な言語から非常に共通の特徴の組み合わせ(例えば、主題・オブジェクト・バーブ語順)までスペクトルを形成している。
特に言語モデル(LM)の学習バイアスが、そのようなパターンを再現するのに十分かどうかについてである。
本研究では, LMの帰納的バイアスと相互作用を研究するために, このような分析, LMの学習シナリオに1つの次元性を加える。
具体的には,第1次研究として,ランダムに順序付けされた入力ではなく,単純な文から始まる発達的動機付け学習シナリオとして,カリキュラム学習(CL)の効果を検討する。
既存の LM ベースの探索 (El-Naggar et al , 2025a,b) を簡単な CL 変種で拡張し,CL が LM の明らかな帰納バイアスに大きく影響することを発見した。
関連論文リスト
- Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective [15.30367035674579]
大規模言語モデル(LLM)は、ファインチューニング(FT)とインコンテキスト学習(ICL)の2つの基本的な学習モードで動作する。
FTとICLを比較した以前の研究では、不整合な実験装置による混合と不整合の結果が得られた。
本稿では,正確な言語境界,制御された文字列サンプリング,データ汚染のない形式的な言語学習タスクを提案する。
論文 参考訳(メタデータ) (2026-04-25T12:19:25Z) - Can Language Models Learn Typologically Implausible Languages? [62.823015163987996]
人間の言語にまたがる文法的特徴は、人間の学習バイアスに起因する興味深い相関関係を示している。
言語モデル(LM)が言語普遍性におけるドメイン一般学習バイアスの役割をよりよく決定する方法について論じる。
本研究は,英語(頭初期)と日本語(頭最終)の超自然主義的だが反実的なバージョンを用いて,LMを試験する。
論文 参考訳(メタデータ) (2025-02-17T20:40:01Z) - Randomly Sampled Language Reasoning Problems Elucidate Limitations of In-Context Learning [9.75748930802634]
機械学習の性能を向上させるために,テキスト内学習の能力について検討する。
非常に単純なドメインを考える: 単純な言語タスクにおける次のトークン予測。
この課題において LLM は n-gram モデルに一様に劣ることがわかった。
論文 参考訳(メタデータ) (2025-01-06T07:57:51Z) - How Do Multilingual Language Models Remember Facts? [50.13632788453612]
これまでに同定された英語のリコール機構が多言語文脈に適用可能であることを示す。
我々は、リコール中の言語の役割をローカライズし、エンリッチメントが言語に依存しないことを発見した。
デコーダのみのLLMでは、FVは2つの異なる段階でこれらの2つの情報を構成する。
論文 参考訳(メタデータ) (2024-10-18T11:39:34Z) - Black Big Boxes: Do Language Models Hide a Theory of Adjective Order? [5.395055685742631]
英語や他の言語では、複雑な名詞句の複数の形容詞は、多くの言語理論の標的となった複雑な順序付けパターンを示している。
本稿では,人体における形容詞順選好(AOP)を説明するために設計された既存の仮説を概観し,言語モデルにおけるAOPを学習するための設定を開発する。
理論言語学で特定された因子によって生成される予測よりも,全てのモデルの予測が人間のAOPにずっと近いことが判明した。
論文 参考訳(メタデータ) (2024-07-02T10:29:09Z) - Understanding and Mitigating Language Confusion in LLMs [76.96033035093204]
我々は,既存の英語および多言語プロンプトを用いた15の型的多様言語の評価を行った。
Llama Instruct と Mistral のモデルでは,言語的混乱の度合いが高いことがわかった。
言語混乱は,数発のプロンプト,多言語SFT,選好調整によって部分的に緩和できることがわかった。
論文 参考訳(メタデータ) (2024-06-28T17:03:51Z) - What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages [78.1866280652834]
大規模言語モデル (LM) は文字列上の分布である。
RNNとTransformer LMによる規則的LM(RLM)の学習性について検討する。
RNNとトランスフォーマーの双方において,RLMランクの複雑さは強く,学習可能性の有意な予測因子であることが判明した。
論文 参考訳(メタデータ) (2024-06-06T17:34:24Z) - Evaluating Neural Language Models as Cognitive Models of Language
Acquisition [4.779196219827507]
我々は、ニューラルネットワークモデルの構文能力を評価するための最も顕著なベンチマークは、十分に厳密でないかもしれないと論じる。
小規模データモデリングによる子言語習得を訓練すると、LMは単純なベースラインモデルで容易にマッチングできる。
子どもの言語習得に関する実証的研究と、LMをよりよく結びつけるための提案をまとめて締めくくった。
論文 参考訳(メタデータ) (2023-10-31T00:16:17Z) - Augmented Language Models: a Survey [55.965967655575454]
この調査は、言語モデル(LM)が推論スキルとツールの使用能力で強化されているかのレビューを行う。
私たちはこれらをAugmented Language Models (ALMs)と呼ぶ。
トークンの目的の欠如により、ALMは標準的な自然言語タスクを実行しながら、推論、ツールの使用、さらには行動を学ぶことができる。
論文 参考訳(メタデータ) (2023-02-15T18:25:52Z) - Shortcut Learning of Large Language Models in Natural Language
Understanding [119.45683008451698]
大規模言語モデル(LLM)は、一連の自然言語理解タスクにおいて最先端のパフォーマンスを達成した。
予測のショートカットとしてデータセットのバイアスやアーティファクトに依存するかも知れません。
これは、その一般化性と敵対的堅牢性に大きな影響を与えている。
論文 参考訳(メタデータ) (2022-08-25T03:51:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。