論文の概要: When transformers learn "impossible" languages, what do they learn?
- arxiv url: http://arxiv.org/abs/2606.30815v1
- Date: Mon, 29 Jun 2026 18:42:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:18.971869
- Title: When transformers learn "impossible" languages, what do they learn?
- Title(参考訳): トランスフォーマーが"不可能"な言語を学ぶとき、何を学ぶのか?
- Abstract要約: 理論的に動機付けられた2つのリンク仮説を,文法的感受性の欠如や生成的生産に起因する不合理性について評価した。
英語の摂動的「不可能」な変種に基づいて訓練された GPT-2 スタイルモデルを用いて,文法性に対する感度を測定する。
モデルの性能は、言語の情報局所性によって、徐々に低下するのみであることがわかった。
- 参考スコア(独自算出の注目度): 9.276738475766512
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent work suggests that transformer language models show a bias towards human languages over unnatural ("impossible") languages argued to be unacquirable by humans. However, this literature has largely based these claims on differences in sample efficiency and test-set perplexity, rather than on direct evaluations of the linguistic capacities that could plausibly explain non-attestation in human languages. We evaluate two theoretically motivated linking hypotheses: impossibility arising from deficiencies in grammatical sensitivity or generative production. Using GPT-2 style models trained on perturbed "impossible" variants of English, we measure sensitivity to grammaticality using BLiMP minimal pairs, finding that model performance exhibits only gradual degradation, mediated by the language's information locality. In contrast, these models exhibited pronounced failures in generation, producing substantially fewer high-quality sentences at longer lengths. Together, these results suggest generative deficiency and transmission failures as a plausible linking hypothesis between language model behaviour and non-attestation of impossible languages.
- Abstract(参考訳): 最近の研究は、トランスフォーマー言語モデルが人間の言語に対する非自然な(不可能な)言語に対する偏見を示すことを示唆している。
しかしながら、この文献はこれらの主張を、人間の言語における非証明を合理的に説明できる言語能力の直接的な評価よりも、サンプル効率とテストセットの難易度の違いに基づいている。
理論的に動機付けられた2つのリンク仮説を,文法的感受性の欠如や生成的生産に起因する不合理性について評価した。
英語の摂動的「不可能」な変種に基づいて訓練された GPT-2 スタイルのモデルを用いて,BLiMP の最小ペアを用いて文法性に対する感受性を測定し,その言語の情報局所性によって,モデルの性能が徐々に低下することを発見した。
対照的に、これらのモデルは生成に顕著な失敗を示し、より長い長さで高品質な文を著しく減らした。
これらの結果から, 言語モデル行動と不可能な言語の非証明とのリンク仮説として, 生成不全と伝達障害が示唆された。
関連論文リスト
- A Unified Assessment of the Poverty of the Stimulus Argument for Neural Language Models [10.792630632317653]
本稿では, 質問形成, 島移動, その他の英語現象を対象とする, 学習・評価スイートであるposhbenchを紹介する。
直接的正の証拠がなくても、すべての現象に対する一般化の兆候が見つかる。
我々の発見は、自然構文が一般化への唯一の経路である、という主張に挑戦する。
論文 参考訳(メタデータ) (2026-02-10T17:16:29Z) - Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation [49.2073409243885]
大規模言語モデル(LLM)は、英語の対物生成に優れ、多言語習熟度を示す。
対象言語における直接生成された反事実と6言語間の英訳によって導出されるものの両方について自動評価を行う。
言語間で生成した偽物に一貫して現れる4つの主要なエラーを識別し分類する。
論文 参考訳(メタデータ) (2026-01-01T08:53:49Z) - Biasless Language Models Learn Unnaturally: How LLMs Fail to Distinguish the Possible from the Impossible [4.7831562043724665]
GPT-2は各言語と不可能な言語を等しく学習する。
パープレキシティ曲線上で計算された様々な指標の言語間差異を考慮することにより、GPT-2は可能と不可能を体系的に分離することができないことを示す。
論文 参考訳(メタデータ) (2025-10-08T16:17:13Z) - Anything Goes? A Crosslinguistic Study of (Im)possible Language Learning in LMs [14.78046527879077]
言語モデルをトレーニングして、不可能で、タイプミス的に証明されていない言語をモデル化します。
以上の結果から, GPT-2 の小型化により, 検証対象言語と不可能言語との完全分離が達成できないことが明らかとなった。
これらの結果は、LMは人間のような誘導バイアスを示すが、これらのバイアスは人間の学習者よりも弱いことを示唆している。
論文 参考訳(メタデータ) (2025-02-26T04:01:36Z) - Can Language Models Learn Typologically Implausible Languages? [62.823015163987996]
人間の言語にまたがる文法的特徴は、人間の学習バイアスに起因する興味深い相関関係を示している。
言語モデル(LM)が言語普遍性におけるドメイン一般学習バイアスの役割をよりよく決定する方法について論じる。
本研究は,英語(頭初期)と日本語(頭最終)の超自然主義的だが反実的なバージョンを用いて,LMを試験する。
論文 参考訳(メタデータ) (2025-02-17T20:40:01Z) - Understanding and Mitigating Language Confusion in LLMs [76.96033035093204]
我々は,既存の英語および多言語プロンプトを用いた15の型的多様言語の評価を行った。
Llama Instruct と Mistral のモデルでは,言語的混乱の度合いが高いことがわかった。
言語混乱は,数発のプロンプト,多言語SFT,選好調整によって部分的に緩和できることがわかった。
論文 参考訳(メタデータ) (2024-06-28T17:03:51Z) - Injecting structural hints: Using language models to study inductive
biases in language learning [40.8902073270634]
言語モデルに帰納バイアスを注入し,形式的構造化データに基づいて事前学習を行う。
次に, 学習者の言語学習能力の評価を行った。
非文脈自由な関係が最良の帰納バイアスとなることを示す。
論文 参考訳(メタデータ) (2023-04-25T18:00:08Z) - Discovering Latent Knowledge in Language Models Without Supervision [72.95136739040676]
既存の言語モデルをトレーニングするテクニックは、真実と正しく一致していない可能性がある。
本稿では,言語モデルの内部アクティベーション内部の潜伏知識を,純粋に教師なしの方法で直接見つけることを提案する。
本手法は, 教師なし, モデル出力がないにもかかわらず, 大規模言語モデルで表される多様な知識を復元できることを示す。
論文 参考訳(メタデータ) (2022-12-07T18:17:56Z) - Do Multilingual Language Models Capture Differing Moral Norms? [71.52261949766101]
大量多言語文表現は、未処理データの大規模なコーパスに基づいて訓練される。
これは、高資源言語からの道徳的判断を含む文化的価値をモデルが把握する原因となる可能性がある。
特定の言語におけるデータ不足は、ランダムで潜在的に有害な信念を発達させる可能性がある。
論文 参考訳(メタデータ) (2022-03-18T12:26:37Z) - Recurrent Neural Network Language Models Always Learn English-Like
Relative Clause Attachment [17.995905582226463]
英語とスペイン語のモデル性能を比較し,RNN LMにおける非言語的バイアスが英語の構文構造と有利に重なることを示す。
英語モデルは人間に似た構文的嗜好を習得しているように見えるが、スペイン語で訓練されたモデルは、同等の人間的な嗜好を取得できない。
論文 参考訳(メタデータ) (2020-05-01T01:21:47Z) - Limits of Detecting Text Generated by Large-Scale Language Models [65.46403462928319]
誤情報キャンペーンで使用される可能性があるため、長く一貫性のあるテキストを生成できる大規模な言語モデルが危険であると考える者もいる。
ここでは、仮説テスト問題として大規模言語モデル出力検出を定式化し、テキストを真あるいは生成されたものと分類する。
論文 参考訳(メタデータ) (2020-02-09T19:53:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。