論文の概要: Language Acquisition Device in Large Language Models
- arxiv url: http://arxiv.org/abs/2605.16758v1
- Date: Sat, 16 May 2026 02:13:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.009775
- Title: Language Acquisition Device in Large Language Models
- Title(参考訳): 大規模言語モデルにおける言語獲得装置
- Authors: Masato Mita, Taiga Someya, Ryo Yoshida, Yohei Oseki,
- Abstract要約: 本稿では,MERGE,AGREE,MOVEを介して,文字列が階層的な構成,特徴ベース依存性,長距離変位を符号化する形式言語MP-STRUCTの事前事前訓練を提案する。
C-RASPでは定義できないが、MP-STRUCT COREは$k$-Shuffle Dyckより優れている。
依存関係の解決の曖昧さを軽減する機能的なランドマークが重要なドライバであることを示す。
- 参考スコア(独自算出の注目度): 20.65039123567166
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large Language Models (LLMs) remain substantially less data-efficient than humans. Pre-pretraining (PPT) on synthetic languages has been proposed to close this gap, with prior work emphasizing highly expressive formal languages such as $k$-Shuffle Dyck. Inspired by the Language Acquisition Device (LAD) hypothesis, which posits that innate constraints preemptively restrict the learner's hypothesis space to natural-language-like structure, we propose LAD-inspired PPT: pre-pretraining on MP-STRUCT, a formal language whose strings encode hierarchical composition, feature-based dependencies, and long-distance displacement via MERGE, AGREE, and MOVE. A brief 500-step PPT with MP-STRUCT matches strong formal-language baselines in token efficiency while additionally imparting a human-like resistance to structurally implausible languages (e.g., REVERSE). Analyzing simplified variants, we find that MP-STRUCT CORE outperforms $k$-Shuffle Dyck despite not being definable in C-RASP (a formal bound on transformer expressivity), challenging the prior hypothesis that effective PPT languages must be both hierarchically expressive and circuit-theoretically learnable. We show that functional landmarks, which reduce dependency resolution ambiguity, are a key driver, suggesting that effective PPT design depends not only on expressivity but also on the accessibility of dependency resolution.
- Abstract(参考訳): 大規模言語モデル(LLM)は、人間よりもデータ効率が著しく低いままである。
合成言語における事前事前訓練(PPT)は、このギャップを埋めるために提案されており、以前の研究は、$k$-Shuffle Dyckのような表現力の高い形式言語を強調していた。
本稿では,Language Acquisition Device (LAD)仮説に触発され,学習者の仮説空間を自然言語的構造にプリエンプティブに制限したことを仮定し,Language Acquisition Device (LAD)仮説を提唱する。
MP-STRUCTを用いた簡単な500ステップのPPTは、トークン効率において強力な形式言語ベースラインと一致し、また、構造的に不明瞭な言語(例えばREVERSE)に対する人間のような抵抗を付与する。
C-RASPで定義できないにもかかわらず、MP-STRUCT COREは$k$-Shuffle Dyckより優れており、効果的なPTP言語は階層的に表現可能で、回路理論的に学習可能でなければならないという仮説に挑戦する。
我々は,依存性解決の曖昧さを軽減する機能的ランドマークが重要な要因であることを示し,効果的なPTT設計は表現性だけでなく,依存性解決のアクセシビリティにも依存することを示した。
関連論文リスト
- What Language is This? Ask Your Tokenizer [32.28976119949841]
言語識別(LID)は多くの多言語自然言語処理パイプラインの重要なコンポーネントである。
我々は,UnigramLMトークン化アルゴリズムに基づくシンプルで効率的なLID手法UniLIDを紹介する。
我々の定式化は、データと計算効率が良く、既存のモデルを再訓練することなく、新しい言語の漸進的な追加をサポートしています。
論文 参考訳(メタデータ) (2026-02-19T18:58:39Z) - HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization [50.27950279695363]
多くの事前訓練された言語モデル (PLM) は、中級言語と低級言語で最適な性能を示す。
これを解決するための一般的な戦略は、ターゲット言語固有の新しいトークンを導入し、埋め込みを初期化し、ターゲット言語データに連続的な事前トレーニングを適用することである。
より適応的なトークン埋め込みのためのハイパーネットワークベースのアプローチであるHYPEROFAを提案する。
論文 参考訳(メタデータ) (2025-04-21T19:40:32Z) - Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic Biases [47.920937001420505]
フォーマルな言語上での言語モデルの事前学習は、自然言語の獲得を改善することができる。
階層的な依存関係をキャプチャする言語は、言語モデルが自然言語の損失を低減できることを示す。
また、フォーマルな言語から自然言語への移動の機械的証拠を与える。
論文 参考訳(メタデータ) (2025-02-26T15:55:55Z) - Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning [29.745218855471787]
トークン化は多くの言語モジュールの現在のアーキテクチャにおいて必要なコンポーネントである。
トークン化は、合理的な人間的な言語のパフォーマンスに必要である、と我々は主張する。
本稿では,建築的選択,すなわち構成,思考のための言語の優越性について論じる。
論文 参考訳(メタデータ) (2024-12-14T18:18:52Z) - Pre-Trained Language Models for Interactive Decision-Making [72.77825666035203]
目的と観測を埋め込みのシーケンスとして表現する模倣学習の枠組みを述べる。
このフレームワークは様々な環境にまたがって効果的な一般化を可能にすることを実証する。
新たなゴールや新しいシーンを含むテストタスクでは、言語モデルによる初期化ポリシーはタスク完了率を43.6%改善する。
論文 参考訳(メタデータ) (2022-02-03T18:55:52Z) - Differentiable Prompt Makes Pre-trained Language Models Better Few-shot
Learners [23.150999852147283]
本研究は,differiAble pRompT (DART) という新規で効率的なアプローチを提案する。
小さな言語モデルを、素早いエンジニアリングなしで、より優れた数ショットの学習者に変換することができる。
標準NLPタスクの包括的な評価は、提案手法がより優れた数ショット性能を実現することを示す。
論文 参考訳(メタデータ) (2021-08-30T12:29:25Z) - SML: a new Semantic Embedding Alignment Transformer for efficient
cross-lingual Natural Language Inference [71.57324258813674]
トランスフォーマーが質問応答、自然言語推論(NLI)、要約といった様々なタスクを精度良く実行できることは、現在この種のタスクに対処するための最良のパラダイムの1つとしてランク付けすることができる。
nliは、複雑な文を理解するための知識が必要であり、仮説と前提の関係を確立するため、これらのアーキテクチャをテストする最良のシナリオの1つである。
本稿では,自然言語推論のための多言語組込みを効率的にアライメントするための新しいアーキテクチャ siamese multilingual transformer を提案する。
論文 参考訳(メタデータ) (2021-03-17T13:23:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。