論文の概要: Disentangling Statistical Preemption from Entrenchment in Language Models' Avoidance of Overgeneralization
- arxiv url: http://arxiv.org/abs/2609.01794v1
- Date: Tue, 01 Sep 2026 19:07:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.925983
- Title: Disentangling Statistical Preemption from Entrenchment in Language Models' Avoidance of Overgeneralization
- Title(参考訳): 言語モデルにおけるエントレンチによる統計的プリエンハンスメントの回避 : オーバージェネリゼーションの回避
- Authors: Yixuan Wang, Freda Shi, Kanishka Misra,
- Abstract要約: LMは動詞固有のレベルでプリエンプションを示さず、代わりに弱いが抽象的なプリエンプションの非ゼロな証拠を示す。
プリエンプション(preemption)は、人間の過度な一般化を避けるための、より妥当な方法である。
- 参考スコア(独自算出の注目度): 25.725435318750836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How do learners avoid overgeneralizations such as Tom laughed me without explicit negative evidence? Constructionists have posited two proposals that describe indirect negative evidence against overgeneralizations: preemption (which privileges exposure to near-synonymous construction---e.g., she made him laugh) vs. entrenchment (all exposures to a verb's grammatical usages, including cases like He laughed). We disentangle these hypotheses by running controlled rearing experiments on LMs trained on child-caregiver conversations, where we systematically remove preemptive vs. non-preemptive evidence. We find that while LMs avoid overgeneralizations, they do not show preemption at a verb-specific level, instead showing weak but non-zero evidence of abstract preemption. Combined with results from analyzing the LMs' training dynamics, we find that LMs treat competing structures as indirect positive---as opposed to negative---evidence in the verb-specific condition. Insofar as preemption is the more plausible route to avoiding overgeneralizations in humans, our results point the need for there to be sensitivities to indirect negative evidence in neural network learners, and suggest new human experiments to test abstract preemption.
- Abstract(参考訳): トムのような過度に一般化されるのを避けるために、学習者は明確な否定的な証拠なしで私を笑ったのか?
建設学者は、過一般化に対する間接的な否定的な証拠を記述した2つの提案を提出した: プリエンプション(プレエンプション)とエントレンチメント(動詞の文法的用法への露出、例えば笑った事例を含む)。
子どもと介護者の会話で訓練されたLMの制御された飼育実験を行うことで、これらの仮説を歪め、プリエンプティブと非プリエンプティブのエビデンスを体系的に除去する。
LMは過度な一般化を避けるが、動詞固有のレベルでプリエンプションを示すのではなく、抽象的なプリエンプションの弱いがゼロではない証拠を示す。
LMの学習力学を解析した結果と合わせて, 係り合う構造を, 動詞的条件における負の証拠とは対照的に, 間接的正のものとして扱うことが判明した。
プリエンプションは、人間の過度な一般化を避けるための、より妥当な経路であり、ニューラルネットワーク学習者において、ネガティブな証拠を間接的に検出するための感受性の必要性を指摘し、抽象的なプリエンプションをテストする新しい実験を提案する。
関連論文リスト
- Do Language Models Know What Not to Say? Causal Evidence for Statistical Preemption in LLMs [13.891522069967507]
建設文法は統計的プリエンプション(英語版)を提案している: 従来の形式への露出は構造的に可能であるが、証明されていない代替手段を前提としている。
本稿では,大規模言語モデルにおいて,競合するエンレンチメント仮説から統計的プリエンプションを解離する計算手法を提案する。
論文 参考訳(メタデータ) (2026-05-21T21:06:43Z) - Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time [2.657126017307447]
言語モデルの微調整は、しばしば望ましくない特徴を望ましいものと組み合わせて学習する。
本稿では,短時間のシステム・プロンプト・インストラクションを前もって微調整データを修正する接種プロンプトを提案する。
接種されたモデルは、修正されていないトレーニングデータで訓練されたモデルよりも、特性の表現がはるかに低い。
論文 参考訳(メタデータ) (2025-10-05T20:04:22Z) - Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection [58.82268659497348]
この失敗の根源は、根本的なミスマッチにある、と私たちは主張する。
本稿では,偽画像検出のための汎用的で説明可能な,会話型アシスタントであるForensic-Chatを提案する。
論文 参考訳(メタデータ) (2025-09-29T20:59:19Z) - Do Retrieval Augmented Language Models Know When They Don't Know? [55.72375712577378]
ALMはいつ知らないのか知っていますか?
期待とは対照的に, LLM は有意なテキストバッファー-拒否行動を示す。
提案手法は, 学習後モデルに対する簡易かつ効果的な拒絶手法を開発し, 解答品質を向上する。
論文 参考訳(メタデータ) (2025-09-01T13:44:15Z) - Generating novel experimental hypotheses from language models: A case study on cross-dative generalization [15.705978435313996]
我々は、シミュレーション学習者としてLMを用いて、人間と実験するための新しい実験仮説を導出する。
子どもの横断的一般化(CDG)の既知のパターンを再現するLMが見つかる。
本論では,CDGが露出コンテキストの特徴として,特に調和性のあるものとして,内部的に促進される,という新たな仮説を提案する。
論文 参考訳(メタデータ) (2024-08-09T14:17:36Z) - The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language Models [78.69526166193236]
プレトレーニング言語モデル(PLM)は、社会的バイアスのような有害な情報を含むことが認識されている。
我々は,社会バイアスなどの望ましくない行動に起因する言語モデルにおいて,正確に単位(すなわちニューロン)を特定するために,sc Social Bias Neuronsを提案する。
StereoSetの以前の測定値からわかるように、我々のモデルは、低コストで言語モデリング能力を維持しながら、より高い公平性を達成する。
論文 参考訳(メタデータ) (2024-06-14T15:41:06Z) - Abductive Commonsense Reasoning Exploiting Mutually Exclusive
Explanations [118.0818807474809]
帰納的推論は、イベントのもっともらしい説明を見つけることを目的としている。
自然言語処理における帰納的推論のための既存のアプローチは、しばしば監督のために手動で生成されたアノテーションに依存している。
この研究は、ある文脈に対して、説明のサブセットのみが正しいという事実を活用する、帰納的コモンセンス推論のアプローチを提案する。
論文 参考訳(メタデータ) (2023-05-24T01:35:10Z) - Not another Negation Benchmark: The NaN-NLI Test Suite for Sub-clausal
Negation [59.307534363825816]
否定は現在の言語モデルでは不十分だが、この問題の範囲は広く理解されていない。
自然言語推論(NLI)テストスイートを導入し,NLP手法の能力を検証した。
論文 参考訳(メタデータ) (2022-10-06T23:39:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。