論文の概要: Pseudowords as probes: Large Language Models show little of the sublexical sensitivity that governs human pseudoword processing
- arxiv url: http://arxiv.org/abs/2610.07936v1
- Date: Tue, 06 Oct 2026 08:09:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.883817
- Title: Pseudowords as probes: Large Language Models show little of the sublexical sensitivity that governs human pseudoword processing
- Title(参考訳): プローブとしての擬似語:ヒトの擬似語処理を規定する語彙感受性のほとんどを示す大言語モデル
- Abstract要約: 体系性 (systematicity) とは、形から意味への確率的マッピングであり、あらゆるレベルで言語を浸透させる。
イタリア語の2字交互強制選択擬似語実験において,5つのLDMを試験した。
LLMは、実際の単語オプションが擬似単語のみの条件よりも語彙的親しみやすいキューを提供する場合、人間とより確実に一致した。
- 参考スコア(独自算出の注目度): 4.886242016374806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Systematicity, the probabilistic mapping of form to meaning, permeates language at all levels, and sublexical cues have been shown to govern human pseudoword processing. Yet whether LLMs exhibit comparable sensitivity to these cues remains unclear. We tested five LLMs on two Italian two-alternative forced-choice pseudoword experiments and compared their responses with a human behavioural baseline. LLMs aligned more reliably with humans when real-word options provided a lexical familiarity cue than in the pseudoword-only condition, where they fell substantially below fastText, a character-n-gram model. In addition, the sublexical cosine-similarity cue that reliably drove human--fastText agreement did not consistently transfer to human--LLM alignment, and reasoning-token expenditure bore no consistent relation to human processing difficulty. These findings suggest that LLMs do not necessarily share the sublexical cues that govern human pseudoword processing; we discuss tokenization and training-data coverage as candidate explanations.
- Abstract(参考訳): 体系性、形から意味への確率的マッピング、あらゆるレベルで言語を浸透させ、サブレキシカルな手がかりが人間の擬似語処理を支配することが示されている。
しかし、LSMがこれらの手がかりに匹敵する感度を示すかどうかは不明だ。
イタリア語の2つの交互強制選択擬似単語実験において,5つのLDMを試験し,その反応を人間の行動ベースラインと比較した。
LLMは、文字-n-gramモデルであるfastTextよりも大幅に下降した擬単語のみの条件よりも語彙的親しみやすいキューを提供する場合、人間とより確実に一致した。
さらに,ヒト-ファストテキスト協定を確実に推進する亜語彙的コサイン類似性キューは,人間-LLMアライメントに一貫して移行するわけではなく,推論-トーケン支出は人間の処理困難と一貫した関係を持たなかった。
これらの結果は,LLMが必ずしも人間の擬似語処理を司る亜語彙的手がかりを共有していないことを示唆し,トークン化とトレーニングデータカバレッジを候補説明として論じる。
関連論文リスト
- Subword models struggle with word learning, but surprisal hides it [8.883534683127415]
単語と文字のモデルにおける単語学習を,心理言語学的語彙決定タスクを用いて研究する。
サブワードLMは高い精度で単語や非単語を識別するのに苦労するが、文字LMはこの課題を簡単かつ一貫して解決する。
論文 参考訳(メタデータ) (2025-02-18T13:09:16Z) - Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning [53.57895922042783]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット(CoT)データに基づいて訓練された場合、推論と計画が優れている。
そこで我々は,遅延離散トークンを用いて推論過程を部分的に抽象化するハイブリッド表現を提案する。
論文 参考訳(メタデータ) (2025-02-05T15:33:00Z) - From Tokens to Words: On the Inner Lexicon of LLMs [7.148628740938674]
自然言語は単語で構成されているが、現代の大言語モデル(LLM)はサブワードを入力として処理する。
サブワード列をコヒーレントな全単語表現に結合する本質的なデトケン化過程にLLMが関与する証拠を提示する。
以上の結果から, LLMはトークン化のスコープを超えて, 潜在語彙を保っていることが示唆された。
論文 参考訳(メタデータ) (2024-10-08T09:53:35Z) - Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies [75.85462924188076]
ジェンダー非包括的NLP研究は、ジェンダーバイナリ中心大言語モデル(LLM)の有害な制限を文書化している。
誤認識はByte-Pair(BPE)トークン化によって大きく影響されている。
本研究では,(1)代名詞の代名詞化パリティ,(2)代名詞間の一貫した代名詞化を強制する手法,および(2)既存のLLM代名詞の知識を活用して新代名詞の習熟度を向上させる手法を提案する。
論文 参考訳(メタデータ) (2023-12-19T01:28:46Z) - Towards preserving word order importance through Forced Invalidation [80.33036864442182]
事前学習された言語モデルは単語の順序に敏感であることを示す。
我々は,単語順序の重要性を維持するために強制的無効化を提案する。
実験の結果,強制的無効化は単語順に対するモデルの感度を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2023-04-11T13:42:10Z) - Contextualized Semantic Distance between Highly Overlapped Texts [85.1541170468617]
テキスト編集や意味的類似性評価といった自然言語処理タスクにおいて、ペア化されたテキストに重複が頻繁に発生する。
本稿では,マスク・アンド・予測戦略を用いてこの問題に対処することを目的とする。
本稿では,最も長い単語列の単語を隣接する単語とみなし,その位置の分布を予測するためにマスク付き言語モデリング(MLM)を用いる。
セマンティックテキスト類似性の実験では、NDDは様々な意味的差異、特に高い重なり合うペアテキストに対してより敏感であることが示されている。
論文 参考訳(メタデータ) (2021-10-04T03:59:15Z) - Language-Independent Tokenisation Rivals Language-Specific Tokenisation
for Word Similarity Prediction [12.376752724719005]
言語に依存しないトークン化(LIT)メソッドはラベル付き言語リソースや語彙を必要としない。
言語固有のトークン化(LST)手法は、長い歴史と確立された歴史を持ち、慎重に作成された語彙とトレーニングリソースを用いて開発されている。
意味的類似度測定を多種多様な言語を対象とした評価課題として用いた2つの手法を実証的に比較した。
論文 参考訳(メタデータ) (2020-02-25T16:24:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。