論文の概要: Emergent Semantic Role Understanding in Language Models
- arxiv url: http://arxiv.org/abs/2605.09187v1
- Date: Sat, 09 May 2026 22:01:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.105253
- Title: Emergent Semantic Role Understanding in Language Models
- Title(参考訳): 言語モデルにおける創発的意味的役割理解
- Abstract要約: 本研究では,言語モデルの事前学習中に意味的役割理解が出現するか,タスク固有の微調整を必要とするかを検討する。
モデルスケール全体にわたって、凍結表現には意味的な役割の情報が含まれており、性能は向上するが、十分に調整されたモデルには適合しない。
セマンティックな役割構造は言語モデリングの目的から生まれるが、その内部実装はモデルスケールが大きくなるにつれてより分散表現へとシフトする。
- 参考スコア(独自算出の注目度): 5.734448042909701
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding how linguistic structure emerges in language models is central to interpreting what these systems learn from data and how much supervision they truly require. In particular, semantic role understanding ("who did what to whom") is a core component of meaning representation, yet it remains unclear whether it arises from pre-training alone or depends on task-specific fine-tuning. We study whether semantic role understanding emerges during language model pre-training or requires task-specific fine-tuning. We freeze decoder-only transformers and train linear probes to extract semantic roles, using performance to infer whether role information is already encoded in pre-training or learned during adaptation. Across model scales, we find that frozen representations contain substantial semantic role information, with performance improving but not fully matching fine-tuned models. This indicates partial but incomplete emergence from pre-training alone. We show that semantic role structure emerges from language modeling objectives, but its internal implementation shifts toward more distributed representations as model scale increases.
- Abstract(参考訳): 言語モデルにおいて言語構造がどのように現れるかを理解することは、これらのシステムがデータから何を学ぶのか、どれくらいの監督を必要とするのかを理解することの中心である。
特に意味的役割理解(誰が誰に何をしたか)は意味表現の中核的な要素であるが、それが事前学習単独で起こるのか、それともタスク固有の微調整に依存しているのかは定かではない。
本研究では,言語モデルの事前学習中に意味的役割理解が出現するか,タスク固有の微調整を必要とするかを検討する。
我々は、デコーダのみのトランスフォーマーを凍結し、線形プローブを訓練して意味的役割を抽出し、パフォーマンスを用いて、プリトレーニングで既に役割情報がエンコードされているか、適応中に学習されているかを推測する。
モデルスケール全体にわたって、凍結表現には意味的な役割の情報が含まれており、性能は向上するが、十分に調整されたモデルには適合しない。
これは、事前訓練単独で部分的ではあるが不完全な出現を示す。
セマンティックな役割構造は言語モデリングの目的から生まれるが、その内部実装はモデルスケールが大きくなるにつれてより分散表現へとシフトする。
関連論文リスト
- Verbalizable Representations Form a Global Workspace in Language Models [13.088673968096884]
大規模言語モデルに類似した機能的区別が出現した証拠を提示する。
モデルがその処理のどの時点でも言語化を意図した表現を識別する。
言語モデルでは,意識的アクセスという機能的特徴を持つ,小さな特権的な表現が維持されていることがわかった。
論文 参考訳(メタデータ) (2026-07-16T22:54:30Z) - Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining [33.22703101533052]
大規模な言語モデルは、事前訓練中に非自明な抽象化を学ぶ。
スパース・クロスコーダを使用して、モデルのチェックポイント間で機能を発見、調整しています。
プレトレーニング中に,クロスコーダが特徴の出現,維持,継続を検知できることを示す。
論文 参考訳(メタデータ) (2025-09-05T17:56:24Z) - Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning [29.745218855471787]
トークン化は多くの言語モジュールの現在のアーキテクチャにおいて必要なコンポーネントである。
トークン化は、合理的な人間的な言語のパフォーマンスに必要である、と我々は主張する。
本稿では,建築的選択,すなわち構成,思考のための言語の優越性について論じる。
論文 参考訳(メタデータ) (2024-12-14T18:18:52Z) - Representations as Language: An Information-Theoretic Framework for Interpretability [7.2129390689756185]
大規模ニューラルモデルは、幅広い言語的タスクにまたがる印象的なパフォーマンスを示す。
それにもかかわらず、それらは主にブラックボックスであり、解釈が難しい入力のベクトル表現を誘導する。
本稿では,モデルが文から表現へ学習するマッピングを,言語の一種として表現する,解釈可能性に対する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2024-06-04T16:14:00Z) - Subspace Chronicles: How Linguistic Information Emerges, Shifts and
Interacts during Language Model Training [56.74440457571821]
我々は、構文、意味論、推論を含むタスクを、200万の事前学習ステップと5つのシードで分析する。
タスクや時間にまたがる重要な学習フェーズを特定し、その間にサブスペースが出現し、情報を共有し、後に専門化するために混乱する。
この結果は,モデル解釈可能性,マルチタスク学習,限られたデータからの学習に影響を及ぼす。
論文 参考訳(メタデータ) (2023-10-25T09:09:55Z) - Visual Grounding Helps Learn Word Meanings in Low-Data Regimes [47.7950860342515]
現代のニューラル言語モデル(LM)は、人間の文の生成と理解をモデル化するための強力なツールである。
しかし、これらの結果を得るためには、LMは明らかに非人間的な方法で訓練されなければならない。
より自然主義的に訓練されたモデルは、より人間らしい言語学習を示すのか?
本稿では,言語習得における重要なサブタスクである単語学習の文脈において,この問題を考察する。
論文 参考訳(メタデータ) (2023-10-20T03:33:36Z) - How to Plant Trees in Language Models: Data and Architectural Effects on
the Emergence of Syntactic Inductive Biases [28.58785395946639]
事前学習は、微調整後にタスクを実行する際に、階層的な構文的特徴に依存するように言語モデルを教えることができることを示す。
アーキテクチャの特徴(深さ、幅、パラメータ数)と、事前学習コーパスのジャンルとサイズに焦点を当てる。
論文 参考訳(メタデータ) (2023-05-31T14:38:14Z) - DeepStruct: Pretraining of Language Models for Structure Prediction [64.84144849119554]
テキストから構造を生成するために,タスクに依存しないコーパスの集合上で言語モデルを事前訓練する。
我々の構造事前学習は、モデルが構造タスクについて持っている学習知識のゼロショット転送を可能にする。
10Bパラメータ言語モデルがほとんどのタスクに非自明に転送し、28のデータセットのうち21の最先端のパフォーマンスを得ることを示す。
論文 参考訳(メタデータ) (2022-05-21T00:58:22Z) - Prototypical Representation Learning for Relation Extraction [56.501332067073065]
本論文では, 遠隔ラベルデータから予測可能, 解釈可能, 堅牢な関係表現を学習することを目的とする。
文脈情報から各関係のプロトタイプを学習し,関係の本質的意味を最善に探求する。
いくつかの関係学習タスクの結果,本モデルが従来の関係モデルを大きく上回っていることがわかった。
論文 参考訳(メタデータ) (2021-03-22T08:11:43Z) - Infusing Finetuning with Semantic Dependencies [62.37697048781823]
シンタックスとは異なり、セマンティクスは今日の事前訓練モデルによって表面化されないことを示す。
次に、畳み込みグラフエンコーダを使用して、タスク固有の微調整にセマンティック解析を明示的に組み込む。
論文 参考訳(メタデータ) (2020-12-10T01:27:24Z) - Usable Information and Evolution of Optimal Representations During
Training [79.38872675793813]
特に、意味的に意味があるが究極的には無関係な情報は、訓練の初期の過渡的ダイナミクスに符号化されている。
文献に触発された知覚的意思決定タスクと標準画像分類タスクの両方にこれらの効果を示す。
論文 参考訳(メタデータ) (2020-10-06T03:50:19Z) - Semantics-Aware Inferential Network for Natural Language Understanding [79.70497178043368]
このようなモチベーションを満たすために,セマンティックス対応推論ネットワーク(SAIN)を提案する。
SAINの推論モジュールは、明示的な文脈的セマンティクスを補完的な入力として、セマンティクス上の一連の推論ステップを可能にする。
本モデルでは,機械読解や自然言語推論など11タスクの大幅な改善を実現している。
論文 参考訳(メタデータ) (2020-04-28T07:24:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。