論文の概要: Word Class Representations Spontaneously Emerge from Successor Representations Trained on Natural Language
- arxiv url: http://arxiv.org/abs/2605.24585v1
- Date: Sat, 23 May 2026 13:55:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.26053
- Title: Word Class Representations Spontaneously Emerge from Successor Representations Trained on Natural Language
- Title(参考訳): 自然言語で学習した後継表現から自発的に出現する単語のクラス表現
- Authors: Mathis Immertreu, Achim Schilling, Thomas Kinfe, Patrick Krauss,
- Abstract要約: 言語モデルは典型的には、シーケンス内の次のトークンを予測するために訓練される。
ここでは、強化学習の代替的予測原理である継承表現について検討する。
複数の時間的地平線にまたがる将来の単語分布を予測するためにニューラルネットワークを訓練する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Language models are typically trained to predict the next token in a sequence. Here, we explore an alternative predictive principle from reinforcement learning: Successor Representations (SRs), which model the expected discounted distribution of future states rather than the immediate next state. We transfer this framework to natural language and train neural networks to predict future word distributions across multiple temporal horizons, thereby learning representations of long-range transition structure. We train a deep residual neural network on WikiText-103 (103 million tokens; 20,000-word vocabulary) and optimize successor representations as probability distributions using KL divergence. Without explicit linguistic supervision, structured language representations emerge spontaneously. After training, the learned space develops a clear geometric organization with respect to part-of-speech (POS) categories: nouns, verbs, and adjectives become separable and recoverable through unsupervised clustering. This organization depends systematically on predictive horizon, with short horizons producing the strongest syntactic structure and longer horizons increasingly integrating broader contextual and semantic information. At finer resolutions, additional interpretable lexical substructure emerges, revealing coherent subclasses within major word categories. These findings suggest that syntactic categories need not be explicitly encoded but may arise as a consequence of predictive sequence learning. To our knowledge, this work provides the first systematic application of successor representations to natural language and establishes a conceptual bridge between reinforcement learning, linguistics, and cognitive neuroscience.
- Abstract(参考訳): 言語モデルは典型的には、シーケンス内の次のトークンを予測するために訓練される。
ここでは、次の状態ではなく将来の状態の予測割引分布をモデル化した後継表現(SR)という、強化学習からの代替的な予測原理について検討する。
このフレームワークを自然言語に転送し、ニューラルネットワークを訓練し、複数の時間的地平線にまたがる将来の単語分布を予測することにより、長距離遷移構造の表現を学習する。
WikiText-103(103万のトークン、20,000ワードの語彙)で深い残差ニューラルネットワークをトレーニングし、KL分散を用いた確率分布として後継表現を最適化する。
明示的な言語指導がなければ、構造化言語表現は自然に出現する。
訓練後、学習空間は、名詞、動詞、形容詞が、教師なしのクラスタリングによって分離され、回復しうる、部分音声(POS)カテゴリに関する明確な幾何学的組織を発達させる。
この組織は、予測的地平線を体系的に依存し、短い地平線が最強の構文構造を生み出し、より広い文脈と意味情報を統合するより長い地平線を生み出す。
より微細な解像度では、解釈可能な語彙のサブ構造が出現し、主要な単語カテゴリ内のコヒーレントなサブクラスが明らかになる。
これらの結果は,構文カテゴリーを明示的にエンコードする必要はないが,予測シーケンス学習の結果生じる可能性があることを示唆している。
本研究は,自然言語への後継表現の体系的適用を初めて提供し,強化学習,言語学,認知神経科学の概念的ブリッジを確立する。
関連論文リスト
- Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability [31.30541946703775]
モデルの内部表現と計算を人間が理解できる概念に変換することが、解釈可能性の重要な目標である。
スパースオートエンコーダのような最近の辞書学習手法は、人間の解釈可能な特徴を発見するための有望な経路を提供する。
しかし、彼らは「文の始めの「The」というフレーズ」のような浅い、トークン特有の、または騒々しい特徴に偏りを呈している。
論文 参考訳(メタデータ) (2025-10-30T17:59:30Z) - Geometry of Semantics in Next-Token Prediction: How Optimization Implicitly Organizes Linguistic Representations [34.88156871518115]
Next-token Prediction (NTP) 最適化により、言語モデルがテキストから意味構造を抽出し、整理する。
我々は、より大きな特異値に対応する概念が訓練中に学習され、自然な意味階層が生成されることを示した。
この洞察は、解釈可能なセマンティックカテゴリを識別するための概念記号を組み合わせる方法である、オーサントベースのクラスタリングを動機付けている。
論文 参考訳(メタデータ) (2025-05-13T08:46:04Z) - Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures [49.19753720526998]
合成データセット上でのニューラルネットワーク性能に関する理論的スケーリング法則を導出する。
局所性と重み共有によって生成過程の構造が整った畳み込みネットワークは、性能の高速化を享受できることを示す。
この発見は、ニューラルネットワークのスケーリング法則に基づくアーキテクチャ上のバイアスを明らかにし、モデルアーキテクチャとデータの統計的性質の間の相互作用によって表現学習がどのように形成されるかを強調している。
論文 参考訳(メタデータ) (2025-05-11T17:44:14Z) - Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning [29.745218855471787]
トークン化は多くの言語モジュールの現在のアーキテクチャにおいて必要なコンポーネントである。
トークン化は、合理的な人間的な言語のパフォーマンスに必要である、と我々は主張する。
本稿では,建築的選択,すなわち構成,思考のための言語の優越性について論じる。
論文 参考訳(メタデータ) (2024-12-14T18:18:52Z) - Collapsed Language Models Promote Fairness [88.48232731113306]
偏りのある言語モデルはトークン表現と単語埋め込みの間に崩壊したアライメントを示す。
我々は,幅広い脱バイアス法において,公平性を効果的に向上する原理的な微調整法を設計する。
論文 参考訳(メタデータ) (2024-10-06T13:09:48Z) - Word class representations spontaneously emerge in a deep neural network
trained on next word prediction [7.240611820374677]
人間はどのように言語を学ぶのか、そして、最初の言語は全く学べるのか?
これらの基本的な疑問はいまだに熱心に議論されている。
特に、次の単語を予測するために、人工的な深層ニューラルネットワークを訓練する。
その結果,9ワード入力シーケンスの内部表現は10ワードの単語クラスに従ってクラスタ化され,出力として予測されることがわかった。
論文 参考訳(メタデータ) (2023-02-15T11:02:50Z) - Latent Topology Induction for Understanding Contextualized
Representations [84.7918739062235]
本研究では,文脈的埋め込みの表現空間について検討し,大規模言語モデルの隠れトポロジについて考察する。
文脈化表現の言語特性を要約した潜在状態のネットワークが存在することを示す。
論文 参考訳(メタデータ) (2022-06-03T11:22:48Z) - Predicting emergent linguistic compositions through time: Syntactic
frame extension via multimodal chaining [8.254139827478355]
連鎖と多モーダル知識の認知機構を利用して、時間を通して構成表現を予測する枠組みを開発する。
本稿では,「知覚」,「概念」,「言語」から連鎖と知識の理論に基づく構文的フレーム拡張モデル(SFEM)を提案する。
マルチモーダルSFEMは、純粋言語的・非言語的知識を用いた競合モデルよりも、新たに出現した動詞構文と引数を予測できることを示す。
論文 参考訳(メタデータ) (2021-09-10T03:42:07Z) - Infusing Finetuning with Semantic Dependencies [62.37697048781823]
シンタックスとは異なり、セマンティクスは今日の事前訓練モデルによって表面化されないことを示す。
次に、畳み込みグラフエンコーダを使用して、タスク固有の微調整にセマンティック解析を明示的に組み込む。
論文 参考訳(メタデータ) (2020-12-10T01:27:24Z) - SLM: Learning a Discourse Language Representation with Sentence
Unshuffling [53.42814722621715]
談話言語表現を学習するための新しい事前学習目的である文レベル言語モデリングを導入する。
本モデルでは,この特徴により,従来のBERTの性能が大幅に向上することを示す。
論文 参考訳(メタデータ) (2020-10-30T13:33:41Z) - APo-VAE: Text Generation in Hyperbolic Space [116.11974607497986]
本稿では,双曲型潜在空間におけるテキスト生成について検討し,連続的な階層表現を学習する。
適応型ポインケア可変オートエンコーダ (APo-VAE) を提示し, ポインケア球上における潜伏変数の事前および変動後部の両方を包み込み正規分布により定義する。
言語モデリングと対話応答生成における実験は,提案したAPo-VAEモデルの有効性を示す。
論文 参考訳(メタデータ) (2020-04-30T19:05:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。