論文の概要: Concept Training for Human-Aligned Language Models
- arxiv url: http://arxiv.org/abs/2603.29123v1
- Date: Tue, 31 Mar 2026 01:20:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.982247
- Title: Concept Training for Human-Aligned Language Models
- Title(参考訳): 言語モデルを用いた概念学習
- Authors: Christine Zhang, Dan Jurafsky, Chen Shani,
- Abstract要約: 次に注意すべき予測は、各ステップで単一の継続トークンを予測するために言語モデルを訓練する。
代わりに、意味論的に関連付けられたトークンの集合として近似された概念を予測するフレームワークを探索する。
概念指導によって訓練されたモデルは、人間の意味的類似性判断とより強く一致していることを示す。
- 参考スコア(独自算出の注目度): 32.18350772329571
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The next-token prediction (NTP) objective trains language models to predict a single continuation token at each step. In natural language, however, a prefix can be continued in many valid ways, and even similar meanings may differ in surface form. For example, the sentence ``this website is safe to \underline{browse}'' could plausibly continue with words such as browse, search, visit, surf, or navigate. While standard NTP training treats these alternatives as mutually exclusive targets, we explore a framework that instead predicts concepts, approximated as sets of semantically related tokens. We show that models trained with concept supervision exhibit stronger alignment with human semantic similarity judgments on multiple lexical benchmarks. These gains are accompanied by lower perplexity on semantically meaningful words (definition in Section 3.1), and a modest increase in global token-level perplexity, reflecting a tradeoff between standard NTP optimization and concept-level supervision. Our results suggest that concept-level objectives can improve semantic alignment while maintaining competitive language modeling performance.
- Abstract(参考訳): 次トーケン予測(NTP)は言語モデルを訓練し、各ステップで単一の継続トークンを予測する。
しかし、自然言語では接頭辞は多くの有効な方法で継続することができ、類似した意味でさえ表面形によって異なるかもしれない。
例えば、 `` this website is safe to \underline{browse}'' という文は、ブラウジング、検索、訪問、サーフィン、ナビゲートなどの単語を確実に継続することができる。
標準的なNTPトレーニングでは、これらの選択肢を相互排他的なターゲットとして扱うが、代わりに意味論的に関連するトークンの集合として近似された概念を予測するフレームワークを探索する。
概念指導によって訓練されたモデルは、複数の語彙ベンチマークにおいて、人間の意味的類似性判定とより強く一致していることを示す。
これらの利得には意味論的意味のある単語(第3.1節で定義されている)の難易度が低く、また、標準的なNTP最適化と概念レベルの監督とのトレードオフを反映して、グローバルなトークンレベルの難易度が緩やかに増加する。
この結果から,概念レベルの目的が言語モデリング性能を維持しつつセマンティックアライメントを改善することが示唆された。
関連論文リスト
- Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models [62.054835560934066]
Next Concept Predictionは、Next Token Predictionの上に構築された、ジェネレーティブな事前学習パラダイムである。
我々のモデルであるConceptLMは、ベクトル量子化を用いて隠れ状態の定量化を行い、概念語彙を構築する。
13のベンチマークの結果、NCPは従来のトークンレベルのモデルよりも一貫したパフォーマンス向上をもたらすことが示された。
論文 参考訳(メタデータ) (2026-02-09T18:33:31Z) - Beyond Tokens: Concept-Level Training Objectives for LLMs [27.252567251972028]
Next-token Prediction (NTP) はtextittoken レベルで動作し、単一の参照継続からの逸脱をエラーとして扱う。
我々はトークンレベルから概念レベルへのシフトを提案し、概念は同じアイデアの複数の曲面形式をグループ化する。
提案手法は, NLP ベンチマークにおいて, NTP モデルよりも低難易度化, ドメインシフト時の堅牢性の向上, 性能向上を実現していることを示す。
論文 参考訳(メタデータ) (2026-01-16T21:35:11Z) - Idea-Gated Transformers: Enforcing Semantic Coherence via Differentiable Vocabulary Pruning [0.40611352512781856]
本稿では,セマンティックプランニングと構文生成を分離した新しいアーキテクチャであるIdean-Gated Transformerを紹介する。
本稿では,意味的に無関係なトークンを抑え,検索空間をリアルタイムで効果的に刈り取る,微分可能なゲーティング機構を提案する。
論文 参考訳(メタデータ) (2025-12-03T01:17:07Z) - Geometry of Semantics in Next-Token Prediction: How Optimization Implicitly Organizes Linguistic Representations [34.88156871518115]
Next-token Prediction (NTP) 最適化により、言語モデルがテキストから意味構造を抽出し、整理する。
我々は、より大きな特異値に対応する概念が訓練中に学習され、自然な意味階層が生成されることを示した。
この洞察は、解釈可能なセマンティックカテゴリを識別するための概念記号を組み合わせる方法である、オーサントベースのクラスタリングを動機付けている。
論文 参考訳(メタデータ) (2025-05-13T08:46:04Z) - A General and Flexible Multi-concept Parsing Framework for Multilingual Semantic Matching [60.51839859852572]
我々は,テキストを多言語セマンティックマッチングのためのマルチコンセプトに分解し,NERモデルに依存するモデルからモデルを解放することを提案する。
英語データセットのQQPとMRPC、中国語データセットのMedical-SMについて包括的な実験を行った。
論文 参考訳(メタデータ) (2024-03-05T13:55:16Z) - Rewrite Caption Semantics: Bridging Semantic Gaps for
Language-Supervised Semantic Segmentation [100.81837601210597]
本研究では,事前学習データにおける視覚的意味論とテキスト的意味論のギャップを埋めるための概念キュレーション(CoCu)を提案する。
CoCuは、最高にゼロショット転送性能を達成し、言語教師ありセグメンテーションベースラインを大きなマージンで大幅に向上させる。
論文 参考訳(メタデータ) (2023-09-24T00:05:39Z) - Multilingual Conceptual Coverage in Text-to-Image Models [98.80343331645626]
コンセプチュアル・カバー・アクロス言語(Conceptual Coverage Across Languages, CoCo-CroLa)とは、任意の生成的テキスト・画像システムにおいて、有形名詞の観点から学習言語に多言語対応を提供する程度をベンチマークする手法である。
各モデルについて、ソースコード中の一連の有形名詞に生成される画像の集団と、対象言語に翻訳された各名詞に生成された画像の集団とを比較することにより、ソース言語に対して与えられた対象言語の「概念的カバレッジ」を評価することができる。
論文 参考訳(メタデータ) (2023-06-02T17:59:09Z) - Few-shot Subgoal Planning with Language Models [58.11102061150875]
事前訓練された言語モデルにエンコードされた言語は、細粒度のサブゴール列を推測できることを示す。
サブゴナル・インスペクションを強く仮定する最近の手法とは対照的に,我々の実験では,詳細なサブゴラル・シーケンスを微調整せずに推論できる言語モデルが示されている。
論文 参考訳(メタデータ) (2022-05-28T01:03:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。