論文の概要: Idea-Gated Transformers: Enforcing Semantic Coherence via Differentiable Vocabulary Pruning
- arxiv url: http://arxiv.org/abs/2512.03343v1
- Date: Wed, 03 Dec 2025 01:17:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-04 20:02:55.065579
- Title: Idea-Gated Transformers: Enforcing Semantic Coherence via Differentiable Vocabulary Pruning
- Title(参考訳): 理想ゲート変換器:可変語彙プルーニングによる意味的コヒーレンスを強制する
- Abstract要約: 本稿では,セマンティックプランニングと構文生成を分離した新しいアーキテクチャであるIdean-Gated Transformerを紹介する。
本稿では,意味的に無関係なトークンを抑え,検索空間をリアルタイムで効果的に刈り取る,微分可能なゲーティング機構を提案する。
- 参考スコア(独自算出の注目度): 0.40611352512781856
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive Language Models (LLMs) trained on Next-Token Prediction (NTP) often suffer from ``Topic Drift'' where the generation wanders away from the initial prompt due to a reliance on local associations rather than global planning \citep{holtzman2019curious}. While scaling model size mitigates this \citep{brown2020language}, the fundamental myopia of the NTP objective remains. In this work, we introduce the Idea-Gated Transformer, a novel architecture that separates semantic planning from syntactic generation. We introduce an auxiliary ``Idea Head'' trained to predict the bag-of-words distribution for a future context window, creating a latent ``Concept Vector'' that actively gates the main vocabulary during generation. We propose a differentiable gating mechanism that suppresses semantically irrelevant tokens, effectively pruning the search space in real-time. Experiments on WikiText-103 demonstrate that while the Idea-Gated model achieves comparable validation perplexity to a standard GPT-2 baseline, it exhibits significantly superior Domain Retention. Qualitative and quantitative analysis reveals that the gating mechanism successfully locks generation into specific semantic clusters (e.g., Finance, Science) and resists associative drift, offering a parameter-efficient path toward more controllable language modeling.
- Abstract(参考訳): 次世代予測 (NTP) で訓練された自己回帰言語モデル (LLMs) は、グローバルプランニングではなく地域社会に依存しているため、世代が最初のプロンプトから遠ざかる '`Topic Drift''' に悩まされることが多い。
スケーリングモデルのサイズはこの \citep{brown2020 Language} を緩和するが、NTP の目的の基本的なミオピアは残っている。
本稿では,セマンティックプランニングと構文生成を分離した新しいアーキテクチャであるIdean-Gated Transformerを紹介する。
本稿では,将来的なコンテキストウインドウの語句分布を予測するために訓練された補助語 `Idea Head' を導入し,生成中の主語彙を積極的にゲートする潜在語 ``Concept Vector'' を作成する。
本稿では,意味的に無関係なトークンを抑え,検索空間をリアルタイムで効果的に刈り取る,微分可能なゲーティング機構を提案する。
WikiText-103の実験では、Idean-Gatedモデルは標準のGPT-2ベースラインと同等の検証難易度を達成するが、ドメイン保持性はかなり優れていることを示した。
定性的かつ定量的な分析により、ゲーティング機構は特定のセマンティッククラスタ(例えばファイナンス、サイエンス)に生成をロックし、より制御可能な言語モデリングへのパラメータ効率の高い経路を提供する連想ドリフトに抵抗することがわかった。
関連論文リスト
- TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving [1.5327485092552822]
Birds-Eye View (BEV) エンドツーエンドのインスタンス予測は、自律運転認識のための堅牢なパラダイムとして登場した。
現在の最先端のアプローチは、占有率の回帰や光の流れといった幾何学的監督に大きく依存している。
このギャップを埋める新しいフレームワークであるText-Guided Representation for Instance Prediction (TGRIP)を紹介します。
論文 参考訳(メタデータ) (2026-07-06T08:47:56Z) - Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - Continuous Latent Diffusion Language Model [48.974403879186916]
大規模言語モデルは自己回帰パラダイムの下で顕著な成功を収めた。
既存の代替手段は、生成効率、スケーラブルな表現学習、効果的なグローバルセマンティックモデリングを共同で達成するのに依然として苦労している。
階層型情報分解によりテキスト生成をフレーム化する階層型潜在拡散言語モデルCola DLMを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:44:56Z) - Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification [60.02530716177415]
生涯人物再識別(LReID)は、逐次的に収集されたデータで一般化可能なモデルを訓練することを目的としている。
既存の非現代的なアプローチは、視覚のみの蒸留やパラメータ正規化に大きく依存している。
本稿では,意味的アライメントとドメイン間一般化のための非対称な視覚テキストフレームワークであるPrompt-Anchored Vision-text Distillation (PAD)を提案する。
論文 参考訳(メタデータ) (2026-05-06T15:23:13Z) - Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation [15.12832019023085]
言語モデル(LM)は、ドメイン固有のタスクのための新しい学習可能な語彙トークンで拡張されつつある。
標準的な慣行は、これらの新しいトークンを既存の語彙埋め込みの手段として初期化し、それから教師付き微調整に頼って表現を学習する。
本論文は, 精密学習の前に, 予め訓練された埋め込み空間に新しいトークンを言語的に基礎付けることを目的とした, emphGrounded Token Initialization hypothesisを提案する。
論文 参考訳(メタデータ) (2026-04-02T17:59:19Z) - Concept Training for Human-Aligned Language Models [32.18350772329571]
次に注意すべき予測は、各ステップで単一の継続トークンを予測するために言語モデルを訓練する。
代わりに、意味論的に関連付けられたトークンの集合として近似された概念を予測するフレームワークを探索する。
概念指導によって訓練されたモデルは、人間の意味的類似性判断とより強く一致していることを示す。
論文 参考訳(メタデータ) (2026-03-31T01:20:03Z) - Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models [102.20309135516186]
クロスエントロピー(CE)トレーニングは、言語モデルの密集したスケーラブルな監視を提供する。
言語モデル微調整のための特徴マッチング手法を提案する。
この目的を効率的に最適化するために,エネルギーベースファインチューニングを提案する。
論文 参考訳(メタデータ) (2026-03-12T17:57:50Z) - Modeling Language as a Sequence of Thoughts [0.0]
トランスフォーマー言語モデルは、トークンのシーケンスとして言語をモデル化することで、驚くほど自然なテキストを生成することができる。
しかし、それらは、エンティティやイベントの世界的な一貫性のある潜在表現を形成することができず、その欠如はリレーショナルな方向(例えば、逆の呪い)の脆さ、文脈化エラー、データ非効率に寄与する。
我々は、トークンと文レベルの「思考」状態という2つの抽象レベルで言語をモデル化する再帰変換器であるThought Gestalt(TG)モデルを導入する。
論文 参考訳(メタデータ) (2025-12-31T18:24:57Z) - Next Interest Flow: A Generative Pre-training Paradigm for Recommender Systems by Modeling All-domain Movelines [8.895768051554162]
本稿では,eコマースレコメンデータシステムのための新しい生成事前学習パラダイムを提案する。
我々のモデルは,ユーザの将来の意図を表す密度の高いベクトル列であるNext Interest Flowを予測することを学ぶ。
パイプライン全体を実装した統合フレームワークである All-domain Moveline Evolution Network (AMEN) を提示する。
論文 参考訳(メタデータ) (2025-10-13T12:13:17Z) - Constrained Auto-Regressive Decoding Constrains Generative Retrieval [71.71161220261655]
ジェネレーティブ検索は、従来の検索インデックスデータ構造を1つの大規模ニューラルネットワークに置き換えようとしている。
本稿では,制約とビームサーチという2つの本質的な視点から,制約付き自己回帰生成の固有の制約について検討する。
論文 参考訳(メタデータ) (2025-04-14T06:54:49Z) - Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning [29.745218855471787]
トークン化は多くの言語モジュールの現在のアーキテクチャにおいて必要なコンポーネントである。
トークン化は、合理的な人間的な言語のパフォーマンスに必要である、と我々は主張する。
本稿では,建築的選択,すなわち構成,思考のための言語の優越性について論じる。
論文 参考訳(メタデータ) (2024-12-14T18:18:52Z) - Implicit Geometry of Next-token Prediction: From Language Sparsity Patterns to Model Representations [24.211603400355756]
大規模テキストコーパス上でのNTP(Next-token Prediction)は,大規模言語モデルの学習のパラダイムとなっている。
得られたモデル表現の幾何学的特性に対する言語パターンのマッピングにNTPがどう影響するかを考察する。
合成および小規模な実言語データセットについて,本研究の成果を検証した。
論文 参考訳(メタデータ) (2024-08-27T21:46:47Z) - Learning Disentangled Semantic Spaces of Explanations via Invertible Neural Networks [10.880057430629126]
切り離された潜在空間は、通常、より良い意味分離性と幾何学的性質を持ち、より良い解釈可能性とより制御可能なデータ生成をもたらす。
本研究では,より一般的な文意味的特徴の局所的な修正と制御を目的とした,文の絡み合いのより一般的な形態に着目した。
本稿では,トランスフォーマベース言語であるオートエンコーダ(AE)と統合されたフローベース可逆ニューラルネットワーク(INN)機構を導入し,より分離性に優れた潜在空間を実現する。
論文 参考訳(メタデータ) (2023-05-02T18:27:13Z) - Better Language Model with Hypernym Class Prediction [101.8517004687825]
クラスベース言語モデル (LM) は、コンテキストの疎結合に$n$-gramのLMで対処するために長年開発されてきた。
本研究では,このアプローチをニューラルLMの文脈で再考する。
論文 参考訳(メタデータ) (2022-03-21T01:16:44Z) - Infusing Finetuning with Semantic Dependencies [62.37697048781823]
シンタックスとは異なり、セマンティクスは今日の事前訓練モデルによって表面化されないことを示す。
次に、畳み込みグラフエンコーダを使用して、タスク固有の微調整にセマンティック解析を明示的に組み込む。
論文 参考訳(メタデータ) (2020-12-10T01:27:24Z) - Unsupervised Paraphrasing with Pretrained Language Models [85.03373221588707]
教師なし環境で,事前学習した言語モデルを用いて高品質なパラフレーズを生成する訓練パイプラインを提案する。
提案手法は,タスク適応,自己スーパービジョン,動的ブロッキング(Dynamic Blocking)という新しい復号アルゴリズムから構成される。
提案手法は,Quora Question PairとParaNMTの両方のデータセット上で,最先端の性能を達成できることを示す。
論文 参考訳(メタデータ) (2020-10-24T11:55:28Z) - Improving Adversarial Text Generation by Modeling the Distant Future [155.83051741029732]
テキスト計画手法を考察し、上記の問題を緩和するためのモデルに基づく模倣学習手法を提案する。
本稿では,より長い地平線上の生成過程に焦点をあてる新しいガイドネットワークを提案する。
論文 参考訳(メタデータ) (2020-05-04T05:45:13Z) - Improve Variational Autoencoder for Text Generationwith Discrete Latent
Bottleneck [52.08901549360262]
変分オートエンコーダ(VAE)は、エンドツーエンドの表現学習において必須のツールである。
VAEは強い自己回帰デコーダで潜伏変数を無視する傾向がある。
よりコンパクトな潜在空間において暗黙的な潜在特徴マッチングを強制する原理的アプローチを提案する。
論文 参考訳(メタデータ) (2020-04-22T14:41:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。