論文の概要: Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers
- arxiv url: http://arxiv.org/abs/2608.06111v1
- Date: Thu, 06 Aug 2026 14:44:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.933647
- Title: Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers
- Title(参考訳): 逐次順序を超える:変換器用構文インフォームド位置埋め込み
- Authors: Haris Riaz, Hyungji Kim, Mihai Surdeanu,
- Abstract要約: textbfSyntax-textbfinformed textbfPositional textbfEmbeddings (textbfSiPE)を紹介する。
事前トレーニング中に依存性解析から軽量な構文を学習し、3つの支配的なPEファミリーすべてに注入する。
SiPEで事前トレーニングされたモデルは、SyntaxGymベンチマークで最大10.3%のコストで改善され、同時に塩基モデル上でのパープレキシティを9.0%のコストで削減できることがわかった。
- 参考スコア(独自算出の注目度): 18.965125052600836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Positional embeddings (PE) in Transformers encode token distance and order but are largely agnostic to \textit{syntactic structure}. We introduce \textbf{S}yntax-\textbf{i}nformed \textbf{P}ositional \textbf{E}mbeddings (\textbf{SiPE}), which learns a lightweight syntactic prior from dependency parses during pretraining and injects it across all three dominant PE families (absolute, relative, rotary), for both encoders and decoders, leaving self-attention and the rest of the architecture untouched. We isolate \emph{where} and \emph{how} the prior should enter the model, and find it depends on the architecture: for autoregressive decoders that use relative PE, the prior is strongest when coupled multiplicatively with the relative-position term of the attention score, outperforming injection into the input embeddings, into self-attention, or into the positional and attention terms jointly---while for encoders it is best added directly to the input embeddings, composing with each encoder's native positional mechanism. We find that models pre-trained with SiPE improve on the SyntaxGym benchmark by up to $10.3\%$ while simultaneously reducing perplexity by $9.0\%$ over a base model with no syntactic supervision---a metric nearly every existing syntax-injection method instead degrades. Crucially, these gains extend beyond syntactic generalization: SiPE also improves real-world language understanding, raising scores on the GLUE benchmark by up to $8.2\%$ over a model trained without it. Unlike existing syntactic language models that marginalize over many parses at inference or discard syntax at runtime, SiPE conditions on a single parse, establishing a new Pareto frontier between syntactic supervision and inference cost.
- Abstract(参考訳): Transformer における位置埋め込み (PE) はトークン距離と順序を符号化するが、大部分は \textit{syntactic structure} とは無関係である。
本稿では,3つの支配的なPEファミリー(絶対的,相対的,回転的)すべてに対して,エンコーダとデコーダの両方に対して,依存構文から軽量な構文を学習する。
相対的PEを用いた自己回帰デコーダの場合、前者は相対的な注目スコアの配置項に乗じて最強であり、入力埋め込みへのインジェクション、自己注意へのインジェクションよりも優れ、エンコーダは直接入力埋め込みに追加され、各エンコーダのネイティブな位置決め機構と組み合わされるのが最適である。
SiPEで事前トレーニングされたモデルは、SyntaxGymベンチマークで最大10.3\%まで改善され、同時にシンタクティックなインジェクションのないベースモデル上でのパープレキシティを9.0\%に削減できる。
SiPEはまた、実世界の言語理解を改善し、GLUEベンチマークでスコアを最大8.2\%引き上げる。
既存の構文言語モデルとは異なり、推論や実行時の構文を捨てる際に多くのパースを疎外し、単一のパースでSiPE条件を定め、構文監督と推論コストの間に新たなパレートフロンティアを確立する。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - $\mathcal{S}^2$IT: Stepwise Syntax Integration Tuning for Large Language Models in Aspect Sentiment Quad Prediction [51.165432266846096]
構文構造情報は、大言語モデル(LLM)の生成パラダイムにおいて未利用である
S2ITは、多段階のチューニングプロセスを通じて、構文構造知識をLLMに徐々に統合する。
実験により、S2ITは複数のデータセットにわたる最先端のパフォーマンスを大幅に改善することが示された。
論文 参考訳(メタデータ) (2026-04-25T13:24:29Z) - Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes [10.877713536966601]
Longestahead Prefix(LSP)スケジューラは、モノリシックプレフィックスの吸収に基づく、トレーニング不要でモデルに依存しない推論パラダイムである。
LSPは1つのフォワードパスを介してトークンの安定性を評価し、安定な予測の連続した左整列ブロックを動的に識別する。
原子のコミットメントの前に、言語や構造的受容の境界を画定する。
論文 参考訳(メタデータ) (2026-03-05T18:25:26Z) - PaTH Attention: Position Encoding via Accumulating Householder Transformations [56.32365080761523]
PaTHは、ハウステリア変換の累積積に基づいて、フレキシブルなデータ依存位置符号化方式である。
家庭用行列の積をコンパクトに表現することで,効率的な並列学習アルゴリズムを導出する。
論文 参考訳(メタデータ) (2025-05-22T08:36:09Z) - MorphTok: Morphologically Grounded Tokenization for Indian Languages [18.594241501479747]
トークン化は、特に大規模言語モデル(LLM)の台頭において、NLPにおいて重要なステップである。
古典的Byte-pairを適用する前に, 形態素認識のセグメンテーションを事前学習のステップとして提案する。
音節ベースの書記システムに共通する係り受け母音を扱うために,制約付きBPE(CBPE)を提案する。
CBPEは従属母音を扱い、単一の単位として発生するのではなく、他の文字との結合単位を形成する。
論文 参考訳(メタデータ) (2025-04-14T15:44:45Z) - Pushdown Layers: Encoding Recursive Structure in Transformer Language
Models [86.75729087623259]
再帰は人間の言語の特徴であり、本質的には自己注意に挑戦する。
この作業では、新しいセルフアテンション層であるPushdown Layersを導入している。
プッシュダウン層を備えたトランスフォーマーは、劇的に改善され、3.5倍の高効率な構文一般化を実現した。
論文 参考訳(メタデータ) (2023-10-29T17:27:18Z) - Adapting Language Models to Compress Contexts [71.98287002918941]
トランスフォーマーベースの言語モデル(LM)は強力で広く適用可能なツールであるが、その有用性は有限コンテキストウィンドウによって制限される。
本稿では,事前学習したLMを,長いコンテキストをコンパクトな要約ベクトルに圧縮可能なAutoCompressorに適応させることを提案する。
最大30,720個のトークンのシーケンスでOPTとLlama-2モデルを微調整し、AutoCompressorが長いコンテキストを使ってパープレキシティを向上できることを示す。
論文 参考訳(メタデータ) (2023-05-24T06:42:44Z) - Syntax-Enhanced Pre-trained Model [49.1659635460369]
BERTやRoBERTaなどの学習済みモデルを強化するために、テキストの構文構造を活用するという問題を研究する。
既存の手法では、事前学習段階または微調整段階のいずれかでテキストの構文を利用しており、両者の区別に苦しむ。
事前学習と微調整の両方の段階でテキストのシンタックスを利用するモデルを提示する。
論文 参考訳(メタデータ) (2020-12-28T06:48:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。