論文の概要: Shifting Mechanisms: How Positional Encoding Choice Shapes In-Context Retrieval
- arxiv url: http://arxiv.org/abs/2609.38530v1
- Date: Tue, 29 Sep 2026 20:50:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.728194
- Title: Shifting Mechanisms: How Positional Encoding Choice Shapes In-Context Retrieval
- Title(参考訳): シフトメカニズム: 文脈検索における位置エンコーディングの形状
- Abstract要約: 標準的な RoPE モデルは主に位置検索に依存しているのに対し,PE のハイブリッドは意味検索に移行している。
これらの行動的差異は、長文検索における一様改善よりも、位置から意味的メカニズムへのシフトをよりよく追跡できることが示される。
- 参考スコア(独自算出の注目度): 11.162969587770094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models increasingly use architectures that vary attention span and positional encoding across layers, such as applying RoPE with sliding-window attention and NoPE with global attention (SWA NoPE). However, how these choices shape in-context retrieval remains unclear. To study this question, we take a mechanistic view, tracing how positional encoding (PE) choice shapes the internal mechanisms models use for in-context retrieval. Across 22 open-weight models spanning eight families, we find that standard RoPE models rely primarily on positional retrieval, while PE hybrids shift toward semantic retrieval. We further show on a controlled pre-training ablation that confining positional encoding to local layers produces this semantic shift, degrading representations of positional information. Finally, we show that the reported long-context gains of PE hybrids mask a retrieval trade-off: SWA NoPE improves over RoPE on multiple-target retrieval and QA, but degrades when distinguishing competing keys. We show that these behavioral differences better track the mechanism shift from positional toward semantic mechanisms than a uniform improvement in long-context retrieval.
- Abstract(参考訳): 言語モデルは、スライディングウインドウのRoPEやグローバルウインドウのNoPE(SWA NoPE)など、レイヤー間の注意範囲や位置エンコーディングの異なるアーキテクチャをますます利用している。
しかし、これらの選択がどのようにコンテキスト内検索を形成するかは、まだ不明である。
そこで,本研究では,モデルが内部メカニズムを組み込んだ位置符号化 (PE) の選択が,コンテキスト内検索にどのように使用されるのかを追究するメカニスティックな視点で検討する。
8つのファミリーにまたがる22のオープンウェイトモデルにおいて、標準的なRoPEモデルは位置検索に大きく依存しているのに対し、PEハイブリッドは意味検索に移行している。
さらに、局所的な層に位置エンコーディングを収束させることにより、位置情報の表現を劣化させる制御された事前学習アブレーションについて述べる。
SWA NoPEは、マルチターゲット検索とQAにおいてRoPEよりも改善されるが、競合するキーを区別すると劣化する。
これらの行動的差異は、長文検索における一様改善よりも、位置から意味的メカニズムへのシフトをよりよく追跡できることが示される。
関連論文リスト
- RoPE is Dead, Long Live RoPE: Towards Scalable Data-aware Positional Encodings [8.53540271606787]
Rotary Position Embedding (RoPE) は現代の言語モデルではデフォルトの位置エンコーディングとなっている。
既存の代替案は異なる設定で評価されており、文献は断片化され、明確な置き換えは行われていない。
我々は,高速帯域上で標準の RoPE を保ちながら,文脈表現から学習した有界座標で遅い帯域上の絶対位置を置き換えるデータアウェアネス RoPE を導入する。
論文 参考訳(メタデータ) (2026-09-28T08:14:18Z) - Give it Space! Explicit Disentangling of Positional and Semantic Representations in Encoders [8.72344410197391]
位置符号化(PE)は、置換不変トランスフォーマーがシーケンス順序をどのように表すかを示す。
RoPEのようなPEメソッドは、長いコンテキストの理解や検索のようなタスクに苦戦している。
我々は、位置的信号と意味的信号が、訓練されたトランスフォーマー内のほとんど閉じた部分空間を占有しているという証拠の上に構築する。
論文 参考訳(メタデータ) (2026-05-28T14:42:25Z) - Untwisting RoPE: Frequency Control for Shared Attention in DiTs [84.14005261938284]
位置符号化はトランスフォーマーベースの生成モデルに不可欠である。
ロータリー・ポジショナル・エンベディング (RoPE) は, 異なる位置感性を有する周波数成分に自然に分解されることを示す。
本稿では,厳密な位置アライメントよりも意味的類似性を反映するように,RoPE周波数帯域を選択的に変調する手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T20:01:59Z) - Do traveling waves make good positional encodings? [44.55744608160896]
移動波に基づく新しい位置符号化機構であるRollPEを提案する。
従来の絶対的な位置埋め込みよりもはるかに優れていることを示す。
我々は、RolePEの数学的等価性を、RoPEの特定の構成に導出する。
論文 参考訳(メタデータ) (2025-11-11T14:32:45Z) - Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings [29.421443764865003]
本稿では,RoPEの回転位置埋め込みにおいて,何とどこで絡み合っているのかを解析する。
本稿では,Polar Coordinate Position Embeddings(PoPE)と呼ばれるRoPEの改良を提案する。
論文 参考訳(メタデータ) (2025-09-05T14:22:27Z) - Context-aware Rotary Position Embedding [0.0]
RoPE(Rotary Positional Embeddings)は、相対的な位置符号化と計算効率との互換性から広く採用されている。
トークン埋め込みを前提とした頭部特異的な周波数パターンを動的に生成するRoPEの新たな一般化であるCARoPE(Context-Aware Rotary Positional Embedding)を提案する。
CaroPEは、RoPEや他の一般的な位置符号化ベースラインを一貫して上回り、より長いコンテキスト長でも非常に低いパープレキシティを実現している。
論文 参考訳(メタデータ) (2025-07-30T20:32:19Z) - SeqPE: Transformer with Sequential Position Encoding [76.22159277300891]
SeqPEは、各$n$次元位置指数をシンボルシーケンスとして表現し、軽量なシーケンシャル位置エンコーダを用いて埋め込みを学習する。
言語モデリング、長文質問応答、および2次元画像分類による実験により、SeqPEはパープレキシティ、正確なマッチング(EM)、精度の強いベースラインを超えるだけでなく、手作業によるアーキテクチャ再設計を必要とせず、多次元入力へのシームレスな一般化を可能にする。
論文 参考訳(メタデータ) (2025-06-16T09:16:40Z) - PaTH Attention: Position Encoding via Accumulating Householder Transformations [56.32365080761523]
PaTHは、ハウステリア変換の累積積に基づいて、フレキシブルなデータ依存位置符号化方式である。
家庭用行列の積をコンパクトに表現することで,効率的な並列学習アルゴリズムを導出する。
論文 参考訳(メタデータ) (2025-05-22T08:36:09Z) - Eliminating Position Bias of Language Models: A Mechanistic Approach [119.34143323054143]
位置バイアスは現代言語モデル (LM) の一般的な問題であることが証明されている。
我々の力学解析は、ほぼ全ての最先端のLMで使われている2つのコンポーネント(因果的注意と相対的位置エンコーディング)に位置バイアスが関係している。
位置バイアスを排除することによって、LM-as-a-judge、検索強化QA、分子生成、数学推論など、下流タスクのパフォーマンスと信頼性が向上する。
論文 参考訳(メタデータ) (2024-07-01T09:06:57Z) - DAPE: Data-Adaptive Positional Encoding for Length Extrapolation [60.18239094672938]
位置符号化はトランスにおいて重要な役割を担い、モデル性能と一般化長に大きな影響を及ぼす。
本研究では,訓練された長さと長さの一般化の観点からモデル性能を向上させるDAPE法を提案する。
提案手法は, 他の静的位置符号化法と比較して, シーケンス長128でモデルをトレーニングし, 評価シーケンス長8192で性能を向上する。
論文 参考訳(メタデータ) (2024-05-23T15:51:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。