論文の概要: Anti-Periodic Positional Encoding: Möbius Boundary Conditions Make In-Context Retrieval Reliable
- arxiv url: http://arxiv.org/abs/2607.21405v1
- Date: Thu, 23 Jul 2026 15:04:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.450447
- Title: Anti-Periodic Positional Encoding: Möbius Boundary Conditions Make In-Context Retrieval Reliable
- Title(参考訳): 反周期的位置エンコーディング:メビウス境界条件は、文脈内検索を信頼性のあるものにする
- Abstract要約: Mbius RoPEは、反周期周波数はしご上に構築された回転位置符号化である。
我々は6つの160Mクラスと3つの410Mクラスのアームにまたがる48のモデルを訓練している。
ワンライン周波数スワップは、検索シード宝くじに対するゼロコスト保険を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Möbius RoPE is a rotary positional encoding built on the anti-periodic frequency ladder $θ_i=π(2i+1)/N$: every rotation plane advances by an odd multiple of $π$ across the training context, so the positional holonomy is $-1$ and the two ends of the sequence are deterministically coupled through a closed-form Dirichlet "dipole"; to our knowledge this is the first anti-periodic boundary condition in positional encoding. We verify the theory numerically to $\sim 10^{-6}$ and pretrain 48 models spanning six 160M-class and three 410M-class arms (2B FineWeb-Edu tokens each; the hybrid arm puts Möbius frequencies on 25% of heads). Hybrid perplexity is unchanged (29.66 vs. 29.72), but needle-in-a-haystack retrieval becomes reliable: $90.3\pm5.7\%$ versus $63.3\pm31.4\%$ at context 512 ($n=6$ seeds), observed worst seed 86% versus 14%, robust variance tests $p=0.013$-$0.029$ (unadjusted), recurring at 410M (Levene $p=0.040$). Matched controls isolate the mechanism: an aperiodic ladder in the same frequency band reproduces none of the effect, and a periodic (holonomy $+1$) ladder only a fraction. Swapping trained models' frequency table back to standard RoPE (weights frozen) collapses retrieval, with damage concentrated on far needles: trained models depend on this long-range geometry. A NoPE arm is even more reliable at short context but pays a 13% perplexity tax and extrapolates worst; only the anti-periodic hybrid pairs baseline perplexity with a high reliability floor. The effect is scoped to single-needle retrieval within the training window; a one-line frequency swap thus provides zero-cost insurance against the retrieval seed lottery.
- Abstract(参考訳): メビウス・ロペ (Möbius RoPE) は反周期周波数ラダー $θ_i=π(2i+1)/N$ 上に構築された回転的な位置符号化である: すべての回転平面はトレーニングコンテキスト全体で$π$の奇数の倍によって進行するので、位置ホロノミーは$-1$であり、シーケンスの2端は閉形式のディリクレ「双極子」によって決定的に結合される。
我々はこの理論を$\sim 10^{-6}$とpretrain 48モデルで6つの160Mクラスと3つの410Mクラスのアーム(それぞれ2B FineWeb-Eduトークン、ハイブリッドアームはメビウスの周波数を25%のヘッドに設定する)に数値的に検証する。
90.3\pm5.7\%$ vs 6,3.3\pm31.4\%$ at context 512 ($n=6$ seed), observed worst seed 86% vs 14%, robust variance test $p=0.013$-0.029$ (undjusted), repeating at 410M (Levene $p=0.040$)。
一致した制御は、同じ周波数帯の周期的なはしごは効果を一切再現せず、周期的なはしご(ホロノミー$+1$)はごくわずかである。
トレーニングされたモデルの周波数表を標準のRoPEに戻すと、損傷は遠針に集中して回復する:訓練されたモデルはこの長距離幾何学に依存する。
NoPEアームは短期的にはより信頼性が高いが、13%のパープレキシティ税を支払い、最悪の場合を補う。
この効果は、トレーニングウィンドウ内のシングルニードル検索に限定され、ワンラインの周波数スワップにより、検索シード宝くじに対するゼロコストの保険が提供される。
関連論文リスト
- Online Non-Monotone DR-Submodular Maximization Matching the Offline $0.401$ Factor [47.30196146041476]
我々は、$d$-oracle単位のコンパクト凸部分集合上の非対称非負、非単調DR-部分モジュラ函数について研究する。
オンラインアルゴリズムは、フィードバックが条件付きで偏りがなく、有界であるときに、およその後悔で0.401$に達する。
論文 参考訳(メタデータ) (2026-09-02T06:00:10Z) - SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models [53.86918766240095]
Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
我々は,チャンク内並列構造を保ちながら,チャンク境界における適応$tanh$圧縮を適用したtextbfState Anomaly Neutralization (SANE)を提案する。
論文 参考訳(メタデータ) (2026-08-23T10:41:07Z) - Closed-form fractional radial links for elliptical Mahalanobis discriminant analysis [0.0]
ベイズ・ラジアルリンク(Bayes radial-link)ファミリーは、クラス内半径法則から導出する。
導出リンクは、装着されたGAMよりも著しく悪いことはない。
5つの重い尾のシリーズと明るい尾のコントロールの3つの方が優れている。
論文 参考訳(メタデータ) (2026-07-07T10:02:33Z) - Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline [43.0484058393522]
我々は,ニューラルシンボリックなハイブリッドパイプラインを直接生成に対して試験する。
本研究は,2000点の合成外用コーパスについて検討した。
論文 参考訳(メタデータ) (2026-05-26T05:14:33Z) - When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation [9.055086193088083]
10大言語モデルによって駆動されるチェーン・オブ・シンクとReActエージェントに経験的現象を記述した。
平均的な摂動は、同等の厳しさのプレゼンテーション摂動よりも、最終的な答えを頻繁に変更する。
論文 参考訳(メタデータ) (2026-05-25T15:57:11Z) - Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m [0.0]
独立に訓練された変圧器は、均一なランダム回転によって異なる残差ストリームベースで同じ関数を計算する。
この現象を多型と呼ぶ:同じ関数、相互に理解不能な内部座標である。
この現象は標準的なSAE測度には見えない。
論文 参考訳(メタデータ) (2026-05-23T13:37:59Z) - Prism: Structural Symmetry Scanning via Duality-Constrained Laplacian Projection [0.0]
複雑なネットワークにおける構造対称性診断のためのフレームワークである textbfPrism を導入する。
Prismは、ネットワークが構造的自己整合性からどのくらい離れているかを測定するスカラーである。
論文 参考訳(メタデータ) (2026-05-18T04:20:05Z) - Tight Convergence Rates for Online Distributed Linear Estimation with Adversarial Measurements [66.94250413799232]
分散パラメータ-サーバ-ワーカー設定における乱数ベクトル$X$の推定について検討する。
主な課題は、敵の計測と非同期である。
その結果, 分散線形推定におけるロバスト性, 識別性, 統計的効率の統一的有限時間評価が得られた。
論文 参考訳(メタデータ) (2026-04-07T11:45:55Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Balancing Centralized Learning and Distributed Self-Organization: A Hybrid Model for Embodied Morphogenesis [0.0]
本研究では,学習可能な脳様のコントローラを細胞様のグレースコット基質に結合して,最小限の努力でステアパターン形成を行う方法について検討する。
コンパクトな畳み込みポリシは、微分可能なPyTorch反応拡散シミュレータに埋め込まれる。
論文 参考訳(メタデータ) (2025-11-13T09:05:27Z) - Multi-Armed Bandits with Interference [39.578572123342944]
スイッチバックポリシは,最高の固定アームポリシに対して,最適に期待された後悔のO(sqrt T)$を達成できることが示される。
提案するクラスタランダム化ポリシは,期待値に最適である。
論文 参考訳(メタデータ) (2024-02-02T19:02:47Z) - Optimistic Posterior Sampling for Reinforcement Learning with Few
Samples and Tight Guarantees [43.13918072870693]
強化学習(OPSRL)のための楽観的後部サンプリングアルゴリズムを提案する。
殆どの$widetildemathcalO(sqrtH3SAT)$ ignoring $textpolylog(HSAT)$ termsにおいて、高い確率で再帰的な順序境界を保証する。
我々の境界は位数$Omega(sqrtH3SAT)$の下位境界と一致し、Agrawal と Jia が提起した開問題に答える。
論文 参考訳(メタデータ) (2022-09-28T20:49:34Z) - Predicting the Stability of Hierarchical Triple Systems with
Convolutional Neural Networks [68.8204255655161]
本稿では,階層型三重項の安定性を予測する畳み込みニューラルネットワークモデルを提案する。
すべてのトレーニングされたモデルは公開されており、純粋な$N$-bodyメソッドよりも200ドルの速さで階層的な3重システムの安定性を予測することができる。
論文 参考訳(メタデータ) (2022-06-24T17:58:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。