論文の概要: How Data Shapes RoPE Frequency Usage: From Positional Scale Matching to Length Generalization
- arxiv url: http://arxiv.org/abs/2607.07678v1
- Date: Wed, 08 Jul 2026 17:38:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.479022
- Title: How Data Shapes RoPE Frequency Usage: From Positional Scale Matching to Length Generalization
- Title(参考訳): データ形状のRoPE周波数利用:位置スケールマッチングから長さ一般化へ
- Abstract要約: RoPE(Rotary Position Embeddings)は、位置周波数の固定グリッドを備えた変圧器を提供する。
本稿では、この周波数使用率を決定する方法について検討し、データ中心の説明を提案する。
- 参考スコア(独自算出の注目度): 19.24080183297062
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Rotary Position Embeddings (RoPE) provide transformers with a fixed grid of positional frequencies, yet trained models use these frequencies highly non-uniformly. We study what determines this frequency usage and propose a data-centered explanation: RoPE frequencies are selected to match the relative-distance structure of the training data. Viewing each frequency as a positional lens, we formalize a field-resolution tradeoff and show that, for a data-induced dependency profile of width $W$, the optimal frequency scales as $1/W$. This frequency-matching principle explains controlled observations on synthetic and text-based data, and suggests that the mid-low frequency bands observed in language models arise from the multi-scale dependency structure of natural language. We further connect frequency selection to position-interpolation-based length generalization: scaling frequencies down expands the effective field while reducing resolution. This helps when longer-context dependencies are approximate dilations of those seen during training, but can fail when relevant dependencies do not scale with context length. Empirically, we show that natural language exhibits approximate self-similarity across positional scales, explaining why test-time frequency scaling can support long-context generalization. Overall, our results identify a data-driven mechanism behind emergent RoPE frequency usage and show that long-context generalization depends on two forms of scale matching: between learned frequencies and training-time dependencies, and between frequency scaling and how those dependencies extend to longer contexts.
- Abstract(参考訳): RoPE(Rotary Position Embeddings)は、位置周波数の固定グリッドを備えたトランスフォーマーを提供するが、訓練されたモデルはこれらの周波数を非一様に利用する。
トレーニングデータの相対距離構造に合わせるために,RoPE周波数を選択した。
各周波数を位置レンズとして見ることにより、フィールド分解能トレードオフを定式化し、データ誘起依存性プロファイルの幅$W$に対して、最適な周波数スケールが1/W$であることを示す。
この周波数マッチング原理は、合成およびテキストベースのデータに対する制御された観察を説明し、自然言語のマルチスケール依存構造から、言語モデルで観察される中低周波帯域が生じることを示唆している。
さらに、周波数選択と位置補間に基づく長さの一般化を結びつける。
これは、長いコンテキスト依存がトレーニング中に見られるものに近いダイレーションである場合に役立つが、関連する依存関係がコンテキスト長でスケールしない場合には失敗する可能性がある。
実験によって、自然言語は位置スケールで近似的な自己相似性を示し、なぜテスト時間周波数のスケーリングが長文の一般化をサポートするのかを説明する。
以上の結果から, 学習周波数と学習時間依存性, 周波数スケーリングとそれらの依存関係が, より長いコンテキストにどのように拡張されるかという, 長期コンテキストの一般化は, スケールマッチングの2つの形態に依存することが明らかとなった。
関連論文リスト
- Faster 3D Gaussian Splatting Convergence via Structure-Aware Densification [52.517763621139956]
3Dガウススプラッティングは、リアルタイムのノベルビュー合成のための強力なシーン表現として登場した。
標準適応密度制御は画面空間の位置勾配に依存する。
本稿では,3次元ガウススプラッティングのための構造認識型密度化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-30T15:37:20Z) - Corpus Frequencies in Morphological Inflection: Do They Matter? [0.5934049163128877]
システム開発における3つの重要な次元に沿った形態的インフレクションの課題に対するコーパス周波数情報の組み入れについて検討する。
その結果,43言語中26言語において,周波数認識訓練が一様サンプリングに優れていることが判明した。
論文 参考訳(メタデータ) (2025-10-27T09:12:04Z) - Stationarity Exploration for Multivariate Time Series Forecasting [16.66747488602513]
APRNet(Amplitude-Phase Reconstruct Network)を提案する。
APRNetは振幅と位相の相互関係をモデル化し、振幅と位相が異なる物理量で制約されるのを防ぐ。
局所関数に適応的に適合する新しいKLCモジュールを提案する。
論文 参考訳(メタデータ) (2025-08-12T13:15:51Z) - TFKAN: Time-Frequency KAN for Long-Term Time Series Forecasting [16.937153556835423]
Kolmogorov-Arnold Networks (KAN) は長期の時系列予測に非常に有効である。
我々は、時間領域と周波数領域の両方からの情報を統合するために、$textbfT$ime-$textbfF$requency Kan (TFKAN)を提案する。
実験の結果、TFKANは複数のデータセットにわたる最先端(SOTA)メソッドを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2025-06-15T02:53:25Z) - The Harmonic Structure of Information Contours [54.38365999922221]
我々は、英語、スペイン語、ドイツ語、オランダ語、バスク語、ブラジルポルトガル語のテキストで、周期的な情報レートのパターンが一貫した証拠を見出した。
多くの支配的な周波数は談話構造と一致しており、これらの振動は意味のある言語組織を反映していることを示唆している。
論文 参考訳(メタデータ) (2025-06-04T12:56:30Z) - FreRA: A Frequency-Refined Augmentation for Contrastive Learning on Time Series Classification [56.925103708982164]
周波数領域からの新たな視点を示し、ダウンストリーム分類の利点として、グローバル、独立、コンパクトの3つを識別する。
本稿では,分類タスクにおける時系列のコントラスト学習に適した,軽量で効果的な周波数補充拡張(FreRA)を提案する。
FreRAは、時系列分類、異常検出、転送学習タスクにおいて、常に10つの主要なベースラインを上回ります。
論文 参考訳(メタデータ) (2025-05-29T07:18:28Z) - Freqformer: Image-Demoiréing Transformer via Efficient Frequency Decomposition [83.40450475728792]
本稿では,Freqformerについて述べる。Freqformerは,ターゲット周波数分離による画像復号化に特化して設計されたトランスフォーマーベースのフレームワークである。
本手法は,モワールパターンを高周波数空間局在化テクスチャと低周波数スケールローバスト色歪みに明確に分割する有効な周波数分解を行う。
様々なデモアのベンチマーク実験により、Freqformerは、コンパクトなモデルサイズで最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-05-25T12:23:10Z) - Multi-View Frequency-Attention Alternative to CNN Frontends for
Automatic Speech Recognition [12.980843126905203]
周波数に対するグローバルな関心は、局所的な畳み込みよりも有益であることを示す。
畳み込み型ニューラルネットワークトランスデューサに代えて,生産規模での単語誤り率を2.4%削減する。
論文 参考訳(メタデータ) (2023-06-12T08:37:36Z) - Adaptive Frequency Learning in Two-branch Face Forgery Detection [66.91715092251258]
本稿では、AFDと呼ばれる2分岐検出フレームワークにおいて、周波数情報を適応的に学習する手法を提案する。
我々は、固定周波数変換からネットワークを解放し、データおよびタスク依存の変換層でより良いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-03-27T14:25:52Z) - Transforming Spectrum and Prosody for Emotional Voice Conversion with
Non-Parallel Training Data [91.92456020841438]
多くの研究は、実生活では実用的ではない異なる感情パターン間の並列音声データを必要とする。
非並列トレーニングデータから最適な擬似ペアを見つけるために,CycleGANネットワークを提案する。
また、連続ウェーブレット変換(CWT)を用いてF0を10時間スケールに分解し、異なる時間分解における音声韻律を記述する。
論文 参考訳(メタデータ) (2020-02-01T12:36:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。