論文の概要: MeRoTune: RoPE-Safe Merging with a Tunable Dial
- arxiv url: http://arxiv.org/abs/2609.07971v1
- Date: Mon, 07 Sep 2026 20:48:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:56:46.117691
- Title: MeRoTune: RoPE-Safe Merging with a Tunable Dial
- Title(参考訳): MeRoTune:RoPEに安全なダイヤルを組み込む
- Abstract要約: 最近の研究は、各モデルのクエリとキープロジェクションに対して可逆的補正行列($M$)を学習することで、誤りの修正を試みる。
この修正は、クエリ側で$M$、キー側で$M-T$を、ドット製品の直前で、アウトユースで$M$をキャンセルする。
我々は、このキャンセルがRoPEの下で正確に、かつ、$M$がRoPE当たりの回転と通勤する場合のみであることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When you merge two fine-tuned models from the same base checkpoint by simply averaging their weights, you implicitly assume their attention subspaces are still aligned. Recent work attempts to fix misalignments by learning an invertible correction matrix, $M$, for each model's query and key projections. This correction cancels out---using $M$ on the query side and $M^{-T}$ on the key side---right before the dot product. However, this cancellation is only exact if nothing sits between the projection and the dot product. In reality, almost all modern open-weight language models put a rotary position embedding (RoPE) exactly there. In this paper, we show that this cancellation is exact under RoPE if and only if $M$ commutes with RoPE's per-position rotation. We derive the specific class of matrices where this holds: a scaled rotation acting independently within each RoPE frequency pair. This forms a strict, low-dimensional subset of the unconstrained matrices that current methods normally train. Building on this, we turn this constrained matrix class into a new merging method. While keeping the base weights entirely frozen, two fine-tunes each learn their own RoPE-compliant correction matrices. We optimize these corrections against a chosen blend ratio so the final result can be adjusted post-hoc like a dial, rather than locked into a single fixed merge. Our default approach trains at one fixed blend ratio, similar to how LoRA sets its scaling hyperparameter in advance. We also experiment with resampling the blend ratio randomly at every training step, and we report the results of both approaches.
- Abstract(参考訳): 2つの微調整されたモデルを同じベースチェックポイントからマージする場合、その重みを単に平均化すれば、そのサブスペースは依然として整列していると暗黙的に仮定できる。
最近の研究は、各モデルのクエリとキープロジェクションに対して可逆的補正行列($M$)を学習することで、誤りの修正を試みる。
この修正は、クエリ側で$M$、キー側で$M^{-T}$のアウトユースをキャンセルする。
しかし、このキャンセルは射影とドット積の間に何も存在しない場合にのみ正確なものである。
実際、現代のほとんどのオープンウェイト言語モデルは回転位置埋め込み(RoPE)を正確に配置している。
本稿では、このキャンセルがRoPEの下で正確に、かつ、M$がRoPE当たりの回転と通勤する場合のみであることを示す。
各RoPE周波数対内で独立に作用するスケールドローテーションである。
これは、現在の方法が通常訓練する非制約行列の厳密で低次元の部分集合を形成する。
これに基づいて、制約付き行列クラスを新しいマージメソッドに変換する。
基本重みを完全に凍結させながら、2つの微調整はそれぞれのRoPE準拠の補正行列を学習する。
選択したブレンド比に対してこれらの補正を最適化することにより、最終的な結果が単一の固定マージにロックされるのではなく、ダイヤルのようにポストホックに調整できる。
我々のデフォルトのアプローチは、LoRAが事前にスケーリングハイパーパラメータを設定するのと同じように、1つの固定ブレンド比でトレーニングします。
また、各トレーニングステップでブレンド比をランダムにサンプリングし、両アプローチの結果を報告する。
関連論文リスト
- RoPE attention is an exact forward-pass gradient step with softmax intact [0.0]
我々は、RoPE-softmaxフォワードパスの正確な勾配-ステップ表現を導出する。
我々は,非定常有限キャッシュヘッドがグローバルに正確なアフィンクエリの読み出しを許さないことを証明した。
論文 参考訳(メタデータ) (2026-09-06T15:53:38Z) - Between-User Collapse Under Popularity-Biased Feedback: A Centered-Covariance Theorem and Computable Phase Boundary [0.0]
我々は,人気度の高いBPRトレーニングが,協調フィルタリング埋め込みのユーザ間幾何学にどう影響するかを考察する。
定常アイテムによる人気バイアスのあるフィードバックの下では、$C$は安定した状態に収束する。
次に、その効果の限界について検討する。
論文 参考訳(メタデータ) (2026-08-03T17:33:25Z) - CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation [6.432245831737748]
安定な微調整はコヒーレントSVD回転に続くことを示す。
CORAは、常識推論とコード生成でLoRA、DoRA、PiSSA、MiLoRAを上回っている。
論文 参考訳(メタデータ) (2026-06-30T20:00:47Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m [0.0]
独立に訓練された変圧器は、均一なランダム回転によって異なる残差ストリームベースで同じ関数を計算する。
この現象を多型と呼ぶ:同じ関数、相互に理解不能な内部座標である。
この現象は標準的なSAE測度には見えない。
論文 参考訳(メタデータ) (2026-05-23T13:37:59Z) - Subspace Geometry Governs Catastrophic Forgetting in Low-Rank Adaptation [0.0]
Low-Rank Adaptation (LoRA) は、大規模な事前学習モデルに適応するためのパラメータ効率の高いアプローチとして登場した。
勾配部分空間相互作用のレンズを通して,LoRAにおける破滅的忘れを特徴付ける幾何学的理論を提案する。
論文 参考訳(メタデータ) (2026-02-10T22:45:47Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit
Feedback and Unknown Transition [71.33787410075577]
線形関数近似,未知遷移,および逆損失を用いた強化学習について検討した。
我々は高い確率で$widetildeO(dsqrtHS3K + sqrtHSAK)$ regretを実現する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-07T15:03:50Z) - Test Set Sizing Via Random Matrix Theory [91.3755431537592]
本稿ではランダム行列理論の手法を用いて、単純な線形回帰に対して理想的なトレーニング-テストデータ分割を求める。
それは「理想」を整合性計量を満たすものとして定義し、すなわち経験的モデル誤差は実際の測定ノイズである。
本論文は,任意のモデルのトレーニングとテストサイズを,真に最適な方法で解決した最初の論文である。
論文 参考訳(メタデータ) (2021-12-11T13:18:33Z) - Model-Based Reinforcement Learning with Value-Targeted Regression [48.92439657407732]
我々は、遷移モデル $P$ が既知のモデルの族 $mathcalP$ に属する有限水平エピソード RL に焦点を当てる。
線形混合の特別な場合において、後悔束は $tildemathcalO(dsqrtH3T)$ という形を取る。
論文 参考訳(メタデータ) (2020-06-01T17:47:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。