論文の概要: CORAM: Coherent Orthogonal Rotation for Model Merging
- arxiv url: http://arxiv.org/abs/2608.17366v1
- Date: Tue, 18 Aug 2026 04:44:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.220781
- Title: CORAM: Coherent Orthogonal Rotation for Model Merging
- Title(参考訳): CORAM:モデルマージのためのコヒーレント直交回転
- Authors: Xinyi Sui, Ziran Liu, Nam Ling, Wei Wang, Wei Jiang,
- Abstract要約: 微調整されたモデルをマージすることは、共同トレーニングやオリジナルのデータへのアクセスなしに、特別な能力を組み合わせる。
CoRAMは、対応するベースモデルSVDフレームにおける特異値分解によって、すべてのエキスパートスライスを表す。
CoRAMはOrthoMergeを0.25から1.35ポイント改善し、最強の重量空間ベースラインを超える。
- 参考スコア(独自算出の注目度): 12.769948700677185
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Merging finetuned models combines specialized capabilities without joint training or access to the original data. Most methods operate by linear arithmetic in Euclidean weight space, which cannot carry the geometry of the update. Orthogonal Model Merging (OrthoMerge) uses a single orthogonal transform for each weight matrix, but such a transform cannot change singular values. We propose CORAM, which partitions each target matrix into row slices, represents every expert slice by its singular value decomposition in the corresponding base-model SVD frame, and merges the task-specific factors on their corresponding manifolds. Because manifold averaging contracts the merged update, CORAM applies an amplification coefficient $λ=κ\hat{c}$. The scale c_hat is estimated from the expert and merged update norms and is approximately $\sqrt{N}$ for $N$ experts with comparable update magnitudes. The restoration strength kappa is selected from the dispersion of expert updates without evaluating candidate merged models. This rule remains within 0.72 points of the best swept value on all evaluated suites. CORAM also includes spread slicing to distribute highly updated rows across slices and a residual pathway for non-target layers. Across four suites covering three model families, 3B to 9B scales, and language and vision-language experts, CORAM improves over OrthoMerge by 0.25 to 1.35 points and matches or exceeds the strongest weight-space baselines.
- Abstract(参考訳): 微調整されたモデルをマージすることは、共同トレーニングやオリジナルのデータへのアクセスなしに、特別な能力を組み合わせる。
ほとんどの手法はユークリッド重み空間における線形算術によって演算されるが、更新の幾何学は持たない。
Orthogonal Model Merging (OrthoMerge) は各重み行列に対して単一の直交変換を使用するが、そのような変換は特異値を変更することはできない。
我々は,各対象行列を行スライスに分割し,対応するベースモデルSVDフレームの特異値分解によって各専門家スライスを表現し,対応する多様体上のタスク固有因子をマージするCORAMを提案する。
多様体平均化は合併された更新を収縮するので、CORAM は増幅係数 $λ=κ\hat{c}$ を適用する。
スケールc_hatは、専門家から推定され、マージされた更新基準から推定され、ほぼ$\sqrt{N}$で、同等の更新規模を持つ専門家に対して$N$である。
候補マージモデルを評価することなく、専門家更新の分散から復元強度カッパを選択する。
このルールは、評価された全てのスイートで最良値の0.72ポイント以内に留まる。
CORAMはまた、高度に更新された行をスライスに分散するスプレッドスライスや、非ターゲット層に対する残留経路も備えている。
3つのモデルファミリ、3Bから9Bスケール、言語と視覚言語の専門家を含む4つのスイートで、CORAMはOrthoMergeよりも0.25から1.35ポイント改善され、最強の重量空間ベースラインを超える。
関連論文リスト
- Kaczmarz Linear Attention [11.650692583508663]
リニアリカレントモデルはコンテキストを固定サイズの状態に圧縮し、情報を忘れ、書き、編集するルールを中心的な設計問題とする。
Gated DeltaNet (GDN) は、ゲート状態崩壊とデルタルール残差書き込みを結合し、学習可能な係数を用いて、忘れと更新の規模をバランスさせる。
状態形状,ゲート,リニアリカレンス,チャンクワイズ並列アルゴリズムを保存するGDNの1スカラー修正であるKaczmarz Linear (KLA)を提案する。
論文 参考訳(メタデータ) (2026-05-09T01:07:01Z) - DiBA: Diagonal and Binary Matrix Approximation for Neural Network Weight Compression [8.81314696375596]
線形層、1時間1ドルの畳み込み、アテンションプロジェクション、埋め込み層を含む現代のネットワークの多くのコンポーネントは、密度の高い行列重みを持つ。
DiBAは$AinmathbbRmtimes n$ by $widehat A=D_1B_DBD_3$を近似する。
DiBARD (DiBA with Retuning only Diagonal Factor) は、密度の高い行列層をDiBA因子で置き換え、バイナリ行列を凍結し、下流データ上の対角成分のみをリチューニングする。
論文 参考訳(メタデータ) (2026-05-07T10:46:22Z) - Evolution Strategies at the Hyperscale [57.75314521465674]
本稿では,大集団にバックプロップフリーな最適化を拡大するための進化戦略(ES)アルゴリズムEGGROLLを紹介する。
ESは、微分不可能またはノイズの多い目的を処理できる強力なブラックボックス最適化手法のセットである。
EGGROLLはランダム行列を$Ain mathbbRmtimes r, Bin mathbbRntimes r$ with $rll min(m,n)$ とすることでこれらのボトルネックを克服し、低ランク行列摂動を$A Btop$とする。
論文 参考訳(メタデータ) (2025-11-20T18:56:05Z) - Multivariate Variational Autoencoder [0.08460698440162889]
斜め後部制限を持ち上げながらガウス的トラクタビリティを保ったVAE変異体を提案する。
MVAEは後続の共分散を分解し、そこでは共役結合行列$mathbfC$がデータセット全体の潜在相関を誘導する。
公正な比較と再利用を容易にするために、トレーニング/評価スクリプトとスイープユーティリティを備えた、完全に再現可能な実装をリリースする。
論文 参考訳(メタデータ) (2025-11-08T16:52:53Z) - MetaCluster: Enabling Deep Compression of Kolmogorov-Arnold Network [8.780976521229741]
Kolmogorov-Arnold Networks (KAN) はスカラーウェイトを基底係数のエッジベクトルに置き換える。
精度を犠牲にすることなく高圧縮性を実現するフレームワークであるMetaClusterを提案する。
論文 参考訳(メタデータ) (2025-10-21T21:58:15Z) - MM-RLHF: The Next Step Forward in Multimodal LLM Alignment [59.536850459059856]
MM-RLHF, $mathbf120k$ fine-fine, human-annotated preference comparison pairsを含むデータセットを紹介する。
本稿では,報酬モデルの品質向上とアライメントアルゴリズムの効率向上のために,いくつかの重要なイノベーションを提案する。
我々のアプローチは、$mathbf10$の異なる次元と$mathbf27$のベンチマークで厳格に評価されている。
論文 参考訳(メタデータ) (2025-02-14T18:59:51Z) - Decoding-Time Language Model Alignment with Multiple Objectives [116.42095026960598]
既存の手法は主に、1つの報酬関数に対してLMを最適化することに集中し、それらの適応性は様々な目的に制限される。
本稿では,予測の線形結合から次のトークンを出力する復号時間アルゴリズムである$textbfmulti-objective decoding (MOD)$を提案する。
提案手法は, 自然条件下であっても, 既存のアプローチが準最適であることを示すとともに, 提案手法の最適性を保証する。
論文 参考訳(メタデータ) (2024-06-27T02:46:30Z) - Why Approximate Matrix Square Root Outperforms Accurate SVD in Global
Covariance Pooling? [59.820507600960745]
本稿では,前方通過のSVDと後方伝播のPad'e近似を用いて勾配を計算する新しいGCPメタ層を提案する。
提案するメタレイヤは,さまざまなCNNモデルに統合され,大規模および微細なデータセット上で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2021-05-06T08:03:45Z) - Regular Polytope Networks [29.44144177954405]
我々は、変換は精度を損なわず、メモリ使用量を減らすことなく修正できると主張しています。
また、固定および最大分離埋め込みを学ぶために使用することができます。
埋め込みの定常性とその最大分離表現を理論的に正当化できることを示した。
論文 参考訳(メタデータ) (2021-03-29T14:11:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。