論文の概要: XMerge: Cross-Axis Selection and Reconstructive Layer Merging for LLM Depth Compression
- arxiv url: http://arxiv.org/abs/2609.02083v1
- Date: Wed, 02 Sep 2026 04:12:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.048477
- Title: XMerge: Cross-Axis Selection and Reconstructive Layer Merging for LLM Depth Compression
- Title(参考訳): XMerge: LLM深度圧縮のためのクロス軸選択と再構成層マージ
- Authors: Jundong Hu, Shekar Ramachandran,
- Abstract要約: 交叉軸選択は、相対マグニチュードの低いブロックと角状隠れ状態の変化を識別する。
局所的な境界再構成は、元の2ブロック出力と一致するように、隣接した生存ブロックに適合する。
XMergeはタスクラベルやエンドツーエンドの微調整は使用しない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Removing complete transformer layers preserves a standard serving architecture, but existing depth-compression methods can lose substantial quality, and the loss varies unpredictably across models. We introduce XMerge, a post-training method with two components. Cross-axis selection identifies a block with low relative-magnitude and angular hidden-state change, and local boundary reconstruction re-fits the adjacent surviving block to match the original two-block output. XMerge uses no task labels or end-to-end fine-tuning, and it introduces neither architectural changes nor additional inference-time parameters. Across seven Llama and Qwen backbones (0.5B-8B), five published baselines, and three layer-reduction levels, its advantage over baselines is largest at the most aggressive removal: at k=4 it ranks first on six of seven backbones on CORE (a 22-task aggregate) and, separately, on six of seven on MMLU (five of seven on both at once), while avoiding the large perplexity increases of several competing operators. In a task-level bootstrap, the 95% confidence intervals for the three largest CORE margins exclude zero; the remaining margins are consistent with ties. Across the 14 (model, regime) cells it is also the only evaluated operator that never collapses, ranking top-2 in both zero-shot and in-context regimes; on a first calibration probe (one backbone) it is the best-calibrated operator. Ablations show that local reconstruction provides most of the gain, while cross-axis fusion helps when the two selection axes disagree. The additional construction cost is recovered through per-token decode savings after roughly tens of thousands of requests.
- Abstract(参考訳): 完全なトランス層を除去することは標準的なサービスアーキテクチャを保存するが、既存の深度圧縮法は実質的な品質を失い、その損失はモデルによって予測不可能に変化する。
XMergeは2つのコンポーネントによるポストトレーニング手法である。
クロス軸選択は、相対値の低いブロックと角度の隠れ状態の変化を識別し、局所的な境界再構成は、元の2ブロック出力と一致するように、隣接した残ブロックに適合する。
XMergeはタスクラベルやエンドツーエンドの微調整を一切使用せず、アーキテクチャの変更も追加の推論時間パラメータも導入していない。
7つのLlamaとQwenのバックボーン(0.5B-8B)、5つの出版ベースライン、3つのレイヤー還元レベルのうち、ベースラインよりも大きな利点は最も攻撃的な除去において最大である。
タスクレベルのブートストラップでは、最大3つのCOREマージンに対する95%の信頼区間がゼロを除いた。
14個のセル(モデル、レジーム)全体では、ゼロショットとインコンテキストのレジームの両方でトップ2をランク付けし、崩壊しない唯一の評価演算子であり、第1のキャリブレーションプローブ(1つのバックボーン)では、最良の校正演算子である。
アブレーションは、局所的な再構成がほとんどの利得をもたらすことを示しているが、一方、交叉軸融合は2つの選択軸が一致しない場合に有効である。
追加の建設コストは、約数万の要求の後に、トーケン単位のデコードセーブによって回収される。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - LegoLM: Structured Weight Sharing for Large Language Models [0.0]
大規模言語モデルのための構造付き重み共有圧縮フレームワークであるLegoLMを提案する。
LegoLMは2つの障害モードを解決している。
GPT-2 の小型(124M) と Mistral-7B 全体で、LegoLM は Mistral-7B 上の 4.41X 圧縮で +0.03% PPL の劣化を達成する。
論文 参考訳(メタデータ) (2026-08-09T11:51:14Z) - ReBRAC-v2: The Return of the King [9.34711333978267]
本稿では、RLアクターとして正確な正規化フローを直接訓練するReBRAC-v2を紹介する。
このレシピをタスク毎に個別にチューニングするのではなく、単一の共有構成を開発する。
一般的な10のOGBenchカテゴリで、ReBRAC-v2の平均は74.8であり、次のベストアグリゲーションの結果は52.3である。
論文 参考訳(メタデータ) (2026-08-02T12:42:20Z) - Reactive 3D Motion Planning for a Franka Arm via Star-World Workspace Reshaping [0.0]
安全インフレーションは、近くの障害物が重なり、多くの変調ベースの反応性プランナーが使用する不規則な障害物の仮定に違反する可能性がある。
フランカ・エミカ・パンダマニピュレータの3次元反応性制御のためのStar-Worldワークスペース再構成について検討する。
目標達成率,パス長比,計算時間を用いて,6つのPyBulletシナリオにおける再形および非形障害物表現を比較した。
論文 参考訳(メタデータ) (2026-07-27T23:12:32Z) - DeRes: Decoupling Residual Stability and Adaptivity for Scalable CTR Prediction [0.343054185715673]
トランスフォーマーベースのCTRモデルは、残差接続におけるボトルネックの増大に直面している。
最近の注意に基づく残差変種(AttnRes)は、言語モデルにおけるこの部分に対応する。
本稿では,各層を2つの並列経路にルートするDeReについて述べる。
論文 参考訳(メタデータ) (2026-06-06T05:07:16Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - CRMA: A Spectrally-Bounded Backbone for Modular Continual Fine-Tuning of LLMs [0.0]
我々は、内部混合行列 M がシンクホーン正規化による全ての前方通過において二重確率である残留アダプタ CRMA を紹介する。
5つのドメインにまたがるMistral-7Bでは、モジュラー・パー・タスクのLoRAは、+42.96%+/-5.5(ナイーブ微調整)から-0.17%+/-0.17までのバックボーンの損失相対的ドリフトを仲介する。
論文 参考訳(メタデータ) (2026-05-29T21:50:23Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - PlueckerNet: Learn to Register 3D Line Reconstructions [57.20244406275875]
本稿では,ユークリッド空間における2つの部分重畳された3次元線再構成の問題をニューラルネットワークで解く手法を提案する。
室内および屋外の両方のデータセットを用いた実験により,本手法の登録精度(回転と翻訳)は,ベースラインを著しく上回ることがわかった。
論文 参考訳(メタデータ) (2020-12-02T11:31:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。