論文の概要: DARTS: Decoder-Aware Representation Tuning via Surgery for Model Merging
- arxiv url: http://arxiv.org/abs/2608.28547v1
- Date: Fri, 28 Aug 2026 17:22:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.419213
- Title: DARTS: Decoder-Aware Representation Tuning via Surgery for Model Merging
- Title(参考訳): DARTS:Decoder-Aware Representation Tuning by Surgery for Model Merging
- Abstract要約: 手術によるDecoder-Aware Representation Tuning(DARTS)を提案する。
DARTSは、エラーが生成品質に最も影響を与える高エントロピー位置でのアップウェイト補正に、新しいエントロピー重み付きL1損失を用いる。
DARTSは, 既往のパラメータを付加しながら, 標準的な手術法よりも有意に改善したことを示す。
- 参考スコア(独自算出の注目度): 0.30586855806896046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model merging combines multiple task-specific fine-tuned LLMs into a single multi-task model without additional training. However, merged models are known to suffer from representation bias: systematic drift between the merged model's hidden states and those of each individual source model. Prior work (Yang et al., 2024a) study and mitigate this bias for encoder-based vision models using a lightweight correction module trained with L1 loss. However, such bias is not studied for decoder models due to their autoregressive nature. We analyze the problem of representation bias in decoder models, and show two challenges absent in encoders: (1) the causal attention mask causes bias to accumulate across token positions, requiring position-dependent correction; and (2) not all token positions are equally important, i.e., high-entropy (decision-critical) positions matter far more than low-entropy ones. To address these challenges, we propose Decoder-Aware Representation Tuning via Surgery (DARTS). DARTS employs a novel entropy-weighted L1 loss to upweight correction at high-entropy positions where errors most affect generation quality, and a per-position additive bias that captures position-dependent error without overparameterization. We perform extensive evaluation on three domains: code generation (HumanEval), mathematical reasoning (GSM8K), and instruction following (AlpacaEval) on Llama-2-7B models, and show DARTS achieves significant improvement over the standard surgery approach while adding negligible parameters ($0.1\%$ of total parameters).
- Abstract(参考訳): モデルマージは、複数のタスク固有の微調整LDMを、追加のトレーニングなしで単一のマルチタスクモデルに結合する。
しかし、マージされたモデルは、表現バイアスに悩まされることが知られている:マージされたモデルの隠れ状態と個々のソースモデルの間の体系的なドリフト。
以前の研究(Yang et al , 2024a)では、L1損失を訓練した軽量補正モジュールを用いて、エンコーダベースの視覚モデルに対して、このバイアスを緩和した。
しかし、そのようなバイアスは自己回帰性のためデコーダモデルでは研究されない。
我々はデコーダモデルにおける表現バイアスの問題を分析し、(1)因果注意マスクがトークン位置をまたいでバイアスを蓄積し、位置依存補正を必要とすること、(2)全てのトークン位置が等しく重要であるわけではないこと、すなわち、高エントロピー(決定クリティカル)の位置が低エントロピーよりもはるかに重要であること、の2つの課題を示す。
これらの課題に対処するため,DARTS(Decoder-Aware Representation Tuning via Surgery)を提案する。
DARTSは、エラーが生成品質に最も影響を与える高エントロピー位置でのアップウェイト補正に、新しいエントロピー重み付きL1損失と、オーバーパラメータ化なしで位置依存誤差をキャプチャするパーポジション付加バイアスを用いる。
我々はLlama-2-7Bモデルのコード生成(HumanEval)、数学的推論(GSM8K)、命令追従(AlpacaEval)の3つの領域に対して広範囲に評価を行い、DARTSが無視可能なパラメータ(総パラメータの0.1 %)を加えながら標準手術アプローチよりも大幅に改善されていることを示す。
関連論文リスト
- Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection [85.49213290363834]
理解力向上型モデル協調手法(UE-MCM)を提案する。
より効率的な粗いビデオ理解と正確なきめ細かなアクション推論を組み合わせる。
結果として得られるシステムは速度と精度のバランスを保ち、エゴセントリックな指導ビデオの微妙で稀で曖昧な誤りを検出するのに効果的である。
論文 参考訳(メタデータ) (2026-06-01T11:50:16Z) - RAE-AR: Taming Autoregressive Models with Representation Autoencoders [61.73674018219353]
分散正規化によるトークンの単純化により、モデリングの難易度を緩和し、収束性を向上させる。
我々は、露光バイアスを軽減するために、訓練中にガウスノイズ注入を取り入れて予測を強化する。
この作業は、視覚的理解と生成的モデリングをまたいだ、より統一されたアーキテクチャの道を開く。
論文 参考訳(メタデータ) (2026-04-02T02:39:28Z) - MAGIC: Achieving Superior Model Merging via Magnitude Calibration [46.30162864565835]
モデルマージは、特殊化されたモデルの能力を統一されたモデルにマージすることを目的としている。
特徴は方向と大きさの2つの重要な構成要素から成っている。
MAGnItude (MAGIC) は,特徴空間と重み空間の層規模を補正するプラグイン・アンド・プレイ・フレームワークである。
論文 参考訳(メタデータ) (2025-12-22T12:13:17Z) - Decoding Partial Differential Equations: Cross-Modal Adaptation of Decoder-only Models to PDEs [27.331524018411926]
時間依存シミュレーションタスクに対して,エンコーダのみのモデルとデコーダのみのモデルを比較した。
デコーダのみのモデルは、既存のアプローチを修正せずに適用した場合に、エンコーダのみのモデルよりもはるかに悪いことが判明した。
自己回帰モデルにおいて、双方向性を模倣しようとする2つの新しいアプローチ、Parallel FlippingとSequence Duublingを導入する。
論文 参考訳(メタデータ) (2025-10-06T18:46:50Z) - Dual-Stage Reweighted MoE for Long-Tailed Egocentric Mistake Detection [85.0189917888094]
本稿では,微妙で頻繁なミスによって生じる課題に対処するため,Dual-Stage Reweighted Mixture-of-Experts (DR-MoE) フレームワークを提案する。
提案手法は,特に稀かつ曖昧な誤りの特定において,高い性能を達成する。
論文 参考訳(メタデータ) (2025-09-16T12:00:42Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery [54.866490321241905]
モデルマージに基づくマルチタスク学習(MTL)は、複数のエキスパートモデルをマージしてMTLを実行するための有望なアプローチを提供する。
本稿では,統合モデルの表現分布について検討し,「表現バイアス」の重要な問題を明らかにする。
このバイアスは、マージされたMTLモデルの表現と専門家モデルの間の大きな分布ギャップから生じ、マージされたMTLモデルの最適下性能に繋がる。
論文 参考訳(メタデータ) (2024-10-18T11:49:40Z) - Alirector: Alignment-Enhanced Chinese Grammatical Error Corrector [25.450566841158864]
中国の文法的誤り訂正(CGEC)は、自己回帰生成モデルを採用する際に深刻な過度な過度な問題に直面している。
過補正問題に対するアライメント強化補正器を提案する。
3つのCGECデータセットの実験結果から,本手法の有効性が示された。
論文 参考訳(メタデータ) (2024-02-07T05:56:54Z) - P-WAE: Generalized Patch-Wasserstein Autoencoder for Anomaly Screening [17.24628770042803]
Patch-wise Wasserstein AutoEncoder (P-WAE) アーキテクチャを提案する。
特に、ジグソーパズルの解法と結合したパッチワイド変分推論モデルを設計する。
MVTec ADデータセットを用いた総合的な実験は、我々のプロポの優れた性能を実証する。
論文 参考訳(メタデータ) (2021-08-09T05:31:45Z) - Discrete Auto-regressive Variational Attention Models for Text Modeling [53.38382932162732]
変分オートエンコーダ(VAE)はテキストモデリングに広く応用されている。
情報不足と後部崩壊という2つの課題に悩まされている。
本稿では,自己回帰変動注意モデル(DAVAM)を提案する。
論文 参考訳(メタデータ) (2021-06-16T06:36:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。