論文の概要: MergeSE: Post-Hoc Model Merging for Software Engineering Tasks Without Retraining
- arxiv url: http://arxiv.org/abs/2608.04181v1
- Date: Tue, 04 Aug 2026 19:39:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.60485
- Title: MergeSE: Post-Hoc Model Merging for Software Engineering Tasks Without Retraining
- Title(参考訳): MergeSE: トレーニングなしのソフトウェアエンジニアリングタスクのためのポストホックモデルマージ
- Abstract要約: 我々は、HFaceエンコーダチェックポイントのトレーニング不要モデルマージのためのオープンソースのCLIおよびWebツールである textbfMergeSE を提示する。
MergeSEは、9つのタスクタイプの組み込みレジストリを通じて、SE分類をより広くサポートする。
TIES、DARE-TIES、Wudi、PCB、平均の5つのマージアルゴリズムをサポートしている。
- 参考スコア(独自算出の注目度): 9.757638656919832
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fine-tuned code models often behave as domain specialists and can degrade sharply under distribution shift: in our clone-detection setting, a model trained on same-language clones drops 71\% F1 on cross-language clones, while multi-task training falls to 0.151 F1 on unseen AI-generated clones. Our companion study shows that post-hoc model merging can address this fragmentation, achieving 93\% of multi-task performance without training data while generalizing 4$\times$ better to unseen clone types. However, no practical tool exists that lets SE researchers diagnose checkpoint compatibility, merge specialists, validate results on SE benchmarks, and export models for deployment. We present \textbf{MergeSE}, an open-source CLI and web tool for training-free model merging of HuggingFace encoder checkpoints. While motivated by OOD generalization in clone detection, MergeSE supports SE classification workflows more broadly through a built-in registry of nine task types, including vulnerability detection, defect prediction, and code-smell detection. MergeSE provides five operations: \textit{tasks}, \textit{inspect}, \textit{merge}, \textit{evaluate}, and \textit{export}. It supports five merging algorithms, including TIES, DARE-TIES, Wudi, PCB, and averaging; detects cross-task classification-head mismatches; produces seedable deterministic outputs; and includes bundled benchmark samples for smoke-test reproduction. A full merge of two 124M-parameter checkpoints completes in under 5 seconds on CPU. End-to-end validation confirms that MergeSE-produced checkpoints match reference implementations and recover cross-domain performance from domain-specific specialists. The tool is available online at https://mergese.usask.ca, and the development repository is at https://github.com/srlabUsask/MergeSE.
- Abstract(参考訳): クローン検出設定では、同言語クローンでトレーニングされたモデルは、クロス言語クローンで71\% F1、マルチタスクのトレーニングは、目に見えないAI生成クローンで0.151 F1に低下します。
コンパニオン研究では、ポストホックモデルマージがこの断片化に対処でき、トレーニングデータなしでマルチタスク性能の93%を達成できると同時に、4$\times$を非表示のクローンタイプに最適化できることを示した。
しかし、SE研究者がチェックポイント互換性の診断、スペシャリストのマージ、SEベンチマークの結果の検証、デプロイメント用モデルのエクスポートを可能にする実用的なツールは存在しない。
We present \textbf{MergeSE}, a open-source CLI and web tool for training-free model merging of HuggingFace encoder checkpoints。
クローン検出におけるOOD一般化に動機づけられたMergeSEは、脆弱性検出、欠陥予測、コードスメル検出を含む9つのタスクタイプの組み込みレジストリを通じて、SE分類ワークフローをより広くサポートする。
MergeSEは5つの操作を提供する: \textit{tasks}, \textit{inspect}, \textit{merge}, \textit{evaluate}, \textit{export}。
TIES、DARE-TIES、Wudi、PCB、平均化を含む5つのマージアルゴリズムをサポートし、クロスタスク分類ヘッドミスマッチを検出し、シード可能な決定論的出力を生成し、スモークテスト再生のためのベンチマークサンプルをバンドルする。
2つの124Mパラメータのチェックポイントの完全なマージは、CPU上で5秒以内に完了する。
エンドツーエンドの検証では、MergeSEが生成するチェックポイントが参照実装と一致し、ドメイン固有の専門家からドメイン間のパフォーマンスを回復することを確認した。
このツールはhttps://mergese.usask.caで、開発リポジトリはhttps://github.com/srlabUsask/MergeSEで公開されている。
関連論文リスト
- Numbat: Building and Verifying a Self-Contained Machine-Learning Stack [0.0]
numbatは1つの汎用言語(Zig)で書かれた機械学習スタックで、サードパーティの依存関係はない。
我々はナムバットの構築と検証について報告する。
論文 参考訳(メタデータ) (2026-09-09T08:36:12Z) - A Unified Model for Cross-Domain Clone Detection via Model Merging [9.757638656919832]
現在のディープラーニング検出器は、トレーニング分布の外で大幅に劣化している。
トレーニングされたチェックポイントのみで動作するポストホック手法のファミリーであるモデルマージについて検討する。
同じベースであるTIESマージは、2つのモデルファミリーと3つのランダムシードで検証された効果的なクロスドメイン検出器を生成する。
論文 参考訳(メタデータ) (2026-08-04T20:32:28Z) - Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing [65.59464371673623]
Local Branch Routing (LBR)はトークンレベルのテストタイムスケーリングフレームワークである。
小さなローカルなルックアヘッドツリーを拡張し、言語モデルを通じてすべてのサンプルブランチを転送し、軽量ルータを使用してコミットするdeep-1サブツリーを選択する。
LBRにより、各トークン決定は、完全なソリューションレベルの検索を避けながら、ルート次トーケン分布を超えるエビデンスを使用することができる。
論文 参考訳(メタデータ) (2026-06-24T03:42:44Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - Geometry over Density: Few-Shot Cross-Domain OOD Detection [26.608445978948183]
アウト・オブ・ディストリビューション(OOD)検出は、モデルのトレーニング分布外にあるテストサンプルを特定する。
拡散軌道の情報・幾何学的解析により,この目標を達成する統一的なフレームワークである textbfUFCOD を提案する。
論文 参考訳(メタデータ) (2026-05-05T06:32:16Z) - LIDARLearn: A Unified Deep Learning Library for 3D Point Cloud Classification, Segmentation, and Self-Supervised Representation Learning [1.2599533416395765]
3次元の3次元クラウド解析は、自律運転やロボット工学から林業や生態モニタリングまで幅広い応用の中心となっている。
libは統合されたPyTorchライブラリで、29の教師付きアーキテクチャ、7つのSSL事前トレーニングメソッド、5つのPEFT戦略を含む55以上のモデル構成を統合している。
libは、標準化されたトレーニングランナー、階層化された$K$-fold分割によるクロスバリデーション、自動化/CSVテーブル生成、厳密なマルチモデル比較のための臨界差図を用いたFriedman/Nemenyi統計テスト、200以上の自動テストを備えた総合的なテストスイートを提供する。
論文 参考訳(メタデータ) (2026-04-12T19:10:12Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - Reviving Any-Subset Autoregressive Models with Principled Parallel Sampling and Speculative Decoding [55.2480439325792]
任意の順序言語モデルでは、正しい関節分布からトークンを並列にサンプリングする方法がオープンな問題である。
我々は,任意のサブセット自動回帰モデル (AS-ARM) という,異なるモデルのクラスが解を持っていることを発見した。
我々は,AS-ARMがベンチマークタスクを埋め込んだ200M未満のパラメータモデル間で最先端の性能を実現し,コード生成における50倍のモデルの性能とほぼ一致していることを示す。
論文 参考訳(メタデータ) (2025-04-29T06:33:13Z) - Single-Stage Visual Relationship Learning using Conditional Queries [60.90880759475021]
TraCQは、マルチタスク学習問題とエンティティペアの分布を回避する、シーングラフ生成の新しい定式化である。
我々は,DETRをベースとしたエンコーダ-デコーダ条件付きクエリを用いて,エンティティラベル空間を大幅に削減する。
実験結果から、TraCQは既存のシングルステージシーングラフ生成法よりも優れており、Visual Genomeデータセットの最先端の2段階メソッドを多く上回っていることがわかった。
論文 参考訳(メタデータ) (2023-06-09T06:02:01Z) - Meta-Generating Deep Attentive Metric for Few-shot Classification [53.07108067253006]
本稿では,新しい数ショット学習タスクのための特定のメトリックを生成するための,新しい深度メタジェネレーション手法を提案する。
本研究では,各タスクの識別基準を生成するのに十分なフレキシブルな3層深い注意ネットワークを用いて,メトリクスを構造化する。
特に挑戦的なケースでは、最先端の競合他社よりも驚くほどパフォーマンスが向上しています。
論文 参考訳(メタデータ) (2020-12-03T02:07:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。