論文の概要: Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
- arxiv url: http://arxiv.org/abs/2608.27409v1
- Date: Thu, 27 Aug 2026 17:38:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.514286
- Title: Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
- Title(参考訳): ドメイン全体にわたるRLVR機能の統合 - フュージョンパラダイムの奥深く
- Authors: Siye Wu, Kai Yang, Yuchen Cai, Xin Xu, Peng-Yuan Wang, Jiaxuan Wang, Jiashun Liu, Jiafei Lyu, Yangkun Chen, Saiyong Yang, Yanghua Xiao,
- Abstract要約: 再利用した人工物によって3つの融合パラダイムを編成する。
モデルスケールとマルチベンチマークスイートで、共有専門家とデータを使用して、これら3つを比較します。
- 参考スコア(独自算出の注目度): 50.28963615440865
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate domain experts and subsequently consolidating them. We organize three fusion paradigms by the artefacts they reuse: Merge combines expert task vectors, Mix RL pools their datasets, and multi-teacher on-policy distillation (MOPD) uses both. Because they have largely been studied in isolation, how they compare and how to choose among them remain unclear. We compare all three using shared experts and data across model scales and a multi-domain benchmark suite. Although their average performance differs by at most 1.4 points, the gap reaches 8.6 points on a single benchmark, with domain-level variation tracking cross-domain relations visible in task-vector geometry. Training dynamics expose distinct constraints: Mix RL depends on domain mixture proportions, MOPD remains bounded by its teachers, and Merge compresses all expert updates into one. All three improve single-sample accuracy without measurable gains in solution coverage or losses in held-out capabilities. These results yield a practical guideline: use Merge when experts already exist and cheap fusion is paramount; Mix RL when training a unified model without experts, with domain proportions adjusted for cross-domain transfer; and MOPD when preserving domain-specific gains matters more than surpassing teachers or minimizing end-to-end cost.
- Abstract(参考訳): 検証可能な報酬(RLVR)による強化学習は、大きな言語モデルの特定の能力を改善するが、複数の能力をカバーするには、しばしば別々のドメインエキスパートを訓練し、それらを統合する。
Mergeは、専門家のタスクベクトルとデータセットを混合するRLプールと、MOPD(Multi-Teacher on-policy distillation)の両方を併用する。
主に単独で研究されているため、どのように比較し、どのように選択するかは未だ不明である。
モデルスケールとマルチベンチマークスイートで、共有専門家とデータを使用して、これら3つを比較します。
平均的なパフォーマンスは少なくとも1.4ポイントは異なるが、ギャップは1つのベンチマークで8.6ポイントに達し、ドメインレベルの変動追跡はタスクベクトル幾何学で見ることができる。
混合RLはドメインの混合比率に依存し、MOPDは教師によって拘束され、Mergeはすべての専門家の更新を1つに圧縮する。
3つとも、ソリューションカバレッジやホールドアウト能力の損失を計測することなく、シングルサンプルの精度を向上させる。
これらの結果は、専門家がすでに存在していて、安価な融合が最重要であるMergeの使用、専門家がいない統一モデルのトレーニング、ドメイン間の転送に調整されたドメイン比率のトレーニングにおけるMix RL、ドメイン固有のゲインを維持する場合のMOPDは、教師を超越したり、エンドツーエンドコストを最小限に抑えたりすることよりも重要である、という実践的なガイドラインを生み出します。
関連論文リスト
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL [55.05743310621117]
Co-RLは、パラメータを共有しない複数の分離されたモデルを、仲間から派生した報酬を使ってRLを通じて同時に最適化するフレームワークである。
我々は,コホート多様性の増大が,自己強化フィードバックループを駆動する相関誤差を減少させることを示す。
論文 参考訳(メタデータ) (2026-08-18T01:16:02Z) - Multi-Domain Learning with Global Expert Mapping [102.62297074508147]
Mixture-of-Experts (MoE)モデルは、入力を専門分野(専門家)にルーティングすることでスケーラブルなソリューションを提供する。
本稿では,学習ルータをグローバルスケジューラに置き換えるプランナー・コンパイラフレームワークであるGEMを提案する。
我々のプランナーは線形プログラミングの緩和に基づいて、データセットを専門家に分数的に割り当てる一方、コンパイラはこのソフトプランを決定論的でキャパシティを意識したマッピングに変換するために階層的なラウンドリングを適用する。
実験の結果、GEM-DINOはUODBベンチマークで最先端のパフォーマンスを達成し、表現不足のデータセットに顕著な利益をもたらし、タスク干渉をわずかに解決していることがわかった。
論文 参考訳(メタデータ) (2026-04-20T21:09:34Z) - To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models [36.65680320664014]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデル(LLM)の明示的推論能力を刺激する上で重要な役割を果たしている。
我々は、オープンソースのデータセットを用いて、広範囲な質的、定量的な実験を設計する。
ドメイン間のRLVRは相互干渉がほとんどなく、推論集約ドメインは相互相乗効果を示す。
論文 参考訳(メタデータ) (2026-02-13T03:25:13Z) - Token-Level LLM Collaboration via FusionRoute [60.72307345997823]
FusionRouteはトークンレベルのマルチLLMコラボレーションフレームワークである。
各デコーディングステップで最も適した専門家を選択し、選択した専門家の次のTokenディストリビューションを洗練または修正する補完ロジットをコントリビュートする。
シーケンスレベルのコラボレーションとトークンレベルのコラボレーション、モデルマージ、ダイレクト微調整の両方に優れています。
論文 参考訳(メタデータ) (2026-01-08T16:53:16Z) - DoReMi: A Domain-Representation Mixture Framework for Generalizable 3D Understanding [10.259254902492978]
DoReMiはMixture-of-Experts(MoE)フレームワークで、Domain-Aware Expertsブランチと統一されたRepresentationブランチを共同でモデル化する。
DoReMiはScanNet Valで80.1% mIoU、S3DISで77.2% mIoUを達成した。
論文 参考訳(メタデータ) (2025-11-14T12:32:45Z) - Mixture of Thoughts: Learning to Aggregate What Experts Think, Not Just What They Say [4.273730624882391]
Mixture of Thoughts (MoT) は、グローバルなルーティング方式の下で、異種の専門家間の潜在レベル協調のための単純な方法である。
MoTは現在のルーティングと集約ベースのアベンジャーズをそれぞれ$+0.38%$と$+2.92%$で上回っている。
論文 参考訳(メタデータ) (2025-09-25T13:50:09Z) - HDEE: Heterogeneous Domain Expert Ensemble [0.3641292357963815]
いくつかの研究は、密集モデルの訓練における通信オーバーヘッドを低減し、集中化への依存を減らすことを目的としている。
通信オーバーヘッドを自然な極端に削減するというこの考え方は、従来の集中的な設定で訓練された大規模な密集モデルよりも優れていることが示されている。
評価に使用する21ドルのデータドメインのうち, 不均一なアンサンブルが20ドルで最も低いパープレキシティスコアを達成していることを示す。
論文 参考訳(メタデータ) (2025-02-26T18:30:49Z) - META: Mimicking Embedding via oThers' Aggregation for Generalizable
Person Re-identification [68.39849081353704]
Domain Generalizable (DG) Person Re-identification (ReID)は、トレーニング時に対象のドメインデータにアクセスすることなく、見えないドメインをまたいでテストすることを目的としている。
本稿では,DG ReID のための OThers' Aggregation (META) を用いた Mimicking Embedding という新しい手法を提案する。
論文 参考訳(メタデータ) (2021-12-16T08:06:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。