論文の概要: F-TIS: Harnessing Diverse Models in Collaborative GRPO
- arxiv url: http://arxiv.org/abs/2605.22537v1
- Date: Thu, 21 May 2026 14:25:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 20:14:18.582909
- Title: F-TIS: Harnessing Diverse Models in Collaborative GRPO
- Title(参考訳): F-TIS:協調GRPOにおける異種モデルのハーネス化
- Authors: Nikolay Blagoev, Oğuzhan Ersoy, Wendelin Boehmer, Lydia Yiyu Chen,
- Abstract要約: Filtered Truncated Importance Smpling (F-TIS)はGRPOスタイルのトレーニングパラダイムであり、ローカルモデルの学習を改善するために、オフ・ポリティクスのサンプルを使用することができる。
F-TISは、純粋に政治訓練と同一の最終モデル収束を示す。
- 参考スコア(独自算出の注目度): 6.113106953880909
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning methods such as GRPO have seen great popularity in LLM post-training. In GRPO, models produce completions to a set of prompts, which are rewarded, and the policy is updated towards the relatively high reward completions. Due to the auto-regressive nature of models, the generation phase of such style of training can be extremely time consuming. As a solution, prior work has sought to distribute the inference step across many nodes, working parallel. These works assume primarily homogeneous models in the training in order to keep samples as close to on-policy as possible. This assumption may be impractical in decentralized systems, where parties with various computes and preferences may wish to collaborate on the same task. Thus, decentralized training requires an approach that can handle heterogeneous models - different models collaborating on the same tasks. However, this leads to highly off-policy samples presented during training, which prior work has identified that off-policy samples can hurt GRPO convergence. To enable heterogeneity, we propose Filtered Truncated Importance Sampling (F-TIS) - a GRPO-style training paradigm that can use off-policy samples to improve local model's learning. Our framework allows various models to collaborate in the same RL training run while being communication efficient. We extensively evaluate F-TIS in various heterogeneous setups and we show that it exhibits identical final model convergence to purely on-sample training. Furthermore, we observe in some setups better generalization on out-of-distribution tasks than on-policy training, increasing model's performance by up to 12\%.
- Abstract(参考訳): GRPOのような強化学習手法は、LLMポストトレーニングにおいて非常に人気がある。
GRPOでは、モデルは報酬を受ける一連のプロンプトの完了を生成し、ポリシーは比較的高い報酬の完了に向けて更新される。
モデルの自動回帰的な性質のため、そのようなトレーニングスタイルの生成フェーズは非常に時間がかかります。
ソリューションとして、事前の作業は、推論ステップを多くのノードに分散し、並列に動作させることを目的としている。
これらの研究は、サンプルをできるだけオン・ポリティクスに近づけるために、トレーニングにおいて主に同質なモデルを仮定する。
この仮定は、様々な計算と好みを持つ当事者が同じタスクで協力したいと願う分散システムでは現実的ではないかもしれない。
したがって、非集中的なトレーニングでは、同じタスクで協力するさまざまなモデルという、異種モデルを扱うためのアプローチが必要です。
しかし、これは、トレーニング中に提示された非常に非政治的なサンプルにつながり、これは以前の研究で、非政治的なサンプルがGRPOの収束を損なう可能性があると判明した。
不均一性を実現するため,地方モデルの学習を改善するために,GRPOスタイルのトレーニングパラダイムであるF-TIS(Filted Truncated Importance Smpling)を提案する。
我々のフレームワークは、コミュニケーション効率を向上しながら、様々なモデルを同じRLトレーニングランで協調することを可能にする。
我々は,F-TISを多種多様なセットアップで広範囲に評価し,本手法が純粋にオンサンプルトレーニングと同一の最終モデル収束を示すことを示した。
さらに、オンライントレーニングよりもアウト・オブ・ディストリビューションタスクをより一般化し、モデルの性能を最大12倍に向上させる設定で観察する。
関連論文リスト
- DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - Reasoning with Sampling: Your Base Model is Smarter Than You Think [52.639108524651846]
本稿では,基本モデル自身の可能性を利用した単純な反復サンプリングアルゴリズムを提案する。
我々のアルゴリズムは、ほぼ一致し、RLのアルゴリズムよりも優れているという推論において、大幅に向上することを示した。
我々の方法は、トレーニング、キュレートされたデータセット、検証器を必要としない。
論文 参考訳(メタデータ) (2025-10-16T17:18:11Z) - Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces [57.466101098183884]
強化学習(Reinforcement Learning, RL)は、現実の多くの問題に共通する大規模なアクション空間にスケールするために苦労する。
本稿では、複雑な環境下での高効率なポリシーとして、離散拡散モデルを訓練するための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-26T21:53:36Z) - Combining Pre-Trained Models for Enhanced Feature Representation in Reinforcement Learning [16.04558746520946]
強化学習(Reinforcement Learning, RL)は、エージェントと環境との相互作用を通じて得られる累積報酬の最大化に焦点を当てている。
我々は、複数の事前学習モデルの埋め込みを組み合わせ、リッチな状態表現を形成する新しいアーキテクチャである、Weight Sharing Attention (WSA)を提案する。
論文 参考訳(メタデータ) (2025-07-09T18:13:52Z) - Probabilistic Federated Prompt-Tuning with Non-IID and Imbalanced Data [35.47385526394076]
微調整事前学習モデルは、適度なデータで複雑なタスクを解決する機械学習の一般的なアプローチである。
事前訓練されたモデル全体を微調整することは、ローカルデータ分布が多様に歪んだフェデレーションデータシナリオでは効果がない。
提案手法は,フェデレーション学習を分散集合モデリングタスクに変換し,事前学習したモデルを世界規模で微調整するための多様なプロンプトを集約する。
論文 参考訳(メタデータ) (2025-02-27T04:31:34Z) - Transferable Post-training via Inverse Value Learning [83.75002867411263]
別個のニューラルネットワーク(すなわち値ネットワーク)を用いた後学習におけるロジットレベルのモデリング変更を提案する。
このネットワークをデモを使って小さなベースモデルでトレーニングした後、推論中に他のトレーニング済みモデルとシームレスに統合することができる。
得られた値ネットワークは、パラメータサイズの異なる事前学習されたモデル間で広い転送性を有することを示す。
論文 参考訳(メタデータ) (2024-10-28T13:48:43Z) - Leveraging Foundation Models for Multi-modal Federated Learning with Incomplete Modality [41.79433449873368]
我々は、事前学習完了(FedMVP)を用いた新しいマルチモーダル・コントラスト学習法、フェデレーション・マルチモーダル・コントラストVeトレーニングを提案する。
FedMVPは、大規模な事前トレーニングモデルを統合して、フェデレーショントレーニングを強化する。
実世界の2つの画像テキスト分類データセットよりも優れた性能を示す。
論文 参考訳(メタデータ) (2024-06-16T19:18:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。