論文の概要: Selective Transfer of RL Updates for Visual Reasoning
- arxiv url: http://arxiv.org/abs/2610.08659v1
- Date: Tue, 06 Oct 2026 16:43:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.125852
- Title: Selective Transfer of RL Updates for Visual Reasoning
- Title(参考訳): 視覚推論のためのRL更新の選択的転送
- Abstract要約: 我々は、強化学習(RL)によって引き起こされるパラメータ変化を分離し、トレーニングステージ更新周辺の機能伝達を定式化する。
本研究は, モデル間転送性に大きく違いがみられ, 完全更新よりも支配的な方向転送が効果的であることが確認された。
3つのモデルファミリと5つのビジュアル推論ベンチマークで、Selective-RLは15の比較のうち12でフルアップデートの受信者を改善している。
- 参考スコア(独自算出の注目度): 5.642770204638238
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model merging provides a training-free way to transfer reasoning capabilities from language models to vision-language models (VLMs), but endpoint-based transfer can conflate pre-existing model differences with changes acquired during reasoning post-training. We instead formulate capability transfer around the training-stage update, isolating the parameter changes induced by reinforcement learning (RL). Yet transferring this update in full remains suboptimal: we find that its components differ substantially in cross-model transferability, with dominant directions transferring more effectively than the complete update. Based on this finding, we introduce Selective-RL, which isolates the RL-stage update, retains its dominant matrix-wise directions with magnitude preservation, and transfers them to the language modules of a VLM. Across three model families and five visual-reasoning benchmarks, Selective-RL improves full-update interpolation in 12 of 15 comparisons, including an 8.55 percentage-point MathVision gain on the Qwen recipient. Matched controls show that update magnitude or arbitrary low rank alone does not reproduce these gains. These results highlight a distinction between what is acquired during post-training and what remains transferable across models, providing a training-stage perspective on cross-model capability transfer. Code is available at https://anonymous.4open.science/r/selective-rl.
- Abstract(参考訳): モデルマージは、推論機能を言語モデルから視覚言語モデル(VLM)に移行するためのトレーニング不要の手段を提供するが、エンドポイントベースの転送は、推論後トレーニングで取得した変更と既存のモデルの違いを説明できる。
代わりに,強化学習(RL)によって引き起こされるパラメータ変化を分離し,トレーニングステージ更新の周囲の能力伝達を定式化する。
しかし、この更新を完全で転送することは依然として最適であり、そのコンポーネントはクロスモデル転送容易性において大きく異なり、完全な更新よりも支配的な方向転送の方が効果的である。
そこで本研究では,RLステージ更新を分離したSelective-RLを導入し,その行列方向を大域保存とともに保持し,VLMの言語モジュールに転送する。
3つのモデルファミリと5つのビジュアル推論ベンチマークで、Selective-RLは、Qwen受信者に対する8.55ポイントのMathVisionゲインを含む15の比較のうち、フルアップデートの補間を改善している。
一致した制御は、更新等級または任意の低ランクのみがこれらの利得を再現しないことを示している。
これらの結果は、ポストトレーニング中に取得したものとモデル間で転送可能なものとを区別し、クロスモデル機能移行に関するトレーニング段階の視点を提供する。
コードはhttps://anonymous.4open.science/r/selective-rlで入手できる。
関連論文リスト
- The Low-Rank Structure of VLA Reinforcement Learning [12.712140357467346]
強化学習(Reinforcement Learning, RL)は、視覚-言語-行動モデル(VLA)の訓練後モデルに使用される。
本稿では,パラメータ空間における学習信号のエンコード方法を検討することによって,RLがVLAポリシーにどう影響するかを検討する。
論文 参考訳(メタデータ) (2026-09-28T08:32:26Z) - SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training [70.84726713548099]
SAEベースのTransferability Score(STS)は、トレーニング後のTransferabilityを予測するための新しい指標である。
STSは教師付き微調整の伝達可能性を正確に予測し,実際の性能変化とともに0.7以上のピアソン相関係数を達成できることを示す。
論文 参考訳(メタデータ) (2026-03-03T12:01:09Z) - DRL: Discriminative Representation Learning with Parallel Adapters for Class Incremental Learning [63.65467569295623]
本稿では,これらの課題に対処するための差別的表現学習(DRL)フレームワークを提案する。
逐次学習を効果的かつ効率的に行うために、DRLのネットワークはPTM上に構築される。
我々のDRLは、CIL時代を通して、他の最先端の手法よりも一貫して優れています。
論文 参考訳(メタデータ) (2025-10-14T03:19:15Z) - How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence [52.9442657690445]
大規模言語モデル(LLM)の成功にはポストトレーニングが不可欠である
学習後効果をよりよく理解するために,4つの視点からベースとポストトレーニング後のLLMを比較した。
論文 参考訳(メタデータ) (2025-04-03T06:30:55Z) - Efficient Model Development through Fine-tuning Transfer [13.244979249153872]
差分ベクトルの転送はターゲットベースモデルの性能を大幅に向上させることができることを示す。
我々は多言語タスクのパフォーマンス向上を示し、マラガシーとトルコのグローバルMMLUは4.7%と15.5%改善した。
実験により,パラメータ空間の線形連結領域にソースモデルとターゲットモデルが存在する場合,微調整転送が最も効果的であることが示唆された。
論文 参考訳(メタデータ) (2025-03-25T23:24:43Z) - Transferable Post-training via Inverse Value Learning [83.75002867411263]
別個のニューラルネットワーク(すなわち値ネットワーク)を用いた後学習におけるロジットレベルのモデリング変更を提案する。
このネットワークをデモを使って小さなベースモデルでトレーニングした後、推論中に他のトレーニング済みモデルとシームレスに統合することができる。
得られた値ネットワークは、パラメータサイズの異なる事前学習されたモデル間で広い転送性を有することを示す。
論文 参考訳(メタデータ) (2024-10-28T13:48:43Z) - Emergent Agentic Transformer from Chain of Hindsight Experience [96.56164427726203]
簡単なトランスフォーマーベースモデルが時間差と模倣学習に基づくアプローチの両方と競合することを示す。
単純なトランスフォーマーベースのモデルが時間差と模倣学習ベースのアプローチの両方で競合するのはこれが初めてである。
論文 参考訳(メタデータ) (2023-05-26T00:43:02Z) - Can Wikipedia Help Offline Reinforcement Learning? [12.12541097531412]
大規模なオフザシェルフデータセットが不足しているため、微調整強化学習モデルは難しい。
最近の研究では、Transformerアーキテクチャの導入により、オフラインのRLに対処し、その結果を改善している。
オフラインRLタスクを微調整した場合、他の領域(ビジョン、言語)における事前訓練されたシーケンスモデルの転送可能性について検討する。
論文 参考訳(メタデータ) (2022-01-28T13:55:35Z) - Meta-learning Transferable Representations with a Single Target Domain [46.83481356352768]
微調整とジョイントトレーニングは、下流タスクの精度を常に向上させるわけではない。
伝達可能な特徴を学習するためのメタ表現学習(MeRLin)を提案する。
MeRLinは、様々な実世界のビジョンとNLP転送学習ベンチマークにおいて、従来の最先端のトランスファー学習アルゴリズムを実証的に上回っている。
論文 参考訳(メタデータ) (2020-11-03T01:57:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。