論文の概要: Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2604.16378v1
- Date: Tue, 24 Mar 2026 20:21:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:13.943833
- Title: Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning
- Title(参考訳): Reciprocal Co-Training (RCT):強化学習によるグラディエントベースモデルと非微分モデルとの結合
- Authors: Yunshuo Tian, Akayou Kitessa, Tanuja Chitnis, Yijun Zhao,
- Abstract要約: 大規模言語モデル(LLM)と古典的な機械学習手法は、予測モデリングに補完的な長所を提供する。
LLMはテキストデータに対する勾配に基づく最適化に依存しているが、Random Forests (RF) のようなモデルは微分不可能な特徴分割を採用している。
本研究では,LLMとRF分類器を併用した相互協調学習フレームワークを提案する。
- 参考スコア(独自算出の注目度): 3.8126346464908067
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) and classical machine learning methods offer complementary strengths for predictive modeling, yet their fundamentally different representations and training paradigms hinder effective integration: LLMs rely on gradient-based optimization over textual data, whereas models such as Random Forests (RF) employ non-differentiable feature partitioning. This work introduces a reciprocal co-training framework that couples an LLM with an RF classifier via reinforcement learning, creating an iterative feedback loop in which each model improves using signals from the other. Tabular data are reformulated into standardized textual representations for the LLM, whose embeddings augment the RF feature space, while calibrated RF probability estimates provide feedback signals that guide reinforcement learning updates of the LLM. Experiments across three medical datasets demonstrate consistent performance gains for both models, with particularly strong effects for the LLM. Ablation analyses show that iterative refinement, hybrid reward design, and dimensionality control jointly contribute to these gains. The proposed framework provides a general mechanism that allows incompatible model families to leverage each other's strengths through bidirectional adaptation.
- Abstract(参考訳): 大規模言語モデル(LLM)と古典的な機械学習手法は、予測モデリングに補完的な強みを提供するが、その基本的な表現と訓練パラダイムは、効果的な統合を妨げる: LLMは、テキストデータよりも勾配に基づく最適化に依存しているのに対し、ランダムフォレスト(RF)のようなモデルは、非微分可能な特徴分割を採用している。
本研究は,LLMとRF分類器を相互に結合する相互協調学習フレームワークを導入し,各モデルが他方からの信号を用いて改善する反復フィードバックループを作成する。
音節データをLLMの標準化されたテキスト表現に再構成し、埋め込みによりRF特徴空間が増大し、キャリブレーションされたRF確率推定値がLLMの強化学習更新を導くフィードバック信号を提供する。
3つの医療データセットに対する実験は、両方のモデルで一貫したパフォーマンス向上を示しており、特にLLMには強い影響がある。
アブレーション分析により, 反復精製, ハイブリッド報酬設計, 次元制御がこれらの利得に共同で寄与することが示された。
提案するフレームワークは、非互換なモデルファミリーが双方向適応を通じて互いの強みを活用できる一般的なメカニズムを提供する。
関連論文リスト
- LLMs as High-Dimensional Nonlinear Autoregressive Models with Attention: Training, Alignment and Inference [15.493230983626281]
トランスフォーマーアーキテクチャに基づく大規模言語モデル(LLM)は通常、アーキテクチャコンポーネントやトレーニング手順のコレクションを通して記述される。
注意に基づく高次元非線形自己回帰モデルとしてLSMを定式化する。
論文 参考訳(メタデータ) (2026-01-31T00:37:53Z) - Intrinsic Training Signals for Federated Learning Aggregation [13.540945877050525]
フェデレートラーニング(FL)は、データプライバシを保持しながら、分散クライアント間で協調的なモデルトレーニングを可能にする。
この研究は、既存のトレーニング信号だけで効果的なモデルマージが達成できることを実証している。
論文 参考訳(メタデータ) (2025-07-09T13:03:23Z) - A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models [103.88578274567784]
MeRF(Motivation-enhanced Reinforcement Finetuning)は、大規模共振モデルの強化微調整を強化する直感的かつ効果的な方法である。
MeRFは報酬仕様を直接プロンプトに注入し、最適化目標を認識するためのコンテキスト内モチベーションとして機能する。
MeRFはRLVRベースラインよりもパフォーマンスが大幅に向上する。
論文 参考訳(メタデータ) (2025-06-23T10:37:57Z) - Estimating the Effects of Sample Training Orders for Large Language Models without Retraining [49.59675538160363]
大規模言語モデル(LLM)において,サンプルの訓練順序が重要な役割を担っている
従来の手法では、様々なサンプル順序でモデルを再訓練する必要がある。
リトレーニングフリーのフレームワークを設計することで従来の手法を改善します。
論文 参考訳(メタデータ) (2025-05-28T07:07:02Z) - Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models [48.15777554876988]
伝統的なアライメント手法では、しばしば大きな事前訓練されたモデルを再訓練する必要がある。
本稿では,アライメント処理を重要サンプリングの一種として形式化する新しいtextitResidual Alignment Model (textitRAM) を提案する。
本稿では,トークンレベルの復号化を反復的に行う再サンプリングアルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-05-26T08:53:02Z) - Insights from the Inverse: Reconstructing LLM Training Goals Through Inverse Reinforcement Learning [7.803423399566274]
Reinforcement Learning from Human Feedbackで訓練された大規模言語モデル(LLM)は、目覚ましい能力を示しているが、その基盤となる報酬関数や意思決定プロセスは不透明である。
本稿では, 逆強化学習(IRL)を用いて暗黙の報酬関数を復元することにより, LLMを解釈する新しい手法を提案する。
我々は,ヒトの嗜好を予測するために,最大85%の精度で報酬モデルを抽出し,様々な大きさの毒性に整合したLSMの実験を行った。
論文 参考訳(メタデータ) (2024-10-16T12:14:25Z) - DaRec: A Disentangled Alignment Framework for Large Language Model and Recommender System [83.34921966305804]
大規模言語モデル (LLM) はレコメンデーションシステムにおいて顕著な性能を示した。
LLMと協調モデルのための新しいプラグ・アンド・プレイアライメントフレームワークを提案する。
我々の手法は既存の最先端アルゴリズムよりも優れている。
論文 参考訳(メタデータ) (2024-08-15T15:56:23Z) - CoMMIT: Coordinated Multimodal Instruction Tuning [90.1532838391285]
マルチモーダル大言語モデル(MLLM)は一般に、バックボーンLLMと非テキスト入力モードの特徴エンコーダ間の協調学習を含む。
本稿では,MLLM命令のチューニングを理論的・経験的両面から解析する。
本稿では,学習のバランスを定量的に測定できるマルチモーダルバランス係数を提案する。
論文 参考訳(メタデータ) (2024-07-29T23:18:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。