論文の概要: CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts
- arxiv url: http://arxiv.org/abs/2606.00609v1
- Date: Sat, 30 May 2026 08:18:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.556037
- Title: CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts
- Title(参考訳): CARE-RL:クロスドメイン競合を緩和するための能力認識強化学習
- Abstract要約: 本稿では、プロトコル対応の報酬生成と機能対応の最適化を組み合わせることで、ドメイン間の競合を緩和するCARE-RLを提案する。
検証不能なタスクに対して、Protocol-Aware Generative Reward Model (PA-GRM)は、トレース条件付き報酬を生成する前に、プロンプトレベルの評価プロトコルとスキーマを構築する。
数学、チャット、命令追従ベンチマークによる実験では、CARE-RLは標準のマルチドメインRLベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 9.061334667823193
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) with verifiable rewards has achieved strong progress in reasoning-oriented LLMs, but extending it to multi-domain RL remains challenging due to reward unreliability in non-verifiable tasks and capability interference across domains. We propose CARE-RL to combine protocol-aware reward generation with capability-aware optimization for mitigating cross-domain conflicts. For non-verifiable tasks, the Protocol-Aware Generative Reward Model (PA-GRM) constructs prompt-level evaluation protocols and schemas before producing trace-conditioned rewards, enabling task-adaptive yet comparable evaluation of open-ended responses. For multi-domain optimization, Direction-Aware Capability Subspace Projection (DACSP) extracts historical capability directions from previous RL stages and modulates later updates by amplifying aligned components, suppressing conflicting components, and preserving orthogonal updates. Experiments across math, chat, and instruction-following benchmarks show that CARE-RL consistently outperforms standard multi-domain RL baselines, achieving Total Avg scores of 47.9 and 50.7 on Qwen2.5-7B and Qwen3-4B, respectively.
- Abstract(参考訳): 検証可能な報酬を持つ強化学習(RL)は、推論指向のLLMにおいて大きな進歩を遂げてきたが、検証不可能なタスクに対する報酬不確実性やドメイン間の能力干渉のため、マルチドメインのRLに拡張することは依然として困難である。
本稿では、プロトコル対応の報酬生成と機能対応の最適化を組み合わせることで、ドメイン間の競合を緩和するCARE-RLを提案する。
検証不能なタスクに対して、Protocol-Aware Generative Reward Model (PA-GRM)は、トレース条件付き報酬を生成する前に、プロンプトレベルの評価プロトコルとスキーマを構築する。
マルチドメイン最適化のために、DECSP(Direction-Aware Capability Subspace Projection)は、以前のRLステージから過去の機能方向を抽出し、整列コンポーネントの増幅、競合コンポーネントの抑制、直交アップデートの保存によって後の更新を変調する。
CARE-RLは数学、チャット、命令追従のベンチマークにより、Qwen2.5-7BとQwen3-4Bでそれぞれ47.9と50.7のAvgスコアを達成し、標準のマルチドメインRLベースラインを一貫して上回っている。
関連論文リスト
- Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency [38.99457938189648]
本稿では、推論遅延下での一般ポリシーのRLに基づく改善を可能にする、遅延対応フレームワークであるAsynchronous RL with Intermediate Information (ARLI)を紹介する。
我々のフレームワークは非同期推論アプローチに基づいており、実行時に動作生成をインターリーブして遅延を隠蔽し、RLとの非互換性に対処する。
シミュレーションおよび実世界の操作タスクにまたがるアプローチを評価し、標準RLが完全に失敗する推論遅延下で効果的な微調整を可能にすることを発見した。
論文 参考訳(メタデータ) (2026-08-24T21:19:50Z) - Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL [55.05743310621117]
Co-RLは、パラメータを共有しない複数の分離されたモデルを、仲間から派生した報酬を使ってRLを通じて同時に最適化するフレームワークである。
我々は,コホート多様性の増大が,自己強化フィードバックループを駆動する相関誤差を減少させることを示す。
論文 参考訳(メタデータ) (2026-08-18T01:16:02Z) - Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork [45.63941874462679]
In-Context Reinforcement Learning (ICRL)は、ファンデーションエージェントが新しいタスクに即時に適応することを可能にするが、Ad-Hoc Teamwork (AHT)において、未知のパートナとの協調が不要な場合、その有効性は未検討のままである。
本稿では,Overcooked-V2 の高スループット JAX 実装をベースに構築された大規模ベンチマーク ICRL4AHT を紹介する。
我々は, アルゴリズム蒸留 (AD) やDPT (Decision-Pretrained Transformer) など, 数百万の遷移にまたがる代表的履歴条件ICRLアルゴリズムを評価する。
論文 参考訳(メタデータ) (2026-05-23T06:39:21Z) - Relative Score Policy Optimization for Diffusion Language Models [29.344961499429257]
拡散大言語モデル(dLLMs)は、並列かつ効率的なテキスト生成への有望な経路を提供する。
抽出可能なシーケンスレベルのログ比の欠如により、既存の手法は高分散ELBOベースの近似に頼らざるを得なくなった。
textbfRelative textbfScore textbfPolicy textbfOptimization (RSPO)を提案する。
論文 参考訳(メタデータ) (2026-05-11T08:58:40Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented Generation [54.071574153853994]
ProRAGは、学習段階の監視をオンライン最適化ループに統合するために設計されたプロセス教師付き強化学習フレームワークである。
本フレームワークは,(1)構造化推論形式でモデルを初期化するための監視されたポリシーワームアップ,(2)中間推論品質を定量化するためのMCTSベースのプロセスリワードモデル(PRM)の構築,(3)細粒度プロセスの好みに合わせてポリシーを調整するためのPRM誘導推論リファインメント,(4)プロセススーパービジョン強化学習と2つのグラニュラリティー・アドバンテージ・メカニズムの4段階から構成される。
論文 参考訳(メタデータ) (2026-01-29T16:04:59Z) - DARL: Encouraging Diverse Answers for General Reasoning without Verifiers [41.35516261603945]
DARLは、参照から制御された偏差範囲内で多様な回答を生成するための強化学習フレームワークである。
我々のフレームワークは、既存の汎用強化学習手法と完全に互換性があり、追加の検証なしでシームレスに統合できる。
論文 参考訳(メタデータ) (2026-01-21T06:23:55Z) - ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking [84.07076200941474]
ArenaRLは、ポイントワイドスカラースコアからグループ内相対ランクにシフトする強化学習パラダイムである。
我々は,グループ内対角アリーナを構築し,安定した有利な信号を得るためのトーナメントベースのランキングスキームを考案する。
実験により、ArenaRLは標準のRLベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-10T08:43:07Z) - From Supervision to Exploration: What Does Protein Language Model Learn During Reinforcement Learning? [76.288870982181]
タンパク質言語モデル(PLM)は、大規模事前学習と拡張性のあるアーキテクチャを通じて高度な計算タンパク質科学を持つ。
強化学習(RL)は探索を拡大し、タンパク質設計における正確な多目的最適化を可能にした。
RLはサンプリング効率を向上し,さらに重要な点として,教師あり学習で捉えない能力を明らかにするかどうかを問う。
論文 参考訳(メタデータ) (2025-10-02T01:31:10Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - RLPR: Extrapolating RLVR to General Domains without Verifiers [103.14103272635893]
本稿では,RLVRを汎用ドメインに外挿するシンプルな検証不要なフレームワークであるRLPRを提案する。
このノイズの多い確率報酬の高分散に対処することが、それを機能させるためには不可欠である。
RLPRはGemma、Llama、Qwenベースのモデルの両方の領域における推論機能の改善を一貫して行っている。
論文 参考訳(メタデータ) (2025-06-23T02:56:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。