論文の概要: CARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning
- arxiv url: http://arxiv.org/abs/2609.20098v1
- Date: Thu, 17 Sep 2026 11:59:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.251278
- Title: CARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning
- Title(参考訳): CARE-VI:オフポリティアクター批判学習における価値向上のための保守的適応的信頼性推定
- Abstract要約: 我々は、保守的適応ランク付け・スクリーニング(CARS)とセレクタ・評価値アセスメント(SEVA)を開発する。
DAREは、候補信頼性、セレクタと評価器信号のギャップ、および有限ステージ係数を用いて、各残差補正を規制する。
CARE-VIは、批評家のレグレッションとアクターのアップデートのためのバックボーンインターフェースを保存するエビデンス規制されたターゲット構築フレームワークである。
- 参考スコア(独自算出の注目度): 9.09344103114193
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable temporal-difference targets are central to off-policy actor-critic learning. Direct value improvement refines the next-state target with alternative actions, but the reliability of this refinement depends on how candidate actions are ranked, reviewed, and weighted. Noisy rankings may force premature candidate commitment, reusing selection scores may bias target valuation, and fixed enhancement weights may amplify weak evidence. To address these risks, we develop Conservative Adaptive Ranking and Screening (CARS), which retains an ordered candidate prefix within a preset budget and narrows it only when the observed boundary gap exceeds a disagreement-scaled uncertainty radius. Selector-Evaluator Value Assessment (SEVA) uses selector critics to order candidates and a separately parameterized evaluator critic to review the selected value, then caps the reviewed value at the selector reference. Dynamic Adaptive Risk-aware Enhancement (DARE) then regulates each residual correction using candidate reliability, the gap between selector and evaluator signals, and a finite stage factor. Together, CARS, SEVA, and DARE form CARE-VI, an evidence-regulated target construction framework that preserves the backbone interfaces for critic regression and actor updates. The analysis bounds the CARS boundary error, the SEVA selected-value overestimation, and the one-sided deviation of the DARE residual displacement from its population counterpart, and establishes fixed-policy recovery after the finite-stage perturbation ends. Experiments with SAC, TD3, and TD7 on four MuJoCo tasks show that CARE-VI achieves the highest mean return in all twelve settings. Grouped ablations and scalar diagnostics support the roles of the three components in improving target reliability.
- Abstract(参考訳): 信頼できる時間差のターゲットは、非政治的なアクター批判的学習の中心である。
直接価値改善は代替行動によって次の状態目標を洗練させるが、この改善の信頼性は、どのように候補行動がランク付けされ、レビューされ、重み付けされるかに依存する。
ノイズの多いランキングは、早期の候補者のコミットメントを強制し、選択スコアの再利用はバイアス目標の評価をバイアスし、固定された強化重みは弱い証拠を増幅する可能性がある。
これらのリスクに対処するため、予備予算内に順序付き候補プレフィックスを保持する保守的適応ランク付け・スクリーニング(CARS)を開発し、観測された境界差が不一致スケールの不確かさ半径を超える場合にのみそれを絞り込む。
セレクタ評価値アセスメント(SEVA)は、セレクタ評論家を用いて候補を注文し、個別にパラメータ化された評価値アセスメントを使用して選択された値をレビューし、レビューされた値をセレクタ参照に格納する。
動的適応リスク認識強化(DARE)は、候補信頼性、セレクタと評価器信号のギャップ、および有限ステージ係数を用いて、各残差補正を規制する。
CARS、SEVA、DAREとともにCARE-VIは、批判の回帰とアクター更新のためのバックボーンインターフェースを保存するエビデンス規制されたターゲット構築フレームワークである。
この分析は,CARS境界誤差,SEVA選択値過大評価,DARE残留変位の一方の偏差と,有限段階摂動終了後の固定的な政治回復を確立する。
4つのMuJoCoタスクにおけるSAC、TD3、TD7の実験は、CARE-VIが12設定すべてで最高平均リターンを達成したことを示している。
グループエイブレーションとスカラー診断は、3つのコンポーネントの役割をサポートし、ターゲットの信頼性を向上させる。
関連論文リスト
- Adaptive Doubly Robust Off-Policy Evaluation for Ranking Policies under Diverse User Behavior [0.7161783472741748]
Inverse Propensity Scoring (IPS) は過度な分散を持つ。
IPS と Reward Interaction IPS (RIPS) は、ユーザーがランキングを閲覧する方法に関する仮定を定め、ばらつきを減らす。
本稿では適応重み付けと再帰回帰を組み合わせた適応二重ロバスト(ADR)を提案する。
論文 参考訳(メタデータ) (2026-08-30T06:43:36Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning [63.24624171679711]
大規模言語モデル(LLM)ベースのエージェントは、しばしば最適なツール使用の決定を行う。
本研究では、不確実性分離を維持するための推進力として、不確実性定量化を報酬設計に組み込んだTRUSTを提案する。
論文 参考訳(メタデータ) (2026-06-05T07:08:34Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective [10.958642517467721]
RLVRにおけるコントラストシーケンスレベルのポリシー最適化のためのフレームワークを提案する。
ConSPOはGRPOのクリップされた比率ベースのスコアを、長さ正規化されたシーケンスログ確率に置き換える。
ConSPOは、挑戦的な数学的推論ベンチマークにおいて、いくつかの強力なRLVRベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-13T04:02:36Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging [69.96389360650072]
解析精度は, 標準ラベルの精度を超えて, 下流RLHFの結果を高い精度で予測できることが示される。
我々は,金の判断でトレーニングを増強し,合理的アライメントを明示的に監督するR-Alignを提案する。
論文 参考訳(メタデータ) (2026-02-06T15:17:11Z) - Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement [2.0755366440393748]
大きな言語モデル(LLM)は、臨床退院計画の約束を示すが、その使用は幻覚、排便、誤診された自信によって制限される。
安全性と信頼性を向上させる自己改善型キャッシュオプションのPlanner-Auditorフレームワークを導入する。
論文 参考訳(メタデータ) (2026-01-28T23:04:11Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Uncertainty Calibration for Counterfactual Propensity Estimation in Recommendation [22.67361489565711]
クリック後変換率(CVR)は、オンライン顧客の嗜好の信頼できる指標である。
本稿では,CVR予測の妥当性に基づくデバイアス化のためのモデルに依存しないキャリブレーションフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-23T00:42:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。