論文の概要: ReBRAC-v2: The Return of the King
- arxiv url: http://arxiv.org/abs/2608.01205v1
- Date: Sun, 02 Aug 2026 12:42:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.124043
- Title: ReBRAC-v2: The Return of the King
- Title(参考訳): ReBRAC-v2: The Return of the King
- Authors: Denis Tarasov, Robert K. Katzschmann,
- Abstract要約: 本稿では、RLアクターとして正確な正規化フローを直接訓練するReBRAC-v2を紹介する。
このレシピをタスク毎に個別にチューニングするのではなく、単一の共有構成を開発する。
一般的な10のOGBenchカテゴリで、ReBRAC-v2の平均は74.8であり、次のベストアグリゲーションの結果は52.3である。
- 参考スコア(独自算出の注目度): 9.34711333978267
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent offline reinforcement learning methods increasingly rely on expressive generative policies and specialized value-guidance mechanisms. We ask whether comparable progress can instead come from systematically modernizing a conventional behavior-regularized actor-critic while preserving its algorithmic simplicity. We introduce ReBRAC-v2, which directly trains an exact-likelihood normalizing flow as the RL actor, combines likelihood, MSE, and MAE behavior regularization, and integrates a classification-based residual critic, staged optimization, and multi-sample test-time action selection. Rather than tuning this recipe separately for every task, we develop a single shared configuration via roughly 600 Bayesian proposals on six challenging OGBench tasks, freeze all structural and optimization choices, and adapt only two behavior-regularization coefficients over a 16-point grid. Across ten common state-based OGBench categories, ReBRAC-v2 averages 74.8 compared to 52.3 for the next-best aggregate result and ranks first in eight categories. The same recipe, without structural changes, obtains the strongest averages in our comparisons on D4RL AntMaze (90.2) and Adroit (33.6). Fixed-recipe ablations show the largest sensitivity to the selected mixed cloning objective, staged training, sufficient flow capacity, and multi-sample inference, while showing that several smaller choices depend on the values of other hyperparameters. These results show that disciplined, transferable engineering can achieve state-of-the-art aggregate performance without abandoning a minimalist offline RL foundation.
- Abstract(参考訳): 最近のオフライン強化学習手法は、表現的生成ポリシーと特別な価値誘導機構にますます依存している。
アルゴリズムの単純さを保ちながら、従来の行動規則化アクター批判を体系的に近代化することで、同等の進歩が得られるかどうかを問う。
本稿では、RLアクターとして正確な正規化フローを直接訓練し、確率、MSE、MAEの動作正規化を組み合わせたReBRAC-v2を紹介し、分類に基づく残差批判、ステージ最適化、マルチサンプルテストタイム動作選択を統合する。
このレシピを各タスクに対して個別にチューニングするのではなく、約600のベイズ的提案を6つの挑戦的なOGBenchタスクで実行し、全ての構造的および最適化的選択を凍結し、16点グリッド上で2つの振舞い正規化係数のみを適用することで、単一の共有構成を開発する。
10の州ベースのOGBenchカテゴリで、ReBRAC-v2の平均は74.8であり、次の最多の集計結果では52.3であり、8つのカテゴリで第1位である。
同じレシピは構造的な変化がなく、D4RL AntMaze (90.2) と Adroit (33.6) と比較すると最も高い平均値が得られる。
固定レシピアブレーションは、選択した混合クローニング目標、ステージドトレーニング、十分なフローキャパシティ、マルチサンプル推論に対する最大の感度を示しながら、いくつかのより小さな選択が他のハイパーパラメータの値に依存することを示した。
これらの結果は、最小限のオフラインRL基盤を捨てることなく、規律付き、転送可能なエンジニアリングが最先端の集約性能を達成できることを示している。
関連論文リスト
- Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Context Features Are Cheap: Rank-Aware Decomposition for Efficient Feature Interaction in Recommender Systems [0.0]
本稿では,リコメンデータシステムにおける支配的相互作用機構に適用可能なランクアウェア分解について述べる。
この分解は、コンテキストのみの計算を、元のモデルと同等の1/1の要求から1/1の要求に移行する。
DLRMスタイルのランサーをアーキテクチャ変更せずに生産する場合、分解はポッド当たりのスループットを87.5%向上させる。
論文 参考訳(メタデータ) (2026-05-24T13:35:36Z) - Beyond One-Size-Fits-All: Adaptive Test-Time Augmentation for Sequential Recommendation [3.873910497341511]
テスト時間の増大は、シーケンシャルなレコメンデーションにおいてデータの分散を緩和するための有望なアプローチとなっている。
既存のTTAメソッドは通常、一様でユーザに依存しない拡張戦略に依存している。
AdaTTAはシーケンスごとにシーケンス固有の拡張演算子を選択することを学習する。
論文 参考訳(メタデータ) (2026-04-17T14:56:29Z) - RG-TTA: Regime-Guided Meta-Control for Test-Time Adaptation in Streaming Time Series [0.0]
テスト時間適応(TTA)は、ニューラルネットワークの予測者がストリーミング時系列の分散シフトに適応できるようにする。
本稿では,従来の状態と分布類似性に基づいて適応強度を連続的に変調するメタコントローラであるRegime-Guided Test-Time Adaptation (RG-TTA)を提案する。
論文 参考訳(メタデータ) (2026-03-29T18:57:34Z) - Greedy Is a Strong Default: Agents as Iterative Optimizers [0.22843885788439797]
ランダムな提案生成装置をLCMエージェントに置き換え、評価診断を理由として情報付き候補を提案する。
離散的,混合的,連続的な検索空間にまたがる4つのタスクを評価する。
論文 参考訳(メタデータ) (2026-03-28T21:26:40Z) - Regularized Meta-Learning for Improved Generalization [0.0]
正規化メタラーニングは、高次元アンサンブルシステムのための安定かつデプロイ効率の高いスタックング戦略である。
4段階のパイプラインは、冗長性を考慮したプロジェクション、統計的メタ機能拡張、およびクロスバリデーションされた正規化メタモデルを組み合わせる。
Playground Series S6E1ベンチマークでは、提案フレームワークは8.582のアウトオブフォールドRMSEを実現し、単純な平均(8.894)と従来のリッジ積み重ね(8.627)よりも改善し、グリーディヒルクライミング(8.603)とほぼ低ランタイム(8.603)とほぼ一致する(4倍高速)。
論文 参考訳(メタデータ) (2026-02-12T22:55:32Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - Reverse Preference Optimization for Complex Instruction Following [61.39734201711077]
本稿では,Reverse Preference Optimization (RPO) という,シンプルで効果的な手法を提案する。
選択された応答が完璧であることを保証するために、命令内の制約を動的に反転させることで、優先ペアのノイズを緩和する。
RPOはモデルサイズで効果的にスケールし、70B RPOモデルはGPT-4oを超える。
論文 参考訳(メタデータ) (2025-05-28T09:44:27Z) - Towards Generalizable Trajectory Prediction Using Dual-Level Representation Learning And Adaptive Prompting [107.4034346788744]
既存の車両軌道予測モデルは、一般化可能性、予測の不確実性、複雑な相互作用を扱う。
本研究では,(1)自己拡張(SD)とマスドレコンストラクション(MR)による二重レベル表現学習,グローバルコンテキストと細部の詳細の収集,(2)レジスタベースのクエリと事前学習の強化,クラスタリングと抑圧の必要性の排除,(3)微調整中の適応型プロンプトチューニング,メインアーキテクチャの凍結,および少数のプロンプトの最適化といった,新たなトラジェクタ予測フレームワークであるPerceiverを提案する。
論文 参考訳(メタデータ) (2025-01-08T20:11:09Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z) - Rethinking Classifier Re-Training in Long-Tailed Recognition: A Simple
Logits Retargeting Approach [102.0769560460338]
我々は,クラスごとのサンプル数に関する事前知識を必要とせず,シンプルなロジットアプローチ(LORT)を開発した。
提案手法は,CIFAR100-LT, ImageNet-LT, iNaturalist 2018など,様々な不均衡データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-01T03:27:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。