論文の概要: Robust Asynchronous Q-Learning under Reward and State Corruption via Batching
- arxiv url: http://arxiv.org/abs/2607.20822v2
- Date: Fri, 24 Jul 2026 00:47:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:30.982544
- Title: Robust Asynchronous Q-Learning under Reward and State Corruption via Batching
- Title(参考訳): バッチ処理による逆・状態破壊下でのロバストな非同期Q-Learning
- Abstract要約: BR-Async-Q - 2つの鍵となるアイデアに基づいて構築された新しいエポックベースで堅牢なQ-ラーニングアルゴリズムを提案する。
BR-Async-Q の高確率誤差がバニラQ-ラーニングと一致することを示す。
報酬のみを汚す場合、アルゴリズムの汚職率に対する依存度は最小限である。
- 参考スコア(独自算出の注目度): 2.3096751699592137
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Motivated by reinforcement learning in harsh environments, we consider the problem of learning an optimal policy subject to adversarially corrupted feedback. Specifically, at each time-step, an adversary can perturb both the reward and state observations of the learner following the Huber contamination model. To defend against such data corruption, we propose BR-Async-Q: a novel, epoch-based, robust Q-learning algorithm built upon two key ideas: (i) partitioning the online data stream into batches to reduce variance, and (ii) constructing robust estimates of the Bellman optimality operator using such batched data. We prove a high-probability $\ell_\infty$ error bound for BR-Async-Q that matches that for vanilla Q-learning, up to a small additive term that scales with the fraction of corrupted samples. To our knowledge, this provides the first robustness guarantee for asynchronous Q-learning subject to both reward and state corruption. Furthermore, when only rewards are corrupted, the dependence of our algorithm's bound on the corruption fraction is minimax optimal.
- Abstract(参考訳): 厳しい環境下での強化学習によるモチベーションを生かし、敵意に腐敗したフィードバックを対象とする最適な政策学習の課題を検討する。
具体的には、各段階において、ハマー汚染モデルに従って学習者の報酬と状態の観察の両方を敵が妨害することができる。
BR-Async-Q(BR-Async-Q)は,2つの重要な概念に基づいて構築された,新鮮でエポックな,堅牢なQ-ラーニングアルゴリズムである。
(i)分散を低減するためにオンラインデータストリームをバッチに分割し、
(2)そのようなバッチデータを用いてベルマン最適性演算子のロバスト推定を構築する。
高確率$\ell_\infty$ error bound for BR-Async-Q, which match for vanilla Q-learning, to a small additive term that scales with the fractionred sample。
私たちの知る限り、これは、報酬と状態の汚職の両方を対象とする非同期Q-ラーニングに対して、初めての堅牢性を保証する。
さらに, 報酬のみを損なう場合, アルゴリズムの汚損率に対する依存度は極小である。
関連論文リスト
- Corruption-robust Offline Multi-agent Reinforcement Learning From Human Feedback [26.662444975280792]
人間のフィードバックによるオフラインマルチエージェント強化学習におけるデータの破損に対する堅牢性について考察する。
線形マルコフゲーム(英語版)の枠組みを用いて問題をモデル化する。
我々の知る限りでは、これはオフラインのMARLHFにおけるデータ破損に対する最初の体系的な治療である。
論文 参考訳(メタデータ) (2026-03-30T11:03:36Z) - Online Learning to Rank under Corruption: A Robust Cascading Bandits Approach [15.847551488328866]
オンライン学習は、大きなプールからランクの低い項目のリストを推薦する方法を研究し、ユーザークリックに基づいて将来のランキングを改善する。
この設定は一般的にカスケードバンドとしてモデル化され、ユーザが提示されたアイテムの少なくとも1つをクリックする可能性の最大化を目的としている。
そこで我々は,新しい医療平均推定器を組み込んだ頑健なアルゴリズムMSUCBを提案する。
論文 参考訳(メタデータ) (2025-11-04T23:39:37Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Corruption-Tolerant Asynchronous Q-Learning with Near-Optimal Rates [2.3096751699592137]
そこで本研究では,Q-ラーニングアルゴリズムの頑健な新しい変種を提案する。
我々のコントリビューションは、非同期Q-ラーニングのための最初の有限時間ロバスト性保証を提供し、ロバストなRLにおいて大きなギャップを埋めています。
論文 参考訳(メタデータ) (2025-09-10T18:56:39Z) - Adversarially-Robust TD Learning with Markovian Data: Finite-Time Rates and Fundamental Limits [2.07180164747172]
厳しい現実世界の環境に動機付けられ、敵の堅牢性の観点から政策評価問題を再考する。
我々はRobust-TDと呼ばれる新しいアルゴリズムを開発し、その有限時間保証がバニラTDの線形関数近似と小さな$O(epsilon)$項に一致することを証明した。
我々の知る限り、これらの結果はマルコフノイズによって駆動される敵近似スキームの文脈における最初のものである。
論文 参考訳(メタデータ) (2025-02-07T05:05:42Z) - Robust Q-Learning under Corrupted Rewards [2.07180164747172]
本稿では,Q-Learningアルゴリズムの強汚染攻撃モデルに対する堅牢性について検討する。
本研究では,実演的ベルマン演算子を構築するために,履歴報酬データを用いた新しい頑健な同期Q-ラーニングアルゴリズムを開発した。
我々の結果は、真の報酬分布が無限に支持されたとしても、有界な第2モーメントを許容するならば、維持され続ける。
論文 参考訳(メタデータ) (2024-09-05T04:37:02Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - Simultaneous Double Q-learning with Conservative Advantage Learning for
Actor-Critic Methods [133.85604983925282]
保守的アドバンテージ学習(SDQ-CAL)を用いた同時二重Q-ラーニングを提案する。
提案アルゴリズムはバイアスの少ない値推定を実現し,一連の連続制御ベンチマークタスクにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2022-05-08T09:17:16Z) - A Robust Phased Elimination Algorithm for Corruption-Tolerant Gaussian
Process Bandits [118.22458816174144]
そこで本稿では,エポックで動作するロバストな除去型アルゴリズムを提案し,探索と頻繁な切替を併用して,小さなアクションサブセットを選択し,各アクションを複数タイミングで実行する。
我々のアルゴリズムであるGP Robust Phased Elimination (RGP-PE) は、探索とエクスプロイトによる汚職に対するロバストネスのバランスに成功している。
GPバンディット設定におけるロバスト性の最初の実証的研究を行い,アルゴリズムが様々な敵攻撃に対してロバストであることを示す。
論文 参考訳(メタデータ) (2022-02-03T21:19:36Z) - Linear Contextual Bandits with Adversarial Corruptions [91.38793800392108]
本稿では,敵対的腐敗の存在下での線形文脈的包帯問題について検討する。
逆汚染レベルに適応する分散認識アルゴリズムをC$で提案する。
論文 参考訳(メタデータ) (2021-10-25T02:53:24Z) - Risk Minimization from Adaptively Collected Data: Guarantees for
Supervised and Policy Learning [57.88785630755165]
経験的リスク最小化(Empirical Risk Minimization, ERM)は、機械学習のワークホースであるが、適応的に収集されたデータを使用すると、そのモデルに依存しない保証が失敗する可能性がある。
本研究では,仮説クラス上での損失関数の平均値を最小限に抑えるため,適応的に収集したデータを用いた一般的な重み付きERMアルゴリズムについて検討する。
政策学習では、探索がゼロになるたびに既存の文献のオープンギャップを埋める率-最適後悔保証を提供する。
論文 参考訳(メタデータ) (2021-06-03T09:50:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。