論文の概要: Evaluating Fuzz Testing for Reinforcement Learning Agents
- arxiv url: http://arxiv.org/abs/2607.24577v1
- Date: Mon, 27 Jul 2026 15:46:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.48388
- Title: Evaluating Fuzz Testing for Reinforcement Learning Agents
- Title(参考訳): 強化学習エージェントにおけるファズテストの評価
- Abstract要約: 強化学習(Reinforcement Learning, RL)エージェントは、ロボット工学、自律運転、ドローン制御など、安全上重要な領域にますます配備されている。
ファズテストは、RLエージェントの広大な状態空間を探索し、クラッシュを露呈するための有望な方法として登場した。
本研究は,4つの相補的視点からRLファジリング法の有効性,多様性,効率,実用性について系統的に評価する。
- 参考スコア(独自算出の注目度): 8.802650230584762
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement Learning (RL) agents are increasingly deployed in safety-critical domains such as robotics, autonomous driving, and drone control, where unexpected behaviors may lead to severe real-world consequences. Fuzz testing has recently emerged as a promising method for exploring the vast state spaces of RL agents and exposing crashes. Although numerous RL fuzzing methods have been proposed, existing studies often differ in evaluation settings, baselines, and metrics, making it difficult to draw reliable conclusions about their relative effectiveness and practical usefulness. To address this gap, we present the first comprehensive empirical study that systematically evaluates RL fuzzing methods from four complementary perspectives: effectiveness, diversity, efficiency, and practical utility. We benchmark five state-of-the-art methods alongside random testing under unified configurations across three environments of increasing complexity (MountainCar, BipedalWalker, and CARLA), and further assess the downstream usefulness of detected crashes for agent robustness improvement and safety monitoring. Our results reveal several key insights. For instance,throughput-oriented methods like MDPFuzz demonstrate superior effectiveness and efficiency in crash discovery, while methods explicitly designed to encourage exploration like SeqDivFuzz excel at uncovering diverse crash behaviors. We also show that fuzzing-generated crashes can meaningfully improve agent robustness and enable accurate safety monitoring with strong cross-method generalization. Beyond these empirical findings, we distill actionable guidance for both researchers and practitioners, highlighting the benefits of combining complementary fuzzing strategies and adopting multi-level diversity analysis to achieve more comprehensive and practical RL testing.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)エージェントは、ロボット工学、自律運転、ドローン制御など、安全クリティカルな領域にますます展開されている。
ファズテストは、最近RLエージェントの広大な状態空間を探索し、クラッシュを露呈するための有望な方法として現れた。
多くのRLファジリング法が提案されているが、既存の研究はしばしば評価設定、ベースライン、メトリクスが異なるため、それらの相対的有効性や実用性に関する信頼性の高い結論を導き出すことが困難である。
このギャップに対処するため,本研究では,RLファジリング手法を4つの相補的視点から体系的に評価する,初の総合的実証的研究を行った。
複雑度を増大させる3つの環境(MountainCar,BipedalWalker,CARLA)にまたがる統一構成下でのランダムテストと並行して,最先端の5つの手法をベンチマークし,エージェントの堅牢性向上と安全性監視のために検出されたクラッシュの下流の有用性を評価する。
我々の結果はいくつかの重要な洞察を浮き彫りにした。
例えば、MDPFuzzのようなスループット指向の手法は、クラッシュ発見における優れた効率と効率を示す一方、SqDivFuzzのような探索を奨励する手法は、多様なクラッシュの振る舞いを明らかにするために、明示的に設計されている。
また, ファジィ発生による衝突は, エージェントの堅牢性を有意義に向上し, 強力なクロスメタル一般化による正確な安全監視を可能にすることを示す。
これらの経験的知見の他に、研究者と実践者の両方に対して実行可能なガイダンスを抽出し、相補的なファジィング戦略を組み合わせることの利点と、より包括的で実用的なRLテストを実現するために多段階の多様性分析を採用することの利点を強調した。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning [13.041618832271737]
強化学習(RL)は、大規模言語モデルの推論能力を大幅に向上させる。
これをマルチターンエージェントタスクに適用することは、相互作用の長い水平の性質のため、依然として困難である。
本稿では,ProCeedRL:Explorative Demonstration RLによるプロセス批判を提案する。
論文 参考訳(メタデータ) (2026-04-02T13:10:06Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - Improving Deepfake Detection with Reinforcement Learning-Based Adaptive Data Augmentation [60.04281435591454]
CRDA(Curriculum Reinforcement-Learning Data Augmentation)は、マルチドメインの偽造機能を段階的にマスターするための検出器を導く新しいフレームワークである。
私たちのアプローチの中心は、強化学習と因果推論を統合することです。
提案手法は検出器の一般化性を大幅に向上し,複数のクロスドメインデータセット間でSOTA法より優れている。
論文 参考訳(メタデータ) (2025-11-10T12:45:52Z) - Anomalous Decision Discovery using Inverse Reinforcement Learning [3.3675535571071746]
異常検出は、知覚システムを通じて異常な行動を特定することによって、自律走行車(AV)において重要な役割を果たす。
現在のアプローチは、しばしば定義済みのしきい値や教師付き学習パラダイムに依存するが、目に見えないシナリオに直面すると効果が低下する。
異常検出のための新しいIRLフレームワークである Trajectory-Reward Guided Adaptive Pre-training (TRAP) を提案する。
論文 参考訳(メタデータ) (2025-07-06T17:01:02Z) - Preference-Based Multi-Agent Reinforcement Learning: Data Coverage and Algorithmic Techniques [65.55451717632317]
PbMARL(Preference-based Multi-Agent Reinforcement Learning)について検討する。
一般ゲームにおける嗜好のみのオフラインデータセットからナッシュ平衡を同定する。
以上の結果から,PbMARLの多面的アプローチが示唆された。
論文 参考訳(メタデータ) (2024-09-01T13:14:41Z) - Safeguarded Progress in Reinforcement Learning: Safe Bayesian
Exploration for Control Policy Synthesis [63.532413807686524]
本稿では、強化学習(RL)におけるトレーニング中の安全維持の問題に対処する。
探索中の効率的な進捗と安全性のトレードオフを扱う新しいアーキテクチャを提案する。
論文 参考訳(メタデータ) (2023-12-18T16:09:43Z) - Dealing with uncertainty: balancing exploration and exploitation in deep
recurrent reinforcement learning [0.0]
環境に関する不完全な知識は、不確実性の下で意思決定を行うエージェントを導く。
強化学習(Reinforcement Learning, RL)では、自律的なエージェントが2つの対照的なニーズのバランスを取る必要がある。
適応的手法は、探索と搾取の間のトレードオフを近似した方がよいことを示す。
論文 参考訳(メタデータ) (2023-10-12T13:45:33Z) - DEFENDER: DTW-Based Episode Filtering Using Demonstrations for Enhancing
RL Safety [0.0]
本稿では,学習中のRLエージェントの安全性を向上させるために,安全で安全性の低いデモセットを活用するタスク非依存手法を提案する。
提案手法はOpenAI GymのMujocoベンチマークと2つの最先端RLアルゴリズムから評価する。
論文 参考訳(メタデータ) (2023-05-08T14:23:27Z) - Evaluating Model-free Reinforcement Learning toward Safety-critical
Tasks [70.76757529955577]
本稿では、国家安全RLの観点から、この領域における先行研究を再考する。
安全最適化と安全予測を組み合わせた共同手法であるUnrolling Safety Layer (USL)を提案する。
この領域のさらなる研究を容易にするため、我々は関連するアルゴリズムを統一パイプラインで再現し、SafeRL-Kitに組み込む。
論文 参考訳(メタデータ) (2022-12-12T06:30:17Z) - Exploring Inconsistent Knowledge Distillation for Object Detection with
Data Augmentation [66.25738680429463]
物体検出のための知識蒸留(KD)は、教師モデルから知識を伝達することで、コンパクトな検出器を訓練することを目的としている。
教師モデルの反直感的知覚に固有の知識を蒸留することを目的とした,一貫性のない知識蒸留(IKD)を提案する。
本手法は, 1段, 2段, アンカーフリーの物体検出器において, 最先端のKDベースラインより優れる。
論文 参考訳(メタデータ) (2022-09-20T16:36:28Z) - Ablation Study of How Run Time Assurance Impacts the Training and
Performance of Reinforcement Learning Agents [5.801944210870593]
本研究では,評価ベストプラクティスを用いたアブレーション研究を行い,実行時間保証(RTA)が効果的な学習に与える影響について検討する。
私たちの結論は、安全な強化学習の最も有望な方向性に光を当てました。
論文 参考訳(メタデータ) (2022-07-08T20:15:15Z) - Neural Network Repair with Reachability Analysis [10.384532888747993]
安全は次世代の自律性にとって重要な問題であり、知覚と制御のためにディープニューラルネットワークに大きく依存する可能性が高い。
本研究は,安全クリティカルシステムにおける安全でないDNNを到達可能性解析で修復する枠組みを提案する。
論文 参考訳(メタデータ) (2021-08-09T17:56:51Z) - Robust Deep Reinforcement Learning through Adversarial Loss [74.20501663956604]
近年の研究では、深層強化学習剤は、エージェントの入力に対する小さな逆方向の摂動に弱いことが示されている。
敵攻撃に対する堅牢性を向上した強化学習エージェントを訓練するための原則的フレームワークであるRADIAL-RLを提案する。
論文 参考訳(メタデータ) (2020-08-05T07:49:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。