論文の概要: Gimitest: A Comprehensive Tool for Testing Reinforcement Learning Policies
- arxiv url: http://arxiv.org/abs/2607.07029v1
- Date: Wed, 08 Jul 2026 06:00:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.288407
- Title: Gimitest: A Comprehensive Tool for Testing Reinforcement Learning Policies
- Title(参考訳): Gimitest: 強化学習ポリシをテストするための総合ツール
- Authors: Dennis Gross, Quentin Mazouni, Helge Spieker, Arnaud Gotlieb,
- Abstract要約: 強化学習(RL)ポリシーは、攻撃に対して安全で脆弱である。
複数エージェントのRLポリシーを様々な条件下でテストするための包括的フレームワークを提案する。
このフレームワークの実装であるGimitestは、さまざまなジムフレームワークをサポートするオープンソースツールです。
- 参考スコア(独自算出の注目度): 4.1833450831342605
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) policies can be unsafe and vulnerable to attacks. Ensuring their reliability is often a pain point as existing automated testing methods target only selected environments, testing scenarios, and RL algorithms. To address this, we propose a comprehensive framework for testing single- and multi-agent RL policies under varying conditions. Our implementation of this framework, Gimitest, is an open-source tool that supports various gym frameworks and allows for modifications of their integrated components. This article describes the framework and details Gimitest's functionality and architecture. It showcases its effectiveness in testing multiple RL policies in environments such as the official Farama Gymnasium and PettingZoo.
- Abstract(参考訳): 強化学習(RL)ポリシーは、攻撃に対して安全で脆弱である。
既存の自動テストメソッドは、選択された環境、テストシナリオ、RLアルゴリズムのみを対象としているため、信頼性を確保することはしばしば困難である。
そこで本稿では,異なる条件下で単一エージェントとマルチエージェントのRLポリシーをテストするための包括的なフレームワークを提案する。
このフレームワークの実装であるGimitestは、さまざまなジムフレームワークをサポートし、統合コンポーネントの変更を可能にするオープンソースのツールです。
この記事では、フレームワークとGimitestの機能とアーキテクチャの詳細を説明します。
公式なFarama GymnasiumやPettingZooのような環境で、複数のRLポリシーをテストする上での有効性を示す。
関連論文リスト
- Poly-EPO: Training Exploratory Reasoning Models [62.82992914206963]
本稿では,学習後言語モデル(LM)の枠組みについて,楽観的な探索を明示的に奨励し,探索と搾取の相乗効果を促進する。
本稿では,この枠組みを探索と利用を明確に相乗化するための目的として,ポリクロミック探索政策最適化(Poly-EPO)を提案する。
論文 参考訳(メタデータ) (2026-04-19T22:54:19Z) - Constrained Meta Reinforcement Learning with Provable Test-Time Safety [8.354731976915588]
多くの現実世界のアプリケーションは、テスト中に安全性の制約を課している。
本稿では,トレーニング中に学習したポリシーを改良するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-29T15:21:37Z) - AJAR: Adaptive Jailbreak Architecture for Red-teaming [1.356919241968803]
AJARは概念実証フレームワークであり、"赤チーム"と"アクションセキュリティ"のギャップを埋めるように設計されている。
AJARは実行ループから逆ロジックを分離し、X-Teamingのような最先端のアルゴリズムを標準化されたプラグイン・アンド・プレイサービスとしてカプセル化する。
AJARは、この出現する攻撃面の標準化された環境対応評価を容易にするために、オープンソース化されている。
論文 参考訳(メタデータ) (2026-01-16T03:30:40Z) - Multi-Agent Tool-Integrated Policy Optimization [67.12841355267678]
大規模言語モデル(LLM)は、知識集約的かつ複雑な推論タスクに対して、多ターンツール統合計画にますます依存している。
既存の実装は通常、単一のエージェントに依存するが、コンテキスト長とノイズの多いツールレスポンスに悩まされる。
ツール統合マルチエージェントフレームワークの効果的な強化学習をサポートする方法はない。
論文 参考訳(メタデータ) (2025-10-06T10:44:04Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - Proto Successor Measure: Representing the Behavior Space of an RL Agent [37.55496993803242]
汎用強化学習アルゴリズムでは「ゼロショット学習」が有効である。
本稿では,強化学習エージェントのすべての行動に対する基礎セットとして,Proto Successor Measureを提案する。
我々は,環境から報酬のないインタラクションデータを用いて,これらの基礎関数を学習する実用的なアルゴリズムを導出する。
論文 参考訳(メタデータ) (2024-11-29T00:09:39Z) - ODRL: A Benchmark for Off-Dynamics Reinforcement Learning [59.72217833812439]
我々は、オフダイナミックスRL法を評価するための最初のベンチマークであるODRLを紹介する。
ODRLには、4つの実験的な設定が含まれており、ソースドメインとターゲットドメインはオンラインまたはオフラインにすることができる。
我々は、様々な力学シフトにまたがる普遍的な優位性を持つ手法が存在しないことを示す広範なベンチマーク実験を行った。
論文 参考訳(メタデータ) (2024-10-28T05:29:38Z) - Value Functions are Control Barrier Functions: Verification of Safe
Policies using Control Theory [46.85103495283037]
本稿では,制御理論から学習値関数への検証手法の適用方法を提案する。
我々は値関数と制御障壁関数の間の関係を確立する原定理を定式化する。
我々の研究は、RLベースの制御システムの汎用的でスケーラブルで検証可能な設計のための公式なフレームワークに向けた重要な一歩である。
論文 参考訳(メタデータ) (2023-06-06T21:41:31Z) - Provable Safe Reinforcement Learning with Binary Feedback [62.257383728544006]
状態, アクションペアの安全性に対するバイナリフィードバックを提供するオフラインオラクルへのアクセスを与えられた場合, 証明可能な安全なRLの問題を考える。
我々は,その設定に対してブラックボックスPAC RLアルゴリズムに与えられた任意のMDP設定に適用可能な,新しいメタアルゴリズムSABREを提案する。
論文 参考訳(メタデータ) (2022-10-26T05:37:51Z) - Learning Domain Invariant Representations in Goal-conditioned Block MDPs [25.445394992810925]
目的条件付き政策を新しい環境に一般化する理論的枠組みを提案する。
本フレームワークでは,ドメインの一般化を促進する実践的な手法PA-SkewFitを開発する。
論文 参考訳(メタデータ) (2021-10-27T08:10:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。