論文の概要: Scalable Distributed Simulation-Based Testing for Automated Driving Systems
- arxiv url: http://arxiv.org/abs/2608.20904v1
- Date: Fri, 21 Aug 2026 09:22:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.486413
- Title: Scalable Distributed Simulation-Based Testing for Automated Driving Systems
- Title(参考訳): スケーラブルな分散シミュレーションに基づく自動運転システムのテスト
- Abstract要約: 本稿では、自動走行システム(ADS)のCARLAに基づくシナリオテストのためのエンドツーエンドの宣言駆動フレームワークを提案する。
ROS 2アプリケーションは、リポジトリ仕様から生成される標準化されたHelmチャートとしてパッケージされ、シミュレーション環境全体が動的Helmfileマニフェストを介して構成されます。
このフレームワークは、シナリオソースや下流評価モジュールに接続する実世界のADSテストアプリケーションでさらに実証されている。
- 参考スコア(独自算出の注目度): 1.1470070927586018
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Virtual scenario-based testing is a key enabler for validating automated driving systems (ADS) and intelligent transport systems (ITS). However, executing large-scale test suites involving possibly thousands of scenarios remains labor-intensive and difficult to scale. This paper presents an end-to-end, DevOps-driven framework that automates build, deployment, and distributed execution of CARLA-based scenario tests of an ADS on a lightweight Kubernetes cluster. ROS 2 applications are packaged as standardized Kubernetes Helm charts generated from repository specifications, while entire simulation environments are composed declaratively via dynamic Helmfile manifests. The paper describes how a distributed testing workflow can be implemented in Argo Workflows to provision environments, aggregate and batch OpenSCENARIO test cases from configurable sources, execute scenarios in parallel across cluster nodes, and collect logs and resource metrics. In an evaluation on a multi-node K3s cluster running 200 scenarios, the best configuration speeds up end-to-end workflow time by more than a factor of eight compared to a sequential baseline. The results demonstrate significant gains in end-to-end execution time and quantify trade-offs between parallelism, orchestration overhead, and cluster stability. The framework is further demonstrated in a real-world ADS test application with connections to scenario sources and downstream evaluation modules. This demonstrates that the approach provides a strong foundation not only for scalable simulation testing, but also for generating traceable evidence that can support safety arguments.
- Abstract(参考訳): 仮想シナリオベースのテストは、自動走行システム(ADS)とインテリジェントトランスポートシステム(ITS)を検証するための重要な有効性である。
しかし、おそらく数千のシナリオを含む大規模なテストスイートの実行は、労働集約的でスケールが難しいままである。
本稿では、軽量Kubernetesクラスタ上でのADSのCARLAベースのシナリオテストの構築、デプロイ、分散実行を自動化する、エンドツーエンドのDevOps駆動フレームワークを提案する。
ROS 2アプリケーションは、リポジトリ仕様から生成された標準化されたKubernetes Helmチャートとしてパッケージされ、シミュレーション環境全体が動的Helmfileマニフェストを介して宣言的に構成される。
この記事では、Argo Workflowsで分散テストワークフローを実装し、環境のプロビジョニング、設定可能なソースからのOpenSCENARIOテストケースの集約とバッチ、クラスタノード間の並列実行、ログとリソースメトリクスの収集について説明する。
200のシナリオを実行するマルチノードK3sクラスタの評価では、最高の設定は、シーケンシャルベースラインと比較して、エンドツーエンドのワークフロー時間を8倍以上スピードアップする。
その結果、エンドツーエンドの実行時間が大きく向上し、並列性、オーケストレーションのオーバーヘッド、クラスタの安定性のトレードオフを定量化しています。
このフレームワークは、シナリオソースや下流評価モジュールに接続する実世界のADSテストアプリケーションでさらに実証されている。
このことは、このアプローチがスケーラブルなシミュレーションテストだけでなく、安全性の議論をサポートするトレース可能なエビデンスを生成するための強力な基盤を提供することを示している。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - Flower Hub: A Reproducible Benchmarking Platform for Federated Learning in Simulation and Deployment [51.83961778298564]
Flower Hubは、分散およびフェデレーションされたアプリケーションを公開、発見、実行するためのプラットフォームです。
ベンチマークを実行可能としてパッケージングすることで再現性のあるベンチマークを実現する方法、標準化されたメタデータを備えたバージョン管理されたアプリケーション、ピン付き依存関係、明示的な評価について示す。
論文 参考訳(メタデータ) (2026-08-25T20:09:44Z) - EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents [64.96332056338923]
EEVEEは、LLMエージェントのための最初のマルチデータセットテスト時プロンプト学習フレームワークである。
実世界のタスクストリーム下でテスト時のプロンプト学習を可能にする。
EEVEEはQwen3-4B-InstructとDeepSeek-V3.2で平均マルチベンチマークスコアを10.38点、24.32点改善している。
論文 参考訳(メタデータ) (2026-06-09T17:57:16Z) - A Unified Framework for the Evaluation of LLM Agentic Capabilities [36.43241368835721]
LLMエージェント能力の公平な評価のための統一的なフレームワークを提案する。
統合された構成システムによって駆動されるこのフレームワークは、様々なベンチマークを標準化された命令-ツール-環境フォーマットに統合する。
我々は15モデルで400Kロールアウトと5Bトークンに対して大規模な実証分析を行う。
論文 参考訳(メタデータ) (2026-05-27T03:20:45Z) - Grid-Orch: An LLM-Powered Orchestrator for Distribution Grid Simulation and Analytics [0.9801145263519269]
Grid-Orchは、モデルコンテキストプロトコル(MCP)を通じて、大規模言語モデル(LLM)と電力系統シミュレーションをブリッジするフレームワークである。
Grid-Orchは、電力フロー、電圧分析、準静的時系列(QSTS)シミュレーション、自動最適化など、11のカテゴリにまたがる36のドメイン固有ツールを提供する。
論文 参考訳(メタデータ) (2026-05-12T20:31:34Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Declarative Scenario-based Testing with RoadLogic [2.2107822884016404]
宣言型OS2仕様と実行可能なシミュレーションを橋渡しするRoadLogicを提案する。
結果は、RoadLogicが数分で、現実的で、仕様に満足するシミュレーションを一貫して生成していることを示している。
論文 参考訳(メタデータ) (2026-03-10T10:11:09Z) - An LLM-driven Scenario Generation Pipeline Using an Extended Scenic DSL for Autonomous Driving Safety Validation [4.602386383455713]
現実の事故報告は、自律運転システムのシナリオベースのテストに有用である。
現在の手法では、このマルチモーダルデータを正確に実行可能なシミュレーションシナリオに効果的に変換することはできない。
本稿では,大規模言語モデルと確率的中間表現を用いたスケーラブルで検証可能なパイプラインを提案する。
論文 参考訳(メタデータ) (2026-02-24T07:44:26Z) - Req2Road: A GenAI Pipeline for SDV Test Artifact Generation and On-Vehicle Execution [24.305511228249486]
大規模言語モデルと視覚言語モデルは、信号と行動論理を抽出するために使用される。
パイプラインは検索拡張生成を使用して、マッピング前に候補VSS信号をプリセレクトする。
本稿では,SDVサブシステムのためのエンドツーエンド要求-テストパイプラインの実現可能性とアーキテクチャ実証について述べる。
論文 参考訳(メタデータ) (2026-02-17T14:03:35Z) - Scenic4RL: Programmatic Modeling and Generation of Reinforcement
Learning Environments [89.04823188871906]
リアルタイム戦略(RTS)環境では,多様な現実シナリオの生成が難しい。
既存のシミュレータのほとんどは環境をランダムに生成することに頼っている。
我々は、研究者を支援するために、既存の形式シナリオ仕様言語であるSCENICを採用する利点を紹介する。
論文 参考訳(メタデータ) (2021-06-18T21:49:46Z) - CREPO: An Open Repository to Benchmark Credal Network Algorithms [78.79752265884109]
クレダルネットワークは、確率質量関数の集合であるクレダルに基づく不正確な確率的グラフィカルモデルである。
CREMAと呼ばれるJavaライブラリが最近リリースされ、クレダルネットワークをモデル化し、処理し、クエリする。
我々は,これらのモデル上での推論タスクの正確な結果とともに,合成クレダルネットワークのオープンリポジトリであるcrrepoを提案する。
論文 参考訳(メタデータ) (2021-05-10T07:31:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。