論文の概要: Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control
- arxiv url: http://arxiv.org/abs/2609.01676v2
- Date: Tue, 08 Sep 2026 18:31:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.871625
- Title: Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control
- Title(参考訳): Sim2Signal: 信号制御のためのSim-to-Realベンチマーク
- Authors: Ferdous Al Rafi, Susrik Mukherjee, Latika Liladhar Dekate, Jennifer Yawa Lavoe, Huaiyuan Yao, Shlok Mohanty, Longchao Da, Xuesong Zhou, Hua Wei,
- Abstract要約: 強化学習は、シミュレーションにおいて強い信号制御性能を達成するが、シミュレータで訓練されたポリシーは、実世界で一度デプロイされると失敗することが多い。
Sim2Signalは、Sim-to-Realギャップを観察、行動、遷移、報酬ギャップに分解するベンチマークである。
直接転送は4つのギャップ源全てで連続的に性能を低下させるが、劣化の重大さは緩和効果を予測できない。
- 参考スコア(独自算出の注目度): 5.6447718409709795
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning achieves strong traffic signal control performance in simulation, yet policies trained in simulators often fail once deployed in the real world, a failure known as the Sim-to-Real gap. When RL is applied to traffic signal control, this gap arises from several sources: sensing, action execution, traffic dynamics, and the control objective. Their relative impact and the reliability of existing Sim-to-Real mitigation methods remain insufficiently understood, and the field lacks a standard benchmark for systematically measuring the gap and evaluating mitigation methods. We present Sim2Signal, a benchmark that decomposes the Sim-to-Real gap into observation, action, transition, and reward gaps, corresponding to mismatches in the four components of the underlying MDP, and induces each gap in isolation under a shared protocol. We evaluate 18 mitigation methods on 2 base controllers, across 33 gap settings and 10 calibrated networks built from 5 real-world locations. We find that direct transfer consistently degrades performance across all four gap sources, but the severity of the degradation does not predict the effectiveness of mitigation. Instead, mitigation effectiveness depends strongly on the network and gap setting: outside the action gap, a method that helps in one case may fail in another. The most effective methods generally estimate what the gap changes, rather than make the policy insensitive through domain randomization or invariant representations. Our code is available at https://github.com/DaRL-LibSignal/Sim2Signal
- Abstract(参考訳): 強化学習は、シミュレーションにおいて強い信号制御性能を達成するが、シミュレータで訓練されたポリシーは、実世界で一度デプロイされると失敗することが多い。
RLが交通信号制御に適用されると、このギャップは、センシング、アクション実行、トラフィックダイナミクス、制御目的など、いくつかのソースから生じる。
彼らの相対的な影響と既存のSim-to-Real緩和手法の信頼性は未だ十分に理解されておらず、その分野はギャップを体系的に測定し緩和方法を評価するための標準ベンチマークを欠いている。
我々は、シム・トゥ・リアルのギャップを観察、行動、遷移、報酬のギャップに分解するベンチマークであるSim2Signalを、基礎となるMDPの4つのコンポーネントのミスマッチに対応させ、共有プロトコルの下で各分離のギャップを誘導する。
実世界の5つの場所から構築された33のギャップ設定と10のキャリブレーションネットワークを用いて,2つのベースコントローラ上で18の緩和手法を評価する。
直接転送は4つのギャップ源全てで連続的に性能を低下させるが、劣化の重大さは緩和効果を予測できない。
代わりに、緩和効果はネットワークとギャップの設定に強く依存する:アクションギャップの外では、あるケースで補助するメソッドが別のケースで失敗する可能性がある。
最も効果的な方法は、一般に、領域のランダム化や不変表現を通じてポリシーに敏感にするのではなく、ギャップがどう変化するかを推定する。
私たちのコードはhttps://github.com/DaRL-LibSignal/Sim2Signalで利用可能です。
関連論文リスト
- WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation [85.15806404962193]
行動条件付き世界モデル(ACWM)は、計画、ポリシー評価、データ生成のためのスケーラブルな予測シミュレータを具現化したAIを提供することを約束する。
物理シミュレータが期待する観測能力を用いてACWMを評価する。
WorldSimProbeは、制御のバリエーション、相互作用のグラウンディングにおける構造化された障害、ダイナミックスにまたがる、システマティックなアクション実現の劣化を明らかにする。
論文 参考訳(メタデータ) (2026-08-10T08:48:06Z) - BIFROST: Bridging Invariant Feature Representation for Observation-space Sim2Real Transfer [12.497312159934351]
我々は、この共有構造を生観測から識別し、活用し、ゼロショット転送を可能にする政策を訓練できるかどうか検討する。
BIFROSTは、クロスドメインの2つの目的によって、ペア化されたクロスドメインデータ上で共有履歴エンコーダを学習する。
我々は、sim2simビジュアルナビゲーションとsim2realコンタクトリッチ操作タスクとビジュアルサーボタスクに関する実証的な証拠を提供する。
論文 参考訳(メタデータ) (2026-07-01T19:15:17Z) - Sim2Act: Robust Simulation-to-Decision Learning via Adversarial Calibration and Group-Relative Perturbation [54.29523408543184]
シミュレーションと意思決定の学習は、現実世界の展開を危険にさらすことなく、デジタル環境で安全なポリシートレーニングを可能にする。
既存のアプローチでは、平均的なシミュレーションの忠実さを改善するか、保守的な正規化を採用するかに重点を置いている。
提案するSim2Actは,シミュレータとポリシーのロバスト性の両方に対処するロバストなシミュレーション・トゥ・意思決定フレームワークである。
論文 参考訳(メタデータ) (2026-03-10T00:51:47Z) - Bridging Simulation and Reality: Cross-Domain Transfer with Semantic 2D Gaussian Splatting [60.513168855890974]
ロボット操作におけるクロスドメイン転送は、シミュレートされた環境と実世界の環境の間に大きなドメインギャップがあるため、長年にわたる課題である。
本研究では,オブジェクト中心の領域不変空間特徴を抽出する新しい表現法であるSemantic 2D Gaussian Splatting (S2GS)を提案する。
S2GSはsim-to-real転送性を大幅に改善し、現実世界のシナリオで高安定なタスク性能を維持する。
論文 参考訳(メタデータ) (2025-12-04T12:16:15Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z) - Marginalized Importance Sampling for Off-Environment Policy Evaluation [13.824507564510503]
強化学習法(Reinforcement Learning, RL)は、通常、サンプル非効率であり、実世界のロボットでRLポリティエの訓練と展開が困難である。
本稿では,エージェントポリシーを実環境にデプロイする前に,エージェントポリシーの現実的性能を評価するための新しいアプローチを提案する。
提案手法では,実世界のオフラインデータとともにシミュレータを組み込んで,任意のポリシーの性能評価を行う。
論文 参考訳(メタデータ) (2023-09-04T20:52:04Z) - Uncertainty-aware Grounded Action Transformation towards Sim-to-Real
Transfer for Traffic Signal Control [3.6216188129806643]
本稿では,UGAT と呼ばれる実世界のシミュレーション(シミュレート・トゥ・リアル)トランスファー手法を提案する。
本手法は,実世界における移動RLポリシーの性能を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2023-07-23T17:35:49Z) - Bridging the Reality Gap of Reinforcement Learning based Traffic Signal
Control using Domain Randomization and Meta Learning [0.7614628596146599]
本稿では,この現実のギャップに寄与する潜在的なシミュレーションパラメータを包括的に分析する。
ドメインランダム化(DR)とモデル非依存メタラーニング(MAML)という,このギャップを埋める有望な2つの戦略を検討する。
実験の結果,DRとMAMLはいずれも最先端のRLアルゴリズムよりも優れていた。
論文 参考訳(メタデータ) (2023-07-21T05:17:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。