論文の概要: ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control
- arxiv url: http://arxiv.org/abs/2605.29425v1
- Date: Thu, 28 May 2026 06:19:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.849036
- Title: ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control
- Title(参考訳): ReasonLight: ゼロショット信号制御のためのマルチモーダル基礎モデル強化強化学習フレームワーク
- Authors: Aoyu Pang, Maonan Wang, Yuejiao Xie, Chung Shue Chen, Zhiwei Yang, Man-On Pun,
- Abstract要約: ReasonLight はゼロショット TSC のためのマルチモーダル基礎モデル拡張 RL フレームワークである。
事前訓練されたRLコントローラから、構造化されたトラフィック計測、マルチビューカメラ観測、および候補位相決定を統合する。
RLのみのバックボーンと比較して緊急車両待ち時間を88.7%削減する。
- 参考スコア(独自算出の注目度): 7.396142955449211
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has shown promise in traffic signal control (TSC). However, its reliance on predefined states limits responsiveness to observable open-world events that are absent from training data. IoT-enabled intersections provide heterogeneous observations from roadside sensors and cameras, creating opportunities to improve RL adaptability to such events. To this end, we propose ReasonLight, a multimodal foundation model-enhanced RL framework for zero-shot TSC. ReasonLight integrates three sources of information: structured traffic measurements, multi-view camera observations, and candidate phase decisions from a pre-trained RL controller. Given an RL-proposed phase, ReasonLight extracts visual semantics from multi-view images and aligns them with compact sensor-derived scene descriptions. This alignment enables a semantic-guided refinement module to either preserve or adjust the proposed action according to traffic rules and event semantics. To ensure operational reliability, refined actions are constrained by the set of available phases. Any invalid decision is rejected, and the system falls back to the original RL action. We evaluate ReasonLight on two types of rare events not seen during RL training: emergency vehicle priority and temporary traffic regulation. Experimental results show that ReasonLight achieves zero-shot adaptation without retraining. It reduces emergency vehicle waiting time by up to 88.7% compared with the RL-only backbone while preserving comparable routine traffic performance.
- Abstract(参考訳): 強化学習(RL)は交通信号制御(TSC)において有望であることを示す。
しかし、事前定義された状態に依存しているため、トレーニングデータにはない観測可能なオープンワールドイベントへの応答性が制限される。
IoT対応の交差点は、道路脇のセンサーやカメラから異質な観察を提供し、そのようなイベントに対するRL適応性を改善する機会を生み出している。
この目的のために,ゼロショットTSCのためのマルチモーダル基礎モデル拡張RLフレームワークReasonLightを提案する。
ReasonLightは、構造化トラフィック計測、マルチビューカメラ観測、事前訓練されたRLコントローラからの候補位相決定という3つの情報ソースを統合する。
RLが提案するフェーズが与えられた後、ReasonLightは多視点画像から視覚的意味を抽出し、コンパクトなセンサ由来のシーン記述と整合させる。
このアライメントにより、セマンティックガイダンスによるリファインメントモジュールは、トラフィックルールやイベントセマンティクスに従って提案されたアクションを保存または調整することができる。
運用上の信頼性を確保するため、洗練されたアクションは利用可能なフェーズのセットによって制約される。
任意の無効な決定は拒否され、システムは元のRLアクションにフォールバックする。
RL訓練中に見られない2種類のレアな事象、すなわち緊急車両優先と一時的な交通規制についてReasonLightを評価した。
実験結果から、ReasonLightは再トレーニングせずにゼロショット適応を実現することがわかった。
RLのみのバックボーンと比較して緊急車両の待機時間を最大88.7%削減し、通常の交通性能を維持できる。
関連論文リスト
- COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning [55.83415345423854]
批判的オブジェクト指向(CO)推論と強化学習(RL)を統合した新しいエンドツーエンド駆動フレームワークCOVLM-RLを提案する。
CARLAシミュレータで行った実験により、COVLM-RLはトレーニング運転環境における成功率を30%向上することが示された。
論文 参考訳(メタデータ) (2025-12-10T06:18:16Z) - The Path Not Taken: RLVR Provably Learns Off the Principals [85.41043469428365]
スパーシティはモデル条件の最適化バイアスの表面積であることを示す。
我々はこれらの力学を三ゲージ理論で機械的に説明する。
本稿では,RLVRの学習力学のパラメータレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-11-11T18:49:45Z) - Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning [93.00629872970364]
強化学習(Reinforcement Learning, RL)は, 複雑な推論タスクにおいて, 言語モデルの性能向上のための主要なパラダイムとなっている。
SPARKLE(SPARKLE)は、3つの重要な次元にわたるRLの効果を詳細に解析するフレームワークである。
我々は、RL信号と混合品質の推論トレースを産出しない難題が、依然としてトレーニングに有効であるかどうかを調査する。
論文 参考訳(メタデータ) (2025-06-05T07:53:59Z) - VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture [10.403439446065033]
VLMLightは、視覚言語メタコントロールとデュアルブランチ推論を統合する新しいフレームワークである。
大規模言語モデル(LLM)は、安全優先のメタコントローラとして機能し、ルーチントラフィックの高速なRLポリシーとクリティカルケースの構造化推論ブランチを選択できる。
実験によると、VLMLightは緊急車両の待ち時間を、RLのみのシステムよりも最大65%短縮する。
論文 参考訳(メタデータ) (2025-05-26T04:12:57Z) - ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning [68.76048244253582]
ビデオ理解におけるフレーム選択の最適化にルールベース強化学習(RL)を利用する最初のフレームワークであるViaRLを紹介する。
ViaRLは、下流モデルの応答精度を報奨信号として利用し、試行錯誤によってフレームセレクタを訓練する。
ViaRLは、多様なビデオ理解タスクに対して、時間的基盤性能と堅牢な一般化を一貫して提供します。
論文 参考訳(メタデータ) (2025-05-21T12:29:40Z) - FitLight: Federated Imitation Learning for Plug-and-Play Autonomous Traffic Signal Control [33.547772623142414]
強化学習(Reinforcement Learning, RL)に基づく交通信号制御(TSC)手法は, 高い学習コストや一般化性の低下といった深刻な問題を提起する。
We propose a novel Federated Imitation Learning (FIL) based framework for multi-intersection TSC, named FitLight。
FitLightはリアルタイムの模倣学習と強化学習へのシームレスな移行を可能にする。
論文 参考訳(メタデータ) (2025-02-17T15:48:46Z) - iLLM-TSC: Integration reinforcement learning and large language model for traffic signal control policy improvement [5.078593258867346]
大規模言語モデル(LLM)と強化学習(RL)を組み合わせた新しい統合フレームワークを提案する。
提案手法は,従来のRL法と比較して,通信条件の劣化により平均待ち時間を17.5%削減する。
論文 参考訳(メタデータ) (2024-07-08T15:22:49Z) - A Holistic Framework Towards Vision-based Traffic Signal Control with
Microscopic Simulation [53.39174966020085]
交通信号制御(TSC)は交通渋滞を低減し、交通の流れを円滑にし、アイドリング時間を短縮し、CO2排出量を減らすために重要である。
本研究では,道路交通の流れを視覚的観察によって調節するTSCのコンピュータビジョンアプローチについて検討する。
我々は、視覚ベースのTSCとそのベンチマークに向けて、TrafficDojoと呼ばれる総合的なトラフィックシミュレーションフレームワークを導入する。
論文 参考訳(メタデータ) (2024-03-11T16:42:29Z) - DenseLight: Efficient Control for Large-scale Traffic Signals with Dense
Feedback [109.84667902348498]
交通信号制御(TSC)は、道路網における車両の平均走行時間を短縮することを目的としている。
従来のTSC手法は、深い強化学習を利用して制御ポリシーを探索する。
DenseLightは、不偏報酬関数を用いてポリシーの有効性をフィードバックする新しいRTLベースのTSC手法である。
論文 参考訳(メタデータ) (2023-06-13T05:58:57Z) - ModelLight: Model-Based Meta-Reinforcement Learning for Traffic Signal
Control [5.219291917441908]
本稿では,交通信号制御のためのモデルベースメタ強化学習フレームワーク(ModelLight)を提案する。
ModelLight内では、道路交差点のためのモデルのアンサンブルと最適化に基づくメタラーニング法を用いて、RLベースのトラヒックライト制御方式のデータ効率を改善する。
実世界のデータセットの実験では、ModelLightが最先端のトラヒックライト制御アルゴリズムより優れていることが示されている。
論文 参考訳(メタデータ) (2021-11-15T20:25:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。