論文の概要: DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control
- arxiv url: http://arxiv.org/abs/2604.25259v1
- Date: Tue, 28 Apr 2026 06:09:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.730247
- Title: DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control
- Title(参考訳): DGLight:DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control
- Authors: Chenbo Yu,
- Abstract要約: 交通信号制御(TSC)は渋滞の低減と都市移動の維持に重要な役割を果たしている。
この論文は、事前訓練された大規模言語モデルをTSCに適応させるための、批評家が指導する強化学習フレームワークであるDGLightを紹介している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Traffic signal control (TSC) plays a central role in reducing congestion and maintaining urban mobility. This dissertation introduces DGLight, a critic-guided reinforcement-learning framework for adapting a pretrained large language model to TSC. DGLight first trains a CoLight-based Deep Q-Network critic to estimate traffic-aware action values from structured intersection states, then uses the frozen critic to score candidate language-model actions and optimize the policy with Group Relative Policy Optimization (GRPO). The resulting controller maps traffic states to interpretable reasoning traces and signal decisions while learning from dense per-state supervision rather than raw cumulative environment rewards. Experiments on TSC benchmarks covering Jinan and Hangzhou show that DGLight is the strongest overall method among the compared LLM-based controllers, remains competitive with strong RL baselines, and transfers well to city datasets not used to fit the critic. Qualitative examples further show that the model's generated reasoning is interpretable and aligned with the chosen signal phase. The project code is available $\href{https://github.com/yyccbb/FYP_LLMTSC}{here}$.
- Abstract(参考訳): 交通信号制御(TSC)は渋滞の低減と都市移動の維持に重要な役割を果たしている。
この論文は、事前訓練された大規模言語モデルをTSCに適応させるための、批評家が指導する強化学習フレームワークであるDGLightを紹介している。
DGLightはまず、CoLightベースのDeep Q-Network批評家を訓練し、構造化された交差点状態からトラフィックを意識したアクション値を推定し、凍結された批評家を使って候補言語モデルアクションをスコアし、グループ相対ポリシー最適化(GRPO)でポリシーを最適化する。
結果として得られるコントローラは、トラフィック状態を、生の累積的な環境報酬ではなく、高密度な州ごとの監視から学びながら、解釈可能な推論トレースと信号決定にマッピングする。
Jinan と Hangzhou を対象とする TSC ベンチマークの実験によると,DGLight は LLM ベースのコントローラの中では最強の総合的な手法であり,強力な RL ベースラインと競合し続けている。
定性的な例は、モデルが生成した推論が解釈可能であり、選択された信号位相と整合していることを示している。
プロジェクトコードは$\href{https://github.com/yyccbb/FYP_LLMTSC}{here}$で利用可能である。
関連論文リスト
- LLM-Augmented Traffic Signal Control with LSTM-Based Traffic State Prediction and Safety-Constrained Decision Support [0.0]
本研究では,LSTMに基づく短期交通状態予測を統合したLLM拡張交通信号制御フレームワークを提案する。
提案手法は,特に動的かつ非再帰的な交通条件下での交通効率を向上する。
論文 参考訳(メタデータ) (2026-04-26T22:26:20Z) - CuraLight: Debate-Guided Data Curation for LLM-Centered Traffic Signal Control [25.292538507972868]
交通信号制御はインテリジェントトランスポートシステム(ITS)のコアコンポーネントである
強化学習(RL)と大規模言語モデル(LLM)に基づく最近のアプローチは適応性を改善したが、それでも限定的な解釈性に悩まされている。
本稿では,LL エージェントが LLM ベースの信号制御装置の微調整を支援するフレームワークである CuraLight を提案する。
論文 参考訳(メタデータ) (2026-04-07T10:05:43Z) - Wireless Traffic Prediction with Large Language Model [54.07581399989292]
TIDESは、無線トラフィック予測のための空間時間相関をキャプチャする新しいフレームワークである。
TIDESは過剰なトレーニングオーバーヘッドを発生させることなく、ドメイン固有のパターンへの効率的な適応を実現する。
この結果から,将来の6Gシステムにおいて,空間認識をLCMベースの予測器に統合することが,スケーラブルでインテリジェントなネットワーク管理の鍵であることが示唆された。
論文 参考訳(メタデータ) (2025-12-19T04:47:40Z) - COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning [55.83415345423854]
批判的オブジェクト指向(CO)推論と強化学習(RL)を統合した新しいエンドツーエンド駆動フレームワークCOVLM-RLを提案する。
CARLAシミュレータで行った実験により、COVLM-RLはトレーニング運転環境における成功率を30%向上することが示された。
論文 参考訳(メタデータ) (2025-12-10T06:18:16Z) - Quantifying Distribution Shift in Traffic Signal Control with Histogram-Based GEH Distance [0.6961253535504978]
本稿では,交通シナリオを需要ヒストグラムとして表現し,分散シフトを定量化する手法を提案する。
NEMAアクティベートコントローラと強化学習コントローラの両方を用いて,20のシミュレーションシナリオに対するアプローチを検証する。
全体として、この手法は、以前公表した手法よりも分散シフトによる性能劣化を予測できる。
論文 参考訳(メタデータ) (2025-11-16T11:05:02Z) - Green Learning for STAR-RIS mmWave Systems with Implicit CSI [53.03358325565645]
再構成可能なインテリジェントサーフェス (STAR-RIS) 支援ミリ波放送システム (mmWave) を同時に送信し, 反射するグリーンラーニング (GL) ベースのプリコーディングフレームワークを提案する。
本研究は,将来の6Gネットワークにおける環境持続可能性を重視し,複数のユーザが同一情報を共有し,スペクトル効率を向上し,冗長伝送と電力消費を低減させるシナリオに,トランスミッションフレームワークを採用する。
論文 参考訳(メタデータ) (2025-09-08T15:56:06Z) - Bayesian Critique-Tune-Based Reinforcement Learning with Adaptive Pressure for Multi-Intersection Traffic Signal Control [0.5399800035598185]
本稿では,多区間信号制御(BCT-APLight)のための適応的圧力を用いた批判-テュンベース強化学習を提案する。
BCT-APLightは、7つの実世界のデータセット上の他の最先端(SOTA)メソッドよりも優れている。
論文 参考訳(メタデータ) (2024-12-18T14:33:25Z) - A Holistic Framework Towards Vision-based Traffic Signal Control with
Microscopic Simulation [53.39174966020085]
交通信号制御(TSC)は交通渋滞を低減し、交通の流れを円滑にし、アイドリング時間を短縮し、CO2排出量を減らすために重要である。
本研究では,道路交通の流れを視覚的観察によって調節するTSCのコンピュータビジョンアプローチについて検討する。
我々は、視覚ベースのTSCとそのベンチマークに向けて、TrafficDojoと呼ばれる総合的なトラフィックシミュレーションフレームワークを導入する。
論文 参考訳(メタデータ) (2024-03-11T16:42:29Z) - Learning to Sail Dynamic Networks: The MARLIN Reinforcement Learning
Framework for Congestion Control in Tactical Environments [53.08686495706487]
本稿では, 正確な並列化可能なエミュレーション環境を利用して, 戦術ネットワークの環境を再現するRLフレームワークを提案する。
衛星通信(SATCOM)とUHFワイドバンド(UHF)の無線リンク間のボトルネックリンク遷移を再現した条件下で、MARLINエージェントを訓練することにより、我々のRL学習フレームワークを評価する。
論文 参考訳(メタデータ) (2023-06-27T16:15:15Z) - DenseLight: Efficient Control for Large-scale Traffic Signals with Dense
Feedback [109.84667902348498]
交通信号制御(TSC)は、道路網における車両の平均走行時間を短縮することを目的としている。
従来のTSC手法は、深い強化学習を利用して制御ポリシーを探索する。
DenseLightは、不偏報酬関数を用いてポリシーの有効性をフィードバックする新しいRTLベースのTSC手法である。
論文 参考訳(メタデータ) (2023-06-13T05:58:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。