論文の概要: Preference-Conditioned Multi-Objective Reinforcement Learning for Runtime-Tunable Transit Signal Priority
- arxiv url: http://arxiv.org/abs/2607.18286v1
- Date: Tue, 30 Jun 2026 09:57:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.107572
- Title: Preference-Conditioned Multi-Objective Reinforcement Learning for Runtime-Tunable Transit Signal Priority
- Title(参考訳): 実行時可変信号優先性のための前提条件付き多目的強化学習
- Authors: Philip-Roman Adam, Stefanie Schmidtner,
- Abstract要約: トランジット信号優先(TSP)は、バスの遅延を低減し、バス以外の交通に対する悪影響を制限し、車両のサブセットの極端な待ち時間を避けるという、競合する目標のバランスを必要とする。
本稿では、最小/最大グリーンおよび遷移実現可能性制約の下で次の信号位相を選択する設定条件付きTSPコントローラを提案する。
実験により、単一の学習条件付きポリシは、好みを越えてスムーズな経験的トレードオフフロンティアにまたがり、固定時間とルールベースのベースラインを上回る性能を示し、制約実現性を維持する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transit signal priority (TSP) requires balancing competing objectives: reducing bus delay while limiting adverse impacts on non-bus traffic and avoiding extreme waits for a subset of vehicles. Existing reinforcement-learning (RL) approaches to TSP typically encode transit-aware features (e.g., occupancy and schedule deviation) but optimize a fixed reward or fixed scalarization, which limits operational flexibility when agency priorities change across time-of-day or disruption conditions. We present a preference-conditioned TSP controller, $π(a \mid s,w)$, that selects the next signal phase under minimum/maximum green and transition-feasibility constraints and can be tuned at runtime via a preference parameter $w$ to trade off bus-priority emphasis against overall traffic delay without retraining. We implement this on top of IntersectionZoo by introducing a constrained signal-control/TSP wrapper, and we extend scenario generation with bus-prevalence augmentation and timetable-based bus insertion to address sparse transit-priority events during training. Experiments against fixed-time control, a rule-based TSP overlay, and fixed-weight PPO specialists show that a single learned conditioned policy spans a smooth empirical trade-off frontier across runtime preferences, outperforms fixed-time and rule-based baselines, and maintains constraint feasibility, while tail-delay diagnostics reveal that non-bus externalities remain limited for moderate preference settings but can increase substantially under high bus-priority weights. The source code of this work is available at https://github.com/urbanAIthi/morl-tsp.
- Abstract(参考訳): トランジット信号優先(TSP)は、バスの遅延を低減し、バス以外の交通に対する悪影響を制限し、車両のサブセットの極端な待ち時間を避けるという、競合する目標のバランスを必要とする。
既存の強化学習(RL)アプローチは、一般的にトランジット対応の特徴(例えば、占有率やスケジュール偏差)を符号化するが、固定報酬や固定スカラー化を最適化する。
優先条件付きTSPコントローラである$π(a \mid s,w)$は、最小/最大グリーンおよび遷移フェーザビリティ制約の下で次の信号位相を選択し、優先パラメータ$w$で実行時に調整することで、再トレーニングなしでバス優先の強調をバスの遅延から切り離すことができる。
我々は,IntersectionZoo上に制約付き信号制御/TSPラッパーを導入することでこれを実装し,バスの頻度向上と時刻表ベースのバス挿入によるシナリオ生成を拡張して,トレーニング中の疎度なトランジッション・プライオリティイベントに対処する。
固定時間制御、ルールベースのTSPオーバーレイ、固定ウェイトPPOスペシャリストに対する実験では、単一の学習条件付きポリシーが実行時優先のスムーズなトレードオフフロンティアにまたがり、固定時間およびルールベースベースラインを上回り、制約可能な実現性を維持する一方で、テール遅延診断では、バス以外の外部性は適度な設定に制限されるが、バスプライオリティの重みよりも大幅に増加することが示されている。
この作業のソースコードはhttps://github.com/urbanAIthi/morl-tsp.comで公開されている。
関連論文リスト
- Adapt Only When It Pays: Budgeted Decision-Loss Priority for Delayed Online Time-Series Adaptation [0.0]
封印された遅延キュー、正確な予算会計、監査可能な更新テレメトリを備えた残差適応フレームワークであるADOWIPを紹介する。
そのメインスケジューラは、フィードバックが公表された後にのみ更新される、観察された決定余分な優先度ゲートである。
コンベックス線形受け入れ更新サブプロブレムに対して, ハード予算の実現性, 提案したOGD後悔, 安定性, 条件付き有限サンプルゲート選択文を検証した。
論文 参考訳(メタデータ) (2026-06-23T18:22:22Z) - Capacity-Constrained Online Convex Optimization with Delayed Feedback [58.59385794080679]
容量制約下での遅延オンライン凸最適化(OCO)について検討した。
1次フィードバックの場合、容量$C = (log T)$ sufficesで標準遅延OCOレートを対数係数まで回復できることがわかった。
包帯フィードバックの場合、後悔率は$(1 + _textmax/C)$で変調される。
論文 参考訳(メタデータ) (2026-06-10T06:37:06Z) - SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data [49.370849653460716]
本稿では,アクタに整列したオフポリシー評価信号を用いたSOPEを,自動早期停止機構として提案する。
Minariベンチマークスイートから25の継続的制御タスクを評価した。
SOPEはベースライン性能を最大45.6%改善し、必要なTFLOPを最大22倍改善した。
論文 参考訳(メタデータ) (2026-05-07T08:32:09Z) - Early Pruning for Public Transport Routing [10.403354331320516]
本稿では、最適性を損なうことなくルーティングアルゴリズムを高速化する低オーバーヘッド手法であるEarly Pruningを紹介する。
転送接続を継続時間でプリソートし、転送ループ内にプルーニングルールを適用することにより、現在の最適解よりも早く到着できないと、停止時に長い転送を破棄する。
複数の最先端のRAPTORベースのソリューションで、クエリ時間を最大57%削減しました。
論文 参考訳(メタデータ) (2026-03-13T02:49:32Z) - FlowPrefill: Decoupling Preemption from Prefill Scheduling Granularity to Mitigate Head-of-Line Blocking in LLM Serving [13.856291757420012]
長期にわたる要求はリソースを独占し、より高いプライオリティの要求を遅らせ、TTFT(Time-to-first-token)サービスレベルの違反を広範囲に発生させる。
本稿では,TTFTに最適化されたサービスシステムであるFlowPrefillを提案する。
FlowPrefillは最先端システムと比較して最大出力を最大5.6$times$に改善することを示す。
論文 参考訳(メタデータ) (2026-02-18T16:57:45Z) - PASS-Enhanced MEC: Joint Optimization of Task Offloading and Uplink PASS Beamforming [67.78883135636657]
ピンチアンテナシステム (PASS) によるモバイルエッジコンピューティング (MEC) アーキテクチャについて検討した。
PASSは、重要な経路損失と潜在的な信号遮断を効果的に軽減しつつ、短距離ライン・オブ・ライト(LoS)リンクを確立する。
ネットワーク遅延最小化問題を定式化し、アップリンクPASSビームフォーミングとタスクオフロードを共同で最適化する。
論文 参考訳(メタデータ) (2025-10-27T03:04:46Z) - Adaptive Transit Signal Priority based on Deep Reinforcement Learning and Connected Vehicles in a Traffic Microsimulation Environment [0.0]
本研究は、適応トランジット信号優先(TSP)アルゴリズムを含むRLベースのトラフィック制御を拡張した。
このエージェントは、バスの走行時間を約21%短縮し、飽和率0.95で一般交通に悪影響を及ぼすことを示した。
論文 参考訳(メタデータ) (2024-07-31T18:17:22Z) - Guaranteed Dynamic Scheduling of Ultra-Reliable Low-Latency Traffic via
Conformal Prediction [72.59079526765487]
アップリンクにおける超信頼性・低遅延トラフィック(URLLC)の動的スケジューリングは、既存のサービスの効率を大幅に向上させることができる。
主な課題は、URLLCパケット生成のプロセスにおける不確実性である。
本稿では,URLLC トラフィック予測器の品質に関わらず,信頼性と遅延を保証した新しい URLLC パケットスケジューラを提案する。
論文 参考訳(メタデータ) (2023-02-15T14:09:55Z) - Deep Reinforcement Learning based Dynamic Optimization of Bus Timetable [4.337939117851783]
深層強化学習に基づくバス時刻動的最適化法(DRL-TO)を提案する。
DQN(Deep Q-Network)は、サービス期間中にバスサービスをディスパッチするかどうかを決定する決定モデルとして使用される。
DRL-TOは、リアルタイムの乗客フローに基づいて出発間隔を動的に決定し、車両の8$%を節約し、乗客の待ち時間の平均17$%を削減できる。
論文 参考訳(メタデータ) (2021-07-15T01:22:49Z) - Better than the Best: Gradient-based Improper Reinforcement Learning for
Network Scheduling [60.48359567964899]
パケット遅延を最小限に抑えるため,制約付き待ち行列ネットワークにおけるスケジューリングの問題を考える。
我々は、利用可能な原子ポリシーよりも優れたスケジューラを生成するポリシー勾配に基づく強化学習アルゴリズムを使用する。
論文 参考訳(メタデータ) (2021-05-01T10:18:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。