論文の概要: ProcessLight: Process Supervision for Large Language Model Based Traffic Signal Control
- arxiv url: http://arxiv.org/abs/2609.22746v1
- Date: Sat, 19 Sep 2026 04:00:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.897437
- Title: ProcessLight: Process Supervision for Large Language Model Based Traffic Signal Control
- Title(参考訳): ProcessLight:大規模言語モデルに基づく交通信号制御のためのプロセススーパービジョン
- Abstract要約: 大規模言語モデル (LLM) は交通信号制御 (TSC) に決定エージェントとして導入された。
我々は、信号決定を検証可能なセマンティックステップに分解するLLMベースのフレームワークProcessLightを提案する。
我々はさらに,新しい強化学習フレームワークであるStep-wise Traffic Process Policy Optimization (STeP-PO)を開発した。
- 参考スコア(独自算出の注目度): 6.268088038005508
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have recently been introduced into traffic signal control (TSC) as decision agents due to their strengths in human-readable reasoning generation. Yet, existing LLM TSC methods optimize only from final outcomes and fail to distinguish valid from flawed reasoning steps, causing useful or misleading steps to be jointly updated and thus impairing the model's learning of effective reasoning. To bridge this gap, we propose an LLM-based framework ProcessLight to decompose signal decisions into verifiable semantic steps. Building on ProcessLight, we further develop Step-wise Traffic Process Policy Optimization (STeP-PO), a novel reinforcement learning framework that optimizes structured reasoning processes through step-level credit assignment. Specifically, STeP-PO uses step quality scores to evaluate local reasoning quality and step importance to measure each step's influence on the final action, and then assigns step-level advantages over a semantic step tree structure. The resulting step-level advantages are propagated to reasoning tokens, enabling fine-grained policy optimization beyond outcome-only rewards. Extensive experiments over multiple real-world datasets demonstrate the superiority of our methods. Our code is available at https://github.com/wenzhaoabc/processlight.
- Abstract(参考訳): 近年,Large Language Models (LLMs) が交通信号制御 (TSC) に導入されている。
しかし、既存のLCM TSC法は最終結果のみを最適化し、欠陥のある推論ステップと有効性を区別できないため、有用または誤解を招くステップを共同で更新することになり、モデルが効果的な推論を学ぶのを損なう。
このギャップを埋めるために、信号決定を検証可能なセマンティックステップに分解するLLMベースのフレームワークProcessLightを提案する。
ProcessLight上に構築したStep-wise Traffic Process Policy Optimization (STeP-PO) は,ステップレベルのクレジット割り当てを通じて構造化推論プロセスを最適化する新しい強化学習フレームワークである。
具体的には、STeP-POは、ステップ品質スコアを使用して、局所的推論の品質を評価し、各ステップが最終動作に与える影響を計測し、セマンティックなステップツリー構造よりもステップレベルのアドバンテージを割り当てる。
結果として生じるステップレベルのアドバンテージは、トークンの推論に伝播し、結果のみの報酬を超えた、きめ細かいポリシー最適化を可能にする。
複数の実世界のデータセットに対する大規模な実験は、我々の手法の優位性を実証している。
私たちのコードはhttps://github.com/wenzhaoabc/processlight.comから入手可能です。
関連論文リスト
- Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets [14.165642103539632]
本稿では,政策学習をユークリッドのスコア空間に移行し,アクションデコーダによる実行可能性を高める枠組みを提案する。
このフレームワークを,状態依存型インデックスベースのディスパッチルールを本質的に学習する待ち行列ネットワーク制御問題に適用する。
数値実験により、小さなインスタンスではほぼ最適性能を示し、大規模システムではベンチマークよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-06-09T15:15:21Z) - Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization [24.150613011881774]
Step-TPはテンソルプログラム最適化のためのトレーニング後のデータセットである。
構造的チェーン・オブ・シークレット(CoT)推論による、基底的で原子レベルのステップレベルの監視を提供する。
Step-TPは、中間プログラム状態上のクローズド推論ループを形成し、信頼性の高いマルチステップ最適化を可能にする。
論文 参考訳(メタデータ) (2026-05-25T15:29:49Z) - Goal-Conditioned Supervised Learning for LLM Fine-Tuning [10.43951412455864]
大規模言語モデルのためのオフライン微調整フレームワークとして,目標条件付き教師あり学習を提案する。
私たちの中核的な考え方は、フィードバック信号を直接明示的な目標として扱い、純粋に教師付き学習を通じてモデルをトレーニングし、その目標を達成するためのレスポンスを生成することです。
論文 参考訳(メタデータ) (2026-05-08T01:55:40Z) - Segment-Aligned Policy Optimization for Multi-Modal Reasoning [55.29606572822562]
本稿では、トークンや全シーケンスではなく、一貫性のある推論ステップをポリシー更新の基本単位として扱う新しい強化学習パラダイムを提案する。
代表的な推論ベンチマークの実験は、SAPOがトークンレベルおよびシーケンスレベルポリシー最適化手法を一貫して上回っていることを示している。
我々の研究は、強化学習の更新を推論の構造と整合させることの重要性を強調し、複雑な推論タスクにおけるより効率的でセマンティックに根ざした政策最適化の道を開く。
論文 参考訳(メタデータ) (2026-05-02T08:47:45Z) - Optimizing LLM Prompt Engineering with DSPy Based Declarative Learning [0.0]
大規模言語モデル(LLM)は、幅広い自然言語処理タスクにおいて、高いパフォーマンスを示している。
それらの効果は、素早い設計、構造、組込み推論に大きく依存している。
本稿では,DSPyに基づく宣言型学習の体系的研究を行い,迅速な最適化を提案する。
論文 参考訳(メタデータ) (2026-04-06T17:17:57Z) - Generating Structured Plan Representation of Procedures with LLMs [5.623006055588189]
本稿では,SOPを構造化表現に変換する新しい手法であるSOPStructuringを紹介する。
SOPStructは、異なるドメインにわたるSOPの標準化された表現を生成し、認知負荷を低減し、ユーザの理解を改善する。
我々の研究は、プロセスモデリングを合理化するために、大規模言語モデルの変換可能性を強調します。
論文 参考訳(メタデータ) (2025-03-28T22:38:24Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。