論文の概要: Structured Reinforcement Learning for Bayesian Persuasion : Application to Intelligent Interactive Driving
- arxiv url: http://arxiv.org/abs/2607.13576v1
- Date: Wed, 15 Jul 2026 08:17:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.70272
- Title: Structured Reinforcement Learning for Bayesian Persuasion : Application to Intelligent Interactive Driving
- Title(参考訳): ベイジアン説得のための構造化強化学習 : インテリジェントインタラクティブ運転への応用
- Authors: Merlin Paul, Anup Aprem,
- Abstract要約: 本稿ではベイジアン説得の戦略的情報開示の枠組みについて考察する。
計算効率のよいシグナリング戦略を合成するオンライン構造化強化学習フレームワークを提案する。
提案手法は, リードおよび連結車両の走行報酬を最適化するために, 30%のコスト効率で提案する。
- 参考スコア(独自算出の注目度): 1.2891210250935148
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Interactive driving, wherein an intelligent lead vehicle equipped with real-time traffic data coordinates route choices of connected vehicles, offers a promising approach to dynamic traffic management. To address the challenge of harmonising decisions, this paper considers the strategic information revealing framework of Bayesian persuasion. Here, the principal (lead vehicle) aims to guide the agent's (connected vehicle) partially observable sequential decision making towards its own objectives by selectively revealing information, such as real-time traffic ahead, using signals. However, the agent's farsighted response to maximize its long-term reward, renders the principal's signaling strategy design computationally challenging. We propose an online structured reinforcement learning framework to synthesize computationally efficient signaling strategy which is persuasive for a far-sighted agent. The main contributions of the paper are as follows: (i) For a monotonic agent with approximate best response, we propose MAPL, a structured policy learning algorithm for faster online learning, (ii) Identification of sufficient conditions for the supermodular structure of the Q function of the principal for a monotonic agent, (iii) Identification of sufficient conditions to ensure the persuasiveness of the principal's signaling strategy, (iv) Supermodular Q learning for Principal (SQP), which leverages the supermodular structure of principal's action value to synthesize computationally efficient signaling strategy that is persuasive for a monotonic learning agent, (v) Numerical analysis considering a real-time application of Bayesian persuasive driving for lane selection demonstrates that the proposed method is 30% cost efficient for optimising travelling rewards of both the lead and connected vehicle compared to the existing methodologies for signaling strategy design.
- Abstract(参考訳): リアルタイム交通データを備えたインテリジェントなリード車両が接続された車両の経路選択を協調する対話運転は、動的な交通管理に有望なアプローチを提供する。
意思決定を調和させるという課題に対処するために,ベイズ説得の戦略的情報開示の枠組みについて考察する。
ここでは、先行するリアルタイムトラフィックなどの情報を信号を用いて選択的に公開することにより、エージェントの部分的に観測可能なシーケンシャルな決定を自身の目的に向けて導くことを目的としている。
しかし、エージェントの長期的な報酬を最大化するための遠視的反応は、主成分の信号戦略設計を計算的に困難にしている。
本稿では,遠隔エージェントに対して説得力のある計算効率の良い信号処理戦略を合成するためのオンライン構造化強化学習フレームワークを提案する。
本論文の主な貢献は次の通りである。
(i)最適応答を近似した単調エージェントに対し,より高速なオンライン学習のための構造化ポリシー学習アルゴリズムMAPLを提案する。
2)単調剤の主成分のQ関数の超モジュラ構造に対する十分条件の同定
三 校長の合図戦略の説得力を確保するための十分な条件の特定
(4)主作用値の超モジュラ構造を活用して単調学習エージェントに説得力のある計算効率の良いシグナリング戦略を合成するプリンシパルのための超モジュラQ学習(SQP)
5)車線選択におけるベイズ的説得運転のリアルタイム適用を考慮した数値解析により,既存の信号戦略設計手法と比較して,リード車とコネクテッド車の両方の走行報酬を最適化する上で,提案手法が30%コスト効率が高いことを示した。
関連論文リスト
- Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance [86.46794021499511]
戦略利用と戦略実行可能性の間には、これまで未定のギャップがある。
SSR(Selective Strategy Retrieval)は,実行可能性を明確にモデル化するテストタイムフレームワークである。
SSRは、直接解決、文脈内学習、単一ソースガイダンスよりも信頼性が高く一貫した改善をもたらす。
論文 参考訳(メタデータ) (2026-02-26T03:34:23Z) - Robust Single-Agent Reinforcement Learning for Regional Traffic Signal Control Under Demand Fluctuations [5.784337914162491]
交通渋滞は、主に交差点の待ち行列によって引き起こされ、都市生活水準、安全性、環境品質、経済効率に大きな影響を及ぼす。
本研究では,地域適応型TSCのための新しい単エージェント強化学習フレームワークを提案する。
このフレームワークは堅牢な反ゆらぎ能力を示し、待ち時間を大幅に短縮する。
論文 参考訳(メタデータ) (2025-11-01T13:18:50Z) - ReAL-AD: Towards Human-Like Reasoning in End-to-End Autonomous Driving [27.75047397292818]
エンドツーエンドの自動運転は、単一のフレームワーク内で認識、予測、計画を統合するための有望なアプローチとして現れています。
本稿では,3階層の認知モデルに基づいて自律運転における意思決定を構造化するReAL-ADを提案する。
我々のフレームワークを統合することで、計画の正確さと安全性が30%以上向上し、エンドツーエンドの自動運転がより解釈可能になり、人間のような階層的推論に適合することを示します。
論文 参考訳(メタデータ) (2025-07-16T02:23:24Z) - TeLL-Drive: Enhancing Autonomous Driving with Teacher LLM-Guided Deep Reinforcement Learning [61.33599727106222]
TeLL-Driveは、Teacher LLMを統合して、注意に基づく学生DRLポリシーをガイドするハイブリッドフレームワークである。
自己維持機構はDRLエージェントの探索とこれらの戦略を融合させ、政策収束を加速し、堅牢性を高める。
論文 参考訳(メタデータ) (2025-02-03T14:22:03Z) - Research on Autonomous Driving Decision-making Strategies based Deep Reinforcement Learning [9.318715702876958]
行動決定サブシステムは、自律運転システムの重要な構成要素である。
本研究では、自律的に学習し、運転戦略を最適化する高度な強化学習モデルを採用する。
論文 参考訳(メタデータ) (2024-08-06T10:24:54Z) - Interactive Autonomous Navigation with Internal State Inference and
Interactivity Estimation [58.21683603243387]
本稿では,関係時間的推論を伴う3つの補助的タスクを提案し,それらを標準のディープラーニングフレームワークに統合する。
これらの補助的なタスクは、他の対話的エージェントの行動パターンを推測するための追加の監視信号を提供する。
提案手法は,標準評価指標の観点から,頑健かつ最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-11-27T18:57:42Z) - Learning to Help Emergency Vehicles Arrive Faster: A Cooperative
Vehicle-Road Scheduling Approach [24.505687255063986]
車両中心のスケジューリングアプローチは、緊急車両の最適経路を推奨する。
道路中心のスケジューリングアプローチは、交通状況を改善し、EVが交差点を通過するための優先度を高めることを目的としている。
本稿では,リアルタイム経路計画モジュールと協調交通信号制御モジュールを含む協調型VehIcle-roaDスケジューリング手法であるLEVIDを提案する。
論文 参考訳(メタデータ) (2022-02-20T10:25:15Z) - MetaVIM: Meta Variationally Intrinsic Motivated Reinforcement Learning for Decentralized Traffic Signal Control [54.162449208797334]
交通信号制御は、交差点を横断する交通信号を調整し、地域や都市の交通効率を向上させることを目的としている。
近年,交通信号制御に深部強化学習(RL)を適用し,各信号がエージェントとみなされる有望な性能を示した。
本稿では,近隣情報を考慮した各交差点の分散化政策を潜時的に学習するメタ変動固有モチベーション(MetaVIM)RL法を提案する。
論文 参考訳(メタデータ) (2021-01-04T03:06:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。