論文の概要: A Closed-Loop Evaluation of Capability Loss and Recovery in Compressed Driving Policies
- arxiv url: http://arxiv.org/abs/2609.00718v1
- Date: Tue, 01 Sep 2026 04:50:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.341957
- Title: A Closed-Loop Evaluation of Capability Loss and Recovery in Compressed Driving Policies
- Title(参考訳): 圧縮運転法における機能低下と回復の閉ループ評価
- Authors: Ahmad Alfan Alfian Irfan, Nur Ahmad Khatim, Mansur Arief,
- Abstract要約: プルーニング、知識蒸留、量子化は、学習した駆動政策のサイズと推論コストを減らすための標準的な方法である。
圧縮パイプラインを通した運転ポリシーに従う段階的な閉ループ評価手法を提案する。
- 参考スコア(独自算出の注目度): 0.8602553195689513
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many automobile and mobility companies deploy learned driving policies on embedded computers with limited memory and power. Pruning, knowledge distillation, and quantization are the standard methods to reduce the size and the inference cost of these policies. However, these methods are commonly assessed by aggregate numerical scores, and such scores may not reflect the ability of the policy to drive safely when interacting with other road users. In this study, we propose a stage-wise closed-loop evaluation approach to follow a driving policy through a compression pipeline. We formulate the driving task as a partially observable Markov decision process (POMDP) and train a belief-state policy with proximal policy optimization (PPO) in Gym-Duckietown. We then extract the actor, compress it one stage at a time, and evaluate it on five driving curricula. We show that structured pruning is the stage at which the driving capability is first lost. Meanwhile, distillation improves the pruned actor, but the improvement is limited by its rehearsal data. Integer quantization of the improved actor loses some of the curricula that require the vehicle to stop and then resume. Interestingly, the same procedure on the unpruned actor preserves all five curricula. Our study thus provides an empirical analysis aiming to answer the currently active discussions on how to accept a compressed driving policy, so as to achieve a safe and statistically reliable deployment of automated driving functions.
- Abstract(参考訳): 多くの自動車やモビリティ企業は、学習した運転ポリシーをメモリと電力に制限のある組み込みコンピュータに展開している。
プルーニング、知識蒸留、量子化は、これらのポリシーのサイズと推論コストを減らす標準的な方法である。
しかし,これらの手法は総合的な数値スコアで評価されることが一般的であり,他の道路利用者と対話する場合の安全運転能力は反映されない可能性がある。
本研究では,圧縮パイプラインによる運転ポリシーに従う段階的な閉ループ評価手法を提案する。
運転課題を部分的に観測可能なマルコフ決定プロセス (POMDP) として定式化し, ギム・ダッキータウンのPPOを用いた信念状態政策を訓練する。
次に、アクターを抽出し、一度に1ステージ圧縮し、5つの駆動カリキュラムで評価する。
構造化プルーニングは、駆動能力が最初に失われる段階であることを示す。
一方、蒸留は白紙のアクターを改善するが、リハーサルデータによって改善は制限される。
改良されたアクターの整数量子化は、車両の停止と再開を要求するキュリキュラの一部を失う。
興味深いことに、未完成の俳優でも同じ手順で5つのカリキュラムが保存される。
本研究は, 自動運転機能の安全かつ統計的に信頼性の高い展開を実現するために, 圧縮運転ポリシーの受け入れに関する現在活発な議論に答えることを目的とした実証分析である。
関連論文リスト
- DRARL: Disengagement-Reason-Augmented Reinforcement Learning for Efficient Improvement of Autonomous Driving Policy [24.36567420971839]
disengagement-reason-augmented reinforcement learning (DRARL)は、運転ポリシーの改善プロセスを強化する。
本手法は,自律走行ロボットによって収集された実世界の解離事例を用いて評価する。
論文 参考訳(メタデータ) (2025-06-20T03:32:01Z) - Cooperative Advisory Residual Policies for Congestion Mitigation [11.33450610735004]
我々は協調的な諮問システムに利用できる学習済みの残留政策のクラスを開発する。
当社のポリシーは、多様なドライバーの振る舞いを考慮に入れながら、交通渋滞を軽減する方法でドライバーに振る舞うことを推奨している。
我々のアプローチは、異なるドライバーの行動に適応しながら、渋滞を軽減することに成功しました。
論文 参考訳(メタデータ) (2024-06-30T01:10:13Z) - RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes [57.319845580050924]
本稿では,リスク感応制御と適応行動空間のカリキュラムを組み合わせた強化学習フレームワークを提案する。
提案アルゴリズムは,現実世界のオフロード運転タスクに対して,高速なポリシーを学習可能であることを示す。
論文 参考訳(メタデータ) (2024-05-07T23:32:36Z) - Conformal Policy Learning for Sensorimotor Control Under Distribution
Shifts [61.929388479847525]
本稿では,センサコントローラの観測値の分布変化を検知・応答する問題に焦点をあてる。
鍵となる考え方は、整合量子を入力として取ることができるスイッチングポリシーの設計である。
本稿では, 基本方針を異なる特性で切り替えるために, 共形量子関数を用いてこのようなポリシーを設計する方法を示す。
論文 参考訳(メタデータ) (2023-11-02T17:59:30Z) - PeRP: Personalized Residual Policies For Congestion Mitigation Through
Co-operative Advisory Systems [12.010221998198423]
Piecewise Constant (PC) Policiesは、交通渋滞を軽減するために、人間の運転の類似性を構造的にモデル化することで問題に対処する。
我々はPersonalized Residual Policy, PeRPを用いたPCポリシに基づく協調アドバイザリシステムの開発を行った。
提案手法は,運転者の行動に適応しながら,渋滞を軽減し,ベースラインよりも平均速度が4~22%向上したことを示す。
論文 参考訳(メタデータ) (2023-08-01T22:25:40Z) - Robust Driving Policy Learning with Guided Meta Reinforcement Learning [49.860391298275616]
本稿では,ソーシャルカーの多種多様な運転方針を一つのメタ政治として訓練する効率的な方法を提案する。
ソーシャルカーのインタラクションに基づく報酬関数をランダム化することにより、多様な目的を生み出し、メタ政治を効率的に訓練することができる。
本研究では,社会自動車が学習メタ政治によって制御される環境を利用して,エゴ自動車の運転方針の堅牢性を高めるためのトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2023-07-19T17:42:36Z) - Exploring Contextual Representation and Multi-Modality for End-to-End
Autonomous Driving [58.879758550901364]
最近の知覚システムは、センサー融合による空間理解を高めるが、しばしば完全な環境コンテキストを欠いている。
我々は,3台のカメラを統合し,人間の視野をエミュレートするフレームワークを導入し,トップダウンのバードアイビューセマンティックデータと組み合わせて文脈表現を強化する。
提案手法は, オープンループ設定において0.67mの変位誤差を達成し, nuScenesデータセットでは6.9%の精度で現在の手法を上回っている。
論文 参考訳(メタデータ) (2022-10-13T05:56:20Z) - Learning to drive from a world on rails [78.28647825246472]
モデルベースアプローチによって,事前記録された運転ログからインタラクティブな視覚ベースの運転方針を学習する。
世界の前方モデルは、あらゆる潜在的な運転経路の結果を予測する運転政策を監督する。
提案手法は,carla リーダボードにまずランク付けし,40 倍少ないデータを用いて25%高い運転スコアを得た。
論文 参考訳(メタデータ) (2021-05-03T05:55:30Z) - Learning from Simulation, Racing in Reality [126.56346065780895]
ミニチュアレースカープラットフォーム上で自律的なレースを行うための強化学習ベースのソリューションを提案する。
シミュレーションで純粋に訓練されたポリシーは、実際のロボットのセットアップにうまく移行できることを示す。
論文 参考訳(メタデータ) (2020-11-26T14:58:49Z) - Can Autonomous Vehicles Identify, Recover From, and Adapt to
Distribution Shifts? [104.04999499189402]
トレーニング外の配布(OOD)シナリオは、デプロイ時にエージェントを学ぶ上で一般的な課題である。
インプロバスト模倣計画(RIP)と呼ばれる不確実性を考慮した計画手法を提案する。
提案手法は,OODシーンにおける過信および破滅的な外挿を低減し,分布変化を検知し,回復することができる。
分散シフトを伴うタスク群に対する駆動エージェントのロバスト性を評価するために,自動走行車ノベルシーンベンチマークであるtexttCARNOVEL を導入する。
論文 参考訳(メタデータ) (2020-06-26T11:07:32Z) - Counterfactual Policy Evaluation for Decision-Making in Autonomous
Driving [3.1410342959104725]
強化や模倣学習のような学習に基づくアプローチは、自動運転のための意思決定において人気を集めている。
本研究では, 対実的世界を活用した対実的政策評価を導入する。
提案手法は高い成功率を維持しながら衝突速度を著しく低下させることを示す。
論文 参考訳(メタデータ) (2020-03-20T10:02:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。