論文の概要: Interpretable Policy Distillation for Power Grid Topology Control
- arxiv url: http://arxiv.org/abs/2606.00561v1
- Date: Sat, 30 May 2026 06:32:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.523884
- Title: Interpretable Policy Distillation for Power Grid Topology Control
- Title(参考訳): 電力グリッドトポロジー制御のための解釈可能な政策蒸留
- Authors: Aleksandra Dmitruka, Karlis Freivalds,
- Abstract要約: 我々は,PPOエージェントを,運用性能を損なうことなく,コンパクトな木型サロゲートに圧縮できるかどうかを問う。
PPOの教師は、Grid2Opの標準14バス環境において、重大かつ高負荷状態のストレス中心のデータ収集を使用して、安定性を重視した報酬で訓練される。
両方のサロゲートは、平均報酬と生存期間において、推論コストのごく一部で教師を上回る。
- 参考スコア(独自算出の注目度): 46.15556541260613
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep reinforcement learning (RL) offers a promising route to real-time power grid operation, yet large neural policies are costly to evaluate, hard to deploy on constrained hardware, and opaque to operators. We ask whether a Proximal Policy Optimization (PPO) agent for grid topology control can be compressed into compact tree-based surrogates without losing operational performance. A PPO teacher is trained on Grid2Op's standard 14-bus environment with a stability-oriented reward, using stress-focused data collection on critical, high-loading states. The policy is then distilled into a decision tree and a random forest. Across held-out validation episodes, both surrogates exceed the teacher in mean reward and survival length at a fraction of the inference cost. The decision tree shows high exact-action agreement with the PPO argmax and near-complete agreement within its top-ranked actions, while remaining small enough to be inspected directly. Feature-importance analysis reveals a representational shift: the PPO policy relies mainly on line-loading signals, while the distilled tree is driven primarily by bus-topology variables. These results suggest that stress-focused distillation can convert a black-box neural controller into a lightweight, auditable rule-like surrogate suited for real-time deployment, while also surfacing risks tied to deterministic actions and topology-specific generalization.
- Abstract(参考訳): 深層強化学習(RL)は、リアルタイム電力グリッド操作への有望な経路を提供するが、大きなニューラルポリシは評価にコストがかかり、制約のあるハードウェアへのデプロイが困難であり、オペレータには不透明である。
グリッドトポロジ制御のためのPPO(Proximal Policy Optimization)エージェントが,運用性能を損なうことなく,コンパクトなツリーベースサロゲートに圧縮できるかどうかを問う。
PPOの教師は、Grid2Opの標準14バス環境において、重大かつ高負荷状態のストレス中心のデータ収集を使用して、安定性を重視した報酬で訓練される。
この方針はその後、決定木とランダムな森に蒸留される。
保留された検証エピソード全体で、双方のサロゲートは、平均報酬と生存期間において、推論コストのごく一部で教師を上回っている。
決定ツリーは、PPOのargmaxと、上位のアクションの中でほぼ完全に一致しているが、直接検査できるほど小さい。
PPOポリシは主にラインローディング信号に依存し、蒸留木は主にバストポロジー変数によって駆動される。
これらの結果は,ブラックボックス型ニューラルコントローラを,リアルタイム展開に適した軽量で監査可能なルールライクなサロゲートに変換すると同時に,決定論的行動やトポロジ固有の一般化に関連するリスクを克服できることを示唆している。
関連論文リスト
- gym-invmgmt: An Open Benchmarking Framework for Inventory Management Methods [1.0799969476894555]
Gym-invmgmtは、監査可能なクロスパラダイム評価のためのOR-Gymインベントリ管理系統の拡張である。
Gymnasium互換のOR-Gymインベントリ管理系統であるGimmom-invmgmtを聴覚的クロスパラダイム評価のために提案する。
論文 参考訳(メタデータ) (2026-05-12T00:22:15Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - ContractionPPO: Certified Reinforcement Learning via Differentiable Contraction Layers [5.690649768462432]
本稿では,手足ロボットのロバストな計画と制御のためのフレームワークであるContractionPPOを提案する。
収縮PPOは、模擬閉ループ系の指数的安定性を証明する収縮計量を生成する。
四足歩行におけるハードウェア実験により,強い外乱下であっても,ContractionPPOは頑健で安定な制御を可能にすることが示された。
論文 参考訳(メタデータ) (2026-03-20T04:32:18Z) - Robust Regularized Policy Iteration under Transition Uncertainty [6.7431287237221085]
我々は、オフラインRLをロバストなポリシー最適化として定式化し、遷移カーネルを不確実性集合内の決定変数として扱う。
本稿では、抽出可能な最大最小二レベル目標を、抽出可能なKL正規化サロゲートに置き換えるロバスト正規化ポリシーイテレーション(RRPI)を提案する。
D4RLベンチマークの実験では、RRPIは高い平均性能を示し、最近のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-10T08:18:27Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - HiPP-Prune: Hierarchical Preference-Conditioned Structured Pruning for Vision-Language Models [2.1418081649543157]
HiPP-Pruneは階層的な好み条件付き構造化プルーニングフレームワークであり、プルーニングを条件付きリソース割り当てとして扱う。
HiPP-Pruneは、決定を全体的なスパーシティ予算と階層的なアロケーションに分解することで、プランレベルの決定を行う。
論文 参考訳(メタデータ) (2026-03-06T13:31:54Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG [71.06073770344732]
エージェント検索強化生成(RAG)は、推論と情報検索の多段階的な相互作用として質問応答を定式化する。
エージェントRAGのためのオンラインツリーベースRLフレームワークであるTreePS-RAGについて述べる。
論文 参考訳(メタデータ) (2026-01-11T14:07:30Z) - Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards [47.557539197058496]
逆推論のためのランダムポリシー評価(ROVER)について紹介する。
ROVERは、一様政体Q値上のソフトマックスから作用をサンプリングする最小限だが高効率なRL法である。
textbfquality(textbf+8.2 on pass@1, textbf+16.8 on pass@256)と textbfdiversity(textbf+17.6%)の両方で優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-09-29T16:09:07Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。