論文の概要: HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging
- arxiv url: http://arxiv.org/abs/2608.00679v1
- Date: Sat, 01 Aug 2026 13:59:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.863787
- Title: HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging
- Title(参考訳): HetGPS: 電気自動車充電のための物理アンコレッド適応安全を用いたスケーラブルグラフマルチエージェント強化学習
- Abstract要約: HetGPSは、学習したグラフリスクと物理アンコール補正を相乗化するためのグラフ制御フレームワークである。
電気自動車の充電では、パラメータ共有した異種グラフソフトアクター批判ポリシーでこのフィルタを結合する。
- 参考スコア(独自算出の注目度): 5.264722105217776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety interventions for large populations of network-coupled agents must protect shared constraints without unnecessarily overriding task-oriented policy decisions. We present HetGPS, a hybrid graph-control framework synergizing learned graph risk with physics-anchored correction by separating intervention magnitude from corrective direction. An action-conditioned graph residual model schedules state-dependent intervention authority, while a physics model determines its direction. For electric vehicle (EV) charging, we couple this filter with a parameter-shared heterogeneous graph soft actor-critic policy, enabling topology-aware coordination with a learned model size independent of fleet size. Across five nested distribution networks with 200--3,218 EVs and 100 evaluation days, Adaptive Authority reduces bus--step voltage violations from 3.93--7.74\% without filtering to 0.52--3.44\%, while maintaining 99.06--100\% departure success. Relative to the same physics-directed projection with fixed authority, it improves mean reward on all five networks and lowers the mean safety score on four. The deployed policy-and-risk model contains 383,702 learned parameters at every scale; at 3,218 EVs, a matched centralized SAC actor is about $170\times$ larger. A policy trained on the eight-transformer system transfers zero-shot to the 16- and 32-transformer systems, attaining 0.57--0.75\% violation rates and at least 99.99\% departure success. These results show that learned graph risk can allocate intervention authority at scale while feeder physics anchors corrective action.
- Abstract(参考訳): ネットワーク結合エージェントの大多数に対する安全介入は、タスク指向の政策決定を必要以上にオーバーライドすることなく、共有制約を保護する必要がある。
本稿では,学習グラフリスクと物理アンコール補正を相乗化するハイブリッドグラフ制御フレームワークHetGPSについて述べる。
動作条件グラフ残差モデルは状態依存の介入権限をスケジュールし、物理モデルはその方向を決定する。
電気自動車(EV)の充電において,このフィルタをパラメータ共有型不均一グラフソフトアクター批判ポリシーと組み合わせることで,トポロジと学習モデルサイズをフリートサイズに依存しない調整を可能にする。
アダプティブ・オーソリティ(Adaptive Authority)は、200~3,218台のEVと100日間のネストされた配電ネットワーク5つにまたがって、バスステップ電圧違反を3.93~7.74\%から0.52~3.44\%に削減し、99.06~100\%の出発成功を維持した。
物理指向の投射と一定の権限を持つのとは対照的に、5つのネットワークの平均的な報酬を改善し、4つのネットワークの平均安全性スコアを下げる。
デプロイされたポリシーとリスクモデルには、すべてのスケールで383,702の学習パラメータが含まれている。
8変圧器システムで訓練されたポリシーは、ゼロショットを16変圧器システムと32変圧器システムに転送し、0.57--0.75\%の違反率と99.99\%の離脱に成功した。
これらの結果から,学習したグラフリスクは介入権限を大規模に割り当てることが可能であり,フィードバック物理は補正作用を定着させることがわかった。
関連論文リスト
- Compact Visuotactile World Models for Lifting: Prediction, Reward Alignment, and Force Constraints [0.0]
Visuotactile dynamicsは力の作用効果のMAEを0.413Nから0.338Nに減少させる。
モデル支援フィードバックは、ID予算による成功を73.3%から93.3%に引き上げる。
RLは11.9%、リアクティブIQLは25.0%で成功している。
論文 参考訳(メタデータ) (2026-09-09T01:50:54Z) - Modality-Decoupled Federated Learning for Privacy-Preserving Embodied Intelligence in 6G [90.42669277637026]
第6世代(6G)無線ネットワークは、大規模なインボディードインテリジェンスのための重要な基盤を提供すると期待されている。
本稿では、6Gネットワークにおけるプライバシー保護型インテリジェンスのためのモダリティ分離FLフレームワークであるFedMVLAを提案する。
論文 参考訳(メタデータ) (2026-09-09T01:36:44Z) - EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - Robust and Personalized Federated Learning for Aircraft-Engine Prognostics under Benign and Adversarial Client Heterogeneity [0.4776836972093627]
FL(Federated Learning)は、航空機の運用者が生データを共有せずに、エンジンセンサーテレメトリから残留寿命(RUL)モデルを共同訓練することを可能にする。
本研究では, 正直な操作者が異なる操作条件や障害モードを観察する良性不均一性と, 妥協した操作者が有毒な更新を提出する敵対的不均一性という2つの相補的課題について検討した。
エンジンの劣化を隠蔽する物理的に動機付けられたセンサ値バックドアを含む,4つのアグリゲーション手法に対する5つの攻撃を評価した。
論文 参考訳(メタデータ) (2026-08-04T06:54:29Z) - Self-Adaptive Anomaly Detection with Reinforcement Learning and Human Feedback in Connected Vehicles [0.3324986723090369]
本稿では,自律型CPSのためのオンライン異常検出フレームワークを提案する。
自己注意を伴う分解された深いQネットワークは、監視対象サービス毎に候補プールから最も適切な検出器を選択する。
保留中のトランジションバッファと60/40の優先順位付けされたリプレイ戦略を中心に構築されたHuman-in-the-loopリトレーニング機構により、オペレーターは専門家の知識を組み込むことができる。
論文 参考訳(メタデータ) (2026-07-09T11:48:52Z) - Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study [48.83701310501069]
本稿では, 一つのレシピがヘテロジニアスなアーキテクチャプールに十分であるか, 最適ペアリングが構造的に多様なモデルによって異なるかを検討する。
我々は,CEL(Cross-Entropy),NLL(Negative Log-Likelihood),および最近導入された遺伝学的に進化したNGL損失を,LEMURヘテロジニアス・アーキテクチャー・プールの6つの画像分類データセット上に提示したベースモデル間で比較検討した。
我々の結果は、単一のペアリングが普遍的に最適でないことを確認した。AdamやAdamWとのクロスエントロピーは、最も堅牢な選択である。
論文 参考訳(メタデータ) (2026-06-18T20:51:42Z) - NOVA: Symbolic Regression Discovery of Interpretable Car-Following and Lane-Change Models with Driver Heterogeneity [1.889930012459364]
NOVAは自動車追尾および車線変更構造のための自律的な象徴的回帰フレームワークである。
NGSIM I-80とUS-101データセットからの4,765,788のアクティブな運転観察に適用される。
NOVAは502人のドライバーに対して厳格な車両IDホールドアウトの下で67.4%のバランスの取れた精度を達成した。
論文 参考訳(メタデータ) (2026-06-09T08:47:39Z) - Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models [0.0]
グループ相対政策最適化は、推論タスク上で言語モデルを整合させる効果的な強化学習アルゴリズムとして登場した。
本稿では,Adaptive-Horizon GRPOとSelective-Advantage AH-GRPOの2つの補完拡張を導入する。
解析の結果、非対称割引は正しい解の完全な勾配信号を保持し、エントロピー崩壊を防止し、トレーニングを著しく安定化させることがわかった。
論文 参考訳(メタデータ) (2026-06-03T20:57:57Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Autonomous Vehicle Collision Avoidance With Racing Parameterized Deep Reinforcement Learning [73.88859384645264]
道路交通事故は世界中の交通事故の主な原因である。
米国では、人間のエラーが94%のクラッシュを引き起こし、7000人以上の歩行者が死亡し、年間500億ドルのコストがかかる。
本稿では,Dreep Reinforcement Learning (DRL) 衝突回避政策のアウト・オブ・ディストリビューションをパラメータ化する。
2つのポリシーが評価され、デフォルトのユニディレクションと、他の車と反対方向にナビゲートする逆方向のバリエーションが評価される。
論文 参考訳(メタデータ) (2026-04-17T21:11:39Z) - Adaptive Regime-Aware Stock Price Prediction Using Autoencoder-Gated Dual Node Transformers with Reinforcement Learning Control [1.2362187555287152]
既存のアプローチは全ての市場状態を均一に扱うか、または手動のレギュレーションラベリングを必要とする。
本稿では,通常の市場条件から逸脱を適応的に識別し,特定の予測経路を通じてデータをルーティングする適応予測フレームワークを提案する。
1982年から2025年にかけてのS&P500株20株の実験では、このフレームワークは1日間の予測では0.68%のMAPE、完全な適応システムでは0.59%のMAPEを達成した。
論文 参考訳(メタデータ) (2026-03-19T16:55:33Z) - ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving [63.980630608984605]
本稿では、ゼロサムマルコフゲームとして、駆動ポリシー(ディフェンダー)と敵エージェント(アタックラー)の相互作用を扱うクローズドループのmin-max最適化フレームワークであるADV-0を提案する。
これを実現するため,我々は動的敵の進化を反復的な選好学習とし,この最適性を効率的に近似し,アルゴリズムに依存しない解をゲームに提供する。
実験により、多様な安全クリティカルな障害を効果的に露呈し、学習方針と運動プランナーの両方の一般化可能性を大幅に向上させることが示されている。
論文 参考訳(メタデータ) (2026-03-16T12:58:31Z) - Parameter-Efficient Domain Adaptation of Physics-Informed Self-Attention based GNNs for AC Power Flow Prediction [7.672324146121681]
物理制約付き逆推定のための電圧-レジムシフト下での制御可能な効率-精度トレードオフについて検討する。
複数のグリッドトポロジにまたがって提案されたLoRA+PHead適応は、ターゲットドメインのRMSEギャップを2.6times10-4$とすることで、ほぼ完全な微調整精度を回復し、トレーニング可能なパラメータの数を85.46%削減した。
論文 参考訳(メタデータ) (2026-02-20T14:07:51Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。