論文の概要: Transfer Learning Across Policy Regimes in Adaptive Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.09685v1
- Date: Mon, 15 Jun 2026 10:16:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.365925
- Title: Transfer Learning Across Policy Regimes in Adaptive Multi-Agent Systems
- Title(参考訳): 適応型マルチエージェントシステムにおける政策レジーム間の伝達学習
- Abstract要約: 政策モデルはしばしば、政策指標と結果の関係が制度的に安定していると仮定する。
本稿では,適応型マルチエージェントシステムにおける伝達学習問題としての状態変化について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Policy models often assume that the relationship between a policy instrument and its outcome remains stable across institutional conditions. In adaptive socio-technical systems this assumption may fail: regulatory change can alter incentives, agents can respond strategically, and the mapping from policy variables to aggregate outcomes can change. This paper studies such regime change as a transfer-learning problem in adaptive multi-agent systems. A policy regime is represented as a learning problem induced by an observable input distribution and a target function mapping policy variables to outcomes. We compare a blank-slate learner that searches a flexible hypothesis class in the new regime with a transfer learner whose effective hypothesis class is restricted by structural knowledge from the previous regime. Transfer is beneficial when this restriction preserves the new target function while reducing effective complexity; it is harmful when the restriction excludes the new target and creates misspecification. A stylized emissions-regulation experimental environment and a dynamic ABM robustness experiment support the claim. When the target regime preserves an affine monotone tax-emissions relation, transfer improves empirical small-sample performance. When the target regime introduces a threshold break, the same transferred structure produces negative transfer: held-out error remains high, online prediction generates more mistakes, and repeated online streams show larger cumulative and final-window error under misspecification. The contribution is methodological: previous regulatory experience should be reused when it captures stable structural invariants, but treated cautiously when policy change alters the policy-outcome relationship.
- Abstract(参考訳): 政策モデルはしばしば、政策指標と結果の関係が制度的に安定していると仮定する。
規制の変更はインセンティブを変え、エージェントは戦略的に反応し、政策変数から集合結果へのマッピングは変更できる。
本稿では,適応型マルチエージェントシステムにおける伝達学習問題としての状態変化について検討する。
ポリシー体制は、観測可能な入力分布と目標関数のポリシー変数と結果との対応によって誘導される学習問題として表現される。
我々は,新体制におけるフレキシブルな仮説クラスを探索する空白学習者と,前体制からの構造的知識によって効果的な仮説クラスが制限される伝達学習者との比較を行った。
この制限が新しいターゲット機能を保ちながら、効果的な複雑さを減らし、新しいターゲットを除外し、誤特定を発生させる場合、転送は有益である。
スタイリングされた排出規制実験環境と動的ABMロバスト性実験は、この主張を支持している。
ターゲットレジームがアフィンモノトン税-排出関係を保存すると、転送は経験的な小サンプルのパフォーマンスを向上させる。
オンラインの予測は、より多くの誤りを発生させ、繰り返しオンラインのストリームは、誤特定の下で、より大きい累積誤差と最終ウィンドウエラーを示す。
これまでの規制経験は、安定した構造的不変性を捉えた時に再利用されるべきであるが、政策変更が政策と成果の関係を変化させたときは慎重に扱われるべきである。
関連論文リスト
- Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation [3.3656696418661975]
残留強化学習は、その動作に付加的な補正を学習することにより、事前訓練されたロボットポリシーに適応する。
基底分布が幾何的に変化した系と一致していない場合、残差補正は未適応のポリシーでさえも過小評価可能であることを示す。
基本方針の行動分布の可逆的状態条件変換を付加残差に置き換える政策適応手法であるWarp RLを提案する。
論文 参考訳(メタデータ) (2026-06-30T02:25:51Z) - Structural Distinguishability of Static and Adaptive Policy Regimes in Agent-Based Regulatory Simulation [0.0]
本稿では,新しい汎用フレームワークではなく,制御されたシミュレーションベンチマークに寄与する。
本研究は, ナイーブな固定ポリシー, トラッキング対応の固定ポリシ, および, セットポイント, 安全マージン, 片側制御の3つの適応コントローラを評価する。
このコントリビューションは、スカラーインジケータ、キャップ相対的なシンボル診断、軌跡モチーフ、視覚検査によって、平均的な結果が類似しているように見える場合でも、どのように規制の結論が異なるかを共同で明らかにする。
論文 参考訳(メタデータ) (2026-06-15T10:06:32Z) - PolicyBank: Evolving Policy Understanding for LLM Agents [51.86716874651299]
PolicyBankは構造化されたツールレベルの政策洞察を維持し、それらを反復的に洗練する。
PolicyBankは、人間の神託に対するギャップの最大82%を閉じている。
論文 参考訳(メタデータ) (2026-04-16T20:29:30Z) - Authority-Level Priors: An Under-Specified Constraint in Hierarchical Predictive Processing [0.0]
オーソリティ・レベル優先(英: Authority-Level Priors、ALP)は、アイデンティティレベルの仮説の規制が許容できるサブセットを定義するメタ構造制約である。
ALPは、追加の表現状態や精度よりも高優先度であり、規制制御に許容される仮説を制約している。
計算形式化は、認可された仮説によって生成されるポリシーに対するポリシー最適化を制限する。
論文 参考訳(メタデータ) (2026-03-19T13:27:47Z) - Decentralized Learning Strategies for Estimation Error Minimization with Graph Neural Networks [86.99017195607077]
統計的に同一性を持つ無線ネットワークにおける自己回帰的マルコフ過程のサンプリングとリモート推定の課題に対処する。
我々のゴールは、分散化されたスケーラブルサンプリングおよび送信ポリシーを用いて、時間平均推定誤差と/または情報の年齢を最小化することである。
論文 参考訳(メタデータ) (2024-04-04T06:24:11Z) - Conformal Policy Learning for Sensorimotor Control Under Distribution
Shifts [61.929388479847525]
本稿では,センサコントローラの観測値の分布変化を検知・応答する問題に焦点をあてる。
鍵となる考え方は、整合量子を入力として取ることができるスイッチングポリシーの設計である。
本稿では, 基本方針を異なる特性で切り替えるために, 共形量子関数を用いてこのようなポリシーを設計する方法を示す。
論文 参考訳(メタデータ) (2023-11-02T17:59:30Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z) - Policy Dispersion in Non-Markovian Environment [53.05904889617441]
本稿では,非マルコフ環境下での国家行動ペアの歴史から,多様な政策の学習を試みる。
まず、ポリシー埋め込みを学習するために、トランスフォーマーベースの手法を採用する。
次に,政策埋め込みを積み重ねて分散行列を構築し,多様な政策の集合を誘導する。
論文 参考訳(メタデータ) (2023-02-28T11:58:39Z) - Dealing with Non-Stationarity in Multi-Agent Reinforcement Learning via
Trust Region Decomposition [52.06086375833474]
非定常性は多エージェント強化学習における厄介な問題である。
ポリシーシーケンスの定常性を明示的にモデル化するための$delta$-stationarity測定を導入する。
共同政策の分岐を推定するために,メッセージパッシングに基づく信頼領域分解ネットワークを提案する。
論文 参考訳(メタデータ) (2021-02-21T14:46:50Z) - Complementary Meta-Reinforcement Learning for Fault-Adaptive Control [1.8799681615947088]
適応的フォールトトレラント制御は、安全でない条件や破滅的な事象に対して障害が発生すると、性能が低下する。
本稿では,その制御方針を変化する条件に迅速に適応するメタ強化学習手法を提案する。
急激な断層下での航空機の燃料輸送システムに対する我々のアプローチを評価する。
論文 参考訳(メタデータ) (2020-09-26T16:30:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。