論文の概要: LLM-Assisted Behavioural and Scenario Augmentation for Agent-Based Energy Adoption Models
- arxiv url: http://arxiv.org/abs/2609.04866v1
- Date: Fri, 04 Sep 2026 08:26:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.974143
- Title: LLM-Assisted Behavioural and Scenario Augmentation for Agent-Based Energy Adoption Models
- Title(参考訳): エージェント型エネルギー導入モデルのためのLCM支援行動・シナリオ拡張
- Abstract要約: 本稿では,LLM支援仕様設計のためのハイブリッドフレームワークを提案する。
振る舞いのルーブリックと構造化シナリオ仕様をキャリブレーションされたエージェントベースモデルに統合する。
その結果, LLM 支援仕様は, 調整済みエネルギー ABM に, 制御, 再現可能, 政策関連方式で組み込むことができることがわかった。
- 参考スコア(独自算出の注目度): 1.1899559337707113
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in large language models (LLMs) create opportunities to enrich simulation-based energy policy analysis, particularly by supporting structured behavioural assumptions and exploratory techno-economic scenarios. However, directly replacing adoption models with LLM reasoning raises concerns regarding interpretability, reproducibility, and behavioural validity. This paper proposes a hybrid framework for LLM-assisted specification design, integrating bounded behavioural rubrics and structured scenario specifications into a calibrated agent-based model (ABM) of solar photovoltaic (PV) adoption by Irish dairy farms. The proposed approach preserves the original techno-economic adoption mechanism while augmenting it with bounded behavioural modulation and scenario-driven uncertainty analysis. Behavioural effects are represented through interpretable conservative, balanced, and optimistic rubrics, while future policy and market conditions are explored through fixed, rule-validated scenario specifications. Experimental results across multiple policy settings, Monte Carlo worlds, and random seeds demonstrate stable and economically plausible behaviour, with adoption outcomes remaining bounded and monotonic across behavioural regimes. The framework achieves up to approximately 13% behavioural adoption increase relative to the corresponding logistic case without producing unstable or unrealistic saturation dynamics. The results demonstrate that LLM-assisted specifications can be integrated into calibrated energy ABMs in a controlled, reproducible, and policy-relevant manner.
- Abstract(参考訳): 大規模言語モデル(LLM)の最近の進歩は、特に構造的行動仮定と探索的テクノ・エコノミクスシナリオをサポートすることにより、シミュレーションに基づくエネルギー政策分析を充実させる機会を生み出している。
しかし、導入モデルを直接LLM推論に置き換えることで、解釈可能性、再現性、行動妥当性に関する懸念が高まる。
本稿では,アイルランドの乳園農家による太陽太陽光発電(PV)導入のキャリブレーションされたエージェントベースモデル(ABM)に,有界な行動ルーブリックと構造化シナリオ仕様を統合したLCM支援仕様設計のためのハイブリッドフレームワークを提案する。
提案手法は,制約付き行動変調とシナリオ駆動型不確実性解析で拡張しながら,従来の技術・経済的な導入メカニズムを保っている。
行動効果は、解釈可能な保守的でバランスのとれた楽観的なルーリックを通して表現される一方、将来の政策と市場条件は、固定されたルール検証されたシナリオ仕様によって探索される。
複数の政策設定、モンテカルロの世界、ランダムな種は、安定的で経済的に妥当な振る舞いを示し、採用結果は、行動体制全体にわたって有界かつ単調なままである。
このフレームワークは、不安定または非現実的な飽和ダイナミクスを発生させることなく、対応するロジスティックケースと比較して、最大で13%の行動導入の増加を達成する。
その結果, LLM 支援仕様は, 調整済みエネルギー ABM に, 制御, 再現可能, 政策関連方式で組み込むことが可能であることが示唆された。
関連論文リスト
- On the Identifiability of Controlled World Models [34.31084112465058]
本稿では,ガウス潜在状態を持つ制御された世界モデルに対する合同識別可能性条件を提案する。
この条件が成立すると、LeJEPAスタイルの予測目標の最小化が潜伏状態と制御力学の両方を回復できることを示す。
また、最も弱い条件-励起マージンで逆スケールする反事実予測誤差の達成可能な増幅を特徴付ける。
論文 参考訳(メタデータ) (2026-07-24T15:49:12Z) - LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning [90.86828952599147]
提案するLaST-R1(LaST-R1)は,「最近の推論・行動」政策を活用するために設計された,新しい強化学習フレームワークである。
LaST-R1 は LIBERO ベンチマークで 99.9% の平均成功率を達成した。
実世界の展開では、LaST-R1はSOTAが監督する微調整アプローチよりも22.5%平均的に改善されている。
論文 参考訳(メタデータ) (2026-04-30T17:59:52Z) - Gaussian Joint Embeddings For Self-Supervised Representation Learning [0.0]
自己パラメトリック表現学習は、しばしば決定論的予測アーキテクチャに頼り、潜在空間におけるコンテキストとターゲットビューを整列させる。
生成的関節モデルに基づく確率的代替案を提案する。
論文 参考訳(メタデータ) (2026-03-26T00:54:54Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - LLM-Generated Counterfactual Stress Scenarios for Portfolio Risk Simulation via Hybrid Prompt-RAG Pipeline [0.0]
マクロ財務ストレステストのための透明で完全に監査可能なLCMベースのパイプラインを開発した。
このシステムは、GDPの成長、インフレ、政策金利をカバーするG7のための機械可読マクロ経済シナリオを生成する。
モデル、国、検索設定を越えて、LLMはコヒーレントで国固有のストレス物語を生成する。
論文 参考訳(メタデータ) (2025-11-26T19:29:22Z) - Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models [7.316631310935769]
VLA(Vision-Language-Action)モデルは、大規模なデモンストレーションを活用することで、強力な一般化を示している。
本研究では,FPOアルゴリズムを提案する。FPOアルゴリズムは,条件付きフローマッチングの目的に対して,サンプルごとの変化を生かして,重要サンプリングを再構築する。
LIBEROベンチマークのFPOとALOHAシミュレーションタスクを、教師付き、嗜好的、拡散的、自己回帰的オンラインRLに対して評価する。
論文 参考訳(メタデータ) (2025-10-11T03:11:18Z) - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning [77.92320830700797]
強化学習は、大規模言語モデルの推論機能を実現する上で中心的な役割を果たしてきた。
本稿では,ポリシー更新時の曲率情報を追跡し,活用するトラクタブルな計算フレームワークを提案する。
アルゴリズムであるCurvature-Aware Policy Optimization (CAPO)は、不安定な更新に寄与するサンプルを特定し、それらをマスクアウトする。
論文 参考訳(メタデータ) (2025-10-01T12:29:32Z) - CTRLS: Chain-of-Thought Reasoning via Latent State-Transition [57.51370433303236]
チェーン・オブ・シント(CoT)推論は、大規模な言語モデルで複雑な問題を解釈可能な中間ステップに分解することを可能にする。
我々は,遅延状態遷移を伴うマルコフ決定プロセス(MDP)としてCoT推論を定式化するフレームワークであるgroundingSを紹介する。
我々は、ベンチマーク推論タスクにおける推論精度、多様性、探索効率の改善を示す。
論文 参考訳(メタデータ) (2025-07-10T21:32:18Z) - Hallucinated Adversarial Control for Conservative Offline Policy
Evaluation [64.94009515033984]
本研究では,環境相互作用のオフラインデータセットが与えられた場合,政策のパフォーマンスを低く抑えることを目的とした,保守的非政治評価(COPE)の課題について検討する。
本稿では,遷移力学の不確実性を考慮した学習モデルに基づくHAMBOを紹介する。
結果のCOPE推定値が妥当な下界であることを証明し、正則性条件下では、真に期待された戻り値への収束を示す。
論文 参考訳(メタデータ) (2023-03-02T08:57:35Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Model-Based Offline Reinforcement Learning with Pessimism-Modulated
Dynamics Belief [3.0036519884678894]
モデルベースオフライン強化学習(RL)は、以前に収集した静的データセットと動的モデルを活用することで、高い報奨ポリシーを見つけることを目的としている。
本研究は, 力学上の信念分布を維持し, バイアスサンプリングによる政策評価・最適化を行う。
偏りのあるサンプリングは、Pessimism-Modulated Dynamics Beliefと呼ばれる、ポリシー依存の再重み付けによる更新された動的信念を自然に引き起こすことを示す。
論文 参考訳(メタデータ) (2022-10-13T03:14:36Z) - DROMO: Distributionally Robust Offline Model-based Policy Optimization [0.0]
モデルベース制御によるオフライン強化学習の問題点を考察する。
分散ロバストなオフラインモデルベースポリシー最適化(DROMO)を提案する。
論文 参考訳(メタデータ) (2021-09-15T13:25:14Z) - Autoregressive Dynamics Models for Offline Policy Evaluation and
Optimization [60.73540999409032]
表現的自己回帰ダイナミクスモデルが次の状態の異なる次元を生成し、以前の次元で順次条件付きで報酬を得ることを示す。
また,リプレイバッファを充実させる手段として,自己回帰的ダイナミクスモデルがオフラインポリシー最適化に有用であることを示す。
論文 参考訳(メタデータ) (2021-04-28T16:48:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。