論文の概要: Grounding Large Language Models in DSGE Simulators for Policy Generation and Forecasting
- arxiv url: http://arxiv.org/abs/2610.01128v1
- Date: Thu, 01 Oct 2026 06:11:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.927877
- Title: Grounding Large Language Models in DSGE Simulators for Policy Generation and Forecasting
- Title(参考訳): 政策生成と予測のためのDSGEシミュレータにおける大規模言語モデルの構築
- Abstract要約: 大規模言語モデルは合理的に聞こえる経済政策の反応を生み出すことができるが、これは彼らの行動が経済力学と一致していることを示すものではない。
本研究では,6つのSnowdrop-backed dynamic general equilibrium (DSGE)シミュレータ内に命令調整言語モデルを配置することによってこれを検証する。
我々は、繰り返しロールアウト、永続的なショック、状態クローニング、ローリング・ホライゾン・シミュレーションのための共通のPythonインターフェースを実装している。
- 参考スコア(独自算出の注目度): 0.8156494881838946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models can produce economic policy responses that sound reasonable, but this does not show that their actions are consistent with economic dynamics. We test this by placing an instruction-tuned language model inside six Snowdrop-backed dynamic stochastic general equilibrium (DSGE) simulators. At each turn, the model observes the economy and a change in economic discourse, selects a bounded policy action, and receives the next simulated state and an economic reward. We implement a common Python interface for repeated rollouts, persistent shocks, state cloning, and rolling-horizon simulation. This setting creates a long-horizon credit-assignment problem. Policy effects may appear several quarters after an action is taken. PPO has a learned value function that can propagate delayed reward to earlier tokens through generalized advantage estimation. GRPO has no learned value function and instead assigns a group-relative advantage from complete rollout returns. It therefore cannot distinguish which earlier turn caused the outcome; if every rollout receives the same return, the normalized advantage is zero. We use PPO as the primary method and GRPO as a matched critic-free baseline. The experiments also test directional semantic signals, reward horizon, trajectory warm starts, cross-simulator transfer, and historically anchored pandemic and monetary-policy shocks. The objective is to judge policy actions by their simulated economic consequences rather than by plausible language alone.
- Abstract(参考訳): 大規模言語モデルは合理的に聞こえる経済政策の反応を生み出すことができるが、これは彼らの行動が経済力学と一致していることを示すものではない。
本研究では,6つのSnowdrop-backed dynamic stochastic General equilibrium (DSGE)シミュレータ内に命令調整言語モデルを配置することによって,これを検証する。
各ターンで、モデルは経済と経済談話の変化を観察し、限定された政策行動を選択し、次のシミュレートされた状態と経済報酬を受け取る。
我々は、繰り返しロールアウト、永続的なショック、状態クローニング、ローリング・ホライゾン・シミュレーションのための共通のPythonインターフェースを実装している。
この設定は、長期のクレジット割り当ての問題を引き起こす。
政策効果は、行動が実行された後、数四半期にわたって現れる可能性がある。
PPOは学習値関数を持ち、一般化された優位推定によって遅延報酬を以前のトークンに伝達することができる。
GRPOは学習された値関数を持たず、代わりに完全なロールアウトリターンからグループ相対的なアドバンテージを割り当てる。
したがって、どのターンが結果を引き起こしたかは区別できない。すべてのロールアウトが同じリターンを受信した場合、正規化された利点はゼロである。
我々はPPOを第一の手法とし、GRPOを一致した批判のないベースラインとする。
実験はまた、方向性のセマンティックシグナル、報奨地平線、軌跡のウォームスタート、クロスシミュレーター転送、歴史的にパンデミックと金融政策のショックをテストする。
目的は、実証可能な言語だけでではなく、シミュレートされた経済的な結果によって政策行動を判断することである。
関連論文リスト
- Token-World: World Modeling in Vision-Language Model Token Space for Robot Manipulation [66.07387385688453]
Token-Worldは、VLM機能をコンパクトなトークン状態に圧縮するアクション条件の世界モデルである。
この縮小された空間で将来の力学を学習し、予測された状態が元の方針に向いた表現に戻る。
論文 参考訳(メタデータ) (2026-09-30T18:45:32Z) - Free Everywhere, Exact on Trees: PPO's Dropped Correction Buys Sample Efficiency Under Aggressive Reuse [0.0]
本研究では,各状態が正確に1つの履歴に到達した履歴インジェクティブ・ダイナミクスの下では,各状態ビジュアライゼーション比がサンプルプレフィックスに沿ったステップごとのポリシー比の積と等しいことを示す。
クリッピングが既に再利用バイアスを含んでいる場合、全会一致で行われる修正は、有害である。
論文 参考訳(メタデータ) (2026-09-30T12:41:43Z) - Large Discrete Policy: Advancing Explicit Behavior Modeling with Stochastic Iterative Scoring [77.17706435067372]
大規模ポリシー(LDiP)は、物理的に妥当な候補の大きな語彙から行動を選択する、完全に独立した行動モデリングフレームワークである。
摂動作用ではなく、LDiPは反復的なスコアリングによって表現性を向上する。
エンド・ツー・エンドの計画、クローズドループ・ドライブ、ロボット操作、ビジョン・ランゲージ・アクション・セッティングを通じて、LDiPは強い離散的かつ連続的なベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-09-07T05:12:52Z) - Robust Control under Stationary Ambiguity [5.394466899760558]
シミュレーションに最適化された制御ポリシーは、シミュレータのパラメータが限られたデータから推定される場合、実システムではうまく機能しない。
システムの状態によってあいまいさが変化するが、時間とともに体系的に減衰しないシミュレータにおけるトレーニングポリシーを提案する。
このようなシミュレータの構築方法を示し,定常的あいまいさの下で訓練された政策が時間とともに潜伏要因に対する堅牢性を維持することを示す。
論文 参考訳(メタデータ) (2026-08-05T13:34:00Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States [14.658333957936769]
内部状態価値推定による政策最適化を導入する。
ポリシーフォワードパス中に既に計算されているポリシーモデルの内部信号を用いて、無視可能なコストでベースラインを得る。
軽量プローブは、プロンプトおよび生成された軌道の隠れ状態から期待される検証可能な報酬を予測する。
論文 参考訳(メタデータ) (2026-05-08T10:49:36Z) - $V_0$: A Generalist Value Model for Any Policy at State Zero [80.7505802128501]
ポリシーメソッドは、アクションの相対的な利点を測定するためにベースラインに依存します。
このベースラインは一般的に、政策モデルそのものと同じくらい大きな価値モデル(Critic)によって推定される。
未知のプロンプト上での任意のモデルの期待性能を推定できるジェネリスト値モデルを提案する。
論文 参考訳(メタデータ) (2026-02-03T14:35:23Z) - See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection [51.59559387222532]
エンドツーエンド自動運転の最近の進歩は、パッチアライメント機能で訓練されたポリシーが、アウト・オブ・ディストリビューション(OOD)よりも一般化していることを示している。
我々は、より堅牢で、一般化可能で、効率的な学習ポリシーのためのシンプルで効果的なアプローチである2.4-Patch-Selection(SPS)を提案する。
論文 参考訳(メタデータ) (2026-01-15T18:58:33Z) - Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning [55.15106182268834]
検証可能な報奨付き強化学習(RLVR)が,大規模言語モデルにおける推論能力向上のための主要なアプローチとして登場した。
ロールアウト生成は恥ずかしく並列であり、メモリライトであるのに対して、ポリシー更新は通信量が多く、メモリ集約的である。
PODS(Policy Optimization with Down-Sampling)を導入し、戦略的に選択されたロールアウトサブセットでのみトレーニングすることで、ポリシー更新からロールアウト生成を分離する。
論文 参考訳(メタデータ) (2025-04-18T17:49:55Z) - Sales Channel Optimization via Simulations Based on Observational Data
with Delayed Rewards: A Case Study at LinkedIn [4.6405223560607105]
ランダム化実験から得られたデータに関するトレーニングモデルは、良い決定を下すのに最適である。
しかし、ランダム化実験は、しばしば時間を要する、コストがかかる、リスクが高い、実現不可能、または非倫理的である。
問題の特徴を扱える離散時間シミュレーションを構築し、異なるポリシーを評価するために使用します。
シミュレーションの結果,シンプルなMABポリシであるLinUCBは,他のポリシよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2022-09-16T07:08:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。