論文の概要: Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers
- arxiv url: http://arxiv.org/abs/2609.05189v2
- Date: Mon, 07 Sep 2026 08:25:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:42.045641
- Title: Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers
- Title(参考訳): 大規模言語モデルは社会政策に対する行動応答を予測できるか? : 中国のフレキシブル労働者の年金受入予測を事例として
- Abstract要約: 中国におけるフレキシブルワーカー間での階層的年金参加予測タスクのためのドメイン特化大型言語モデルFlexPension-LLMを提案する。
DKI-RDistillは,プロビット由来の辺縁効果やフルクープロンス年金規則など,政策的な手がかりをインジェクターに注入する。
この方法はLoRA/SFTを使って、理性に富んだ指導をオープンウェイトなMoE学生に蒸留し、これらのケースを再生することで教師のエラーを修正する。
- 参考スコア(独自算出の注目度): 7.812925339338843
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Assessing the impacts of social policy changes is a widely acknowledged challenge for policymakers. Econometric methods can be unreliable when extrapolating to hypothetical scenarios, while field pilot programs are highly costly. In this paper, we propose using large language models (LLMs) as policy-assessment tools adapted from general-purpose models. We present FlexPension-LLM, the first domain-specialized large language model for a hierarchical pension-enrollment prediction task among flexible workers in China, and introduce DKI-RDistill, which injects policy-grounded cues into the prompt, including Probit-derived marginal effects and hukou-province pension rules. The method then uses LoRA/SFT to distill rationale-augmented supervision into an open-weight MoE student, with teacher errors corrected by regenerating those cases under ground-truth labels. On a CHFS 2019 blind split, FlexPension-LLM achieves 0.9316 Composite F1, surpassing its Claude Sonnet 4.5 teacher and 15 of 17 baselines, and is statistically indistinguishable from Claude Opus 4.6. Across four external surveys, it averages 0.7549 Composite F1 and shows the narrowest performance range among the strongest systems. Component analysis shows that gains come mainly from policy-grounded cue injection and error-filtered supervision, while rationales provide decision traces that can be checked against policy rules.
- Abstract(参考訳): 社会政策の変化の影響を評価することは、政策立案者にとって広く認められた課題である。
エコノメトリ法は仮説的なシナリオを外挿する場合は信頼性が低いが、フィールドパイロットプログラムは非常に高価である。
本稿では,大規模言語モデル(LLM)を汎用モデルに適応したポリシー評価ツールとして用いることを提案する。
本稿では,中国におけるフレキシブルワーカー間の階層的年金参加予測タスクのための最初のドメイン特化大型言語モデルであるFlexPension-LLMについて紹介する。
この方法はLoRA/SFTを使って、理性に富んだ指導をオープンウェイトなMoEの学生に蒸留し、それらのケースを地味ラベルで再生することで教師の誤りを訂正する。
CHFS 2019では、FlexPension-LLMは0.9316の複合F1を達成し、Claude Sonnet 4.5の教師と17のベースラインの15を上回り、Claude Opus 4.6と統計的に区別できない。
4回の外部調査で平均0.7549複合F1であり、最強のシステムの中では最も狭い性能範囲を示している。
コンポーネント分析によると、ゲインは主にポリシーに基づくキューインジェクションとエラーフィルタリングによる監視によるもので、合理性はポリシールールに対してチェック可能な決定トレースを提供する。
関連論文リスト
- FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving [1.4298580363875282]
グループ相対ポリシー最適化は、各ロールアウトグループ内の報酬差から学習する。
Fire-VLAは、未解決の失敗を次のポリシーの特権的な監督に変換する。
150の保持されたnuScenesシーンの6,019の例では、FIRE-VLAは同等の単一サンプルプランニングを維持している。
論文 参考訳(メタデータ) (2026-08-13T15:53:24Z) - Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning [58.088509347353465]
強化学習(Reinforcement Learning, RL)は、言語モデルトレーニングにおいて広く使われている。
我々は,このトレードオフに明確な統計的解釈を与えるゲーム理論の枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-29T00:19:09Z) - Ontology-Amplified Distillation and Contextuality Auditing for Sovereign Enterprise Language Models: A Combined Proof-of-Mechanism and Negative-Results Method Study [0.0]
本稿では2つの関連するFAOS研究を1つのメカニズムと制御項目にまとめる。
まず, オントロジー増幅蒸留の低消費電力実験を報告する。
第2に,エンタープライズエージェントルーティングのためのコンテキスト性監査手法を統合する。
論文 参考訳(メタデータ) (2026-07-11T15:42:40Z) - Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients [89.89504265663057]
近親政策最適化ゾーン(ZPPO)は、ヴィゴツキーの近親開発ゾーンに触発されたものである。
ZPPOは1つの正しい教師の反応と1つの間違った学生の反応を、生徒が識別しなければならない匿名候補としてペアリングする。
プロンプト再生バッファは、生徒の平均ロールアウト精度が半分に達するか、FIFOが削除されるまで、各難問を再循環する。
論文 参考訳(メタデータ) (2026-06-16T17:46:02Z) - MANTA: Multi-turn Assessment for Nonhuman Thinking & Alignment [0.1452394725421793]
MANTAは、Inspect AIプラットフォーム上に構築された動的マルチターン評価フレームワークである。
Clude-sonnet-4-20250514およびopenai/gpt-4oの評価を行った。
また, LLM-as-judge 評価において, 体系的フォーマットバイアスを示す制御された4要素法であるSTYLEJUDGEを提案する。
論文 参考訳(メタデータ) (2026-04-18T19:51:32Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only [70.43369087819332]
Supervised Fine-tuning (SFT) は、大規模な言語モデルと人間のアノテーションによる実演を整合させる重要な方法として登場した。
本稿では, 自己回帰型PPOを提案する。
論文 参考訳(メタデータ) (2025-10-24T02:02:13Z) - Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning [33.899779762210976]
大規模言語モデルの教師付き微調整(SFT)は、非政治的な学習問題と見なすことができる。
既存の方法では、ギャップを積極的に減らすのではなく、パッシブに更新するKLペナルティやクリッピングによってこの問題を軽減する。
本稿では,トレーニング前の政策ギャップを積極的に縮小する,シンプルで効果的なデータ書き換えフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-18T17:02:30Z) - Op-Fed: Opinion, Stance, and Monetary Policy Annotations on FOMC Transcripts Using Active Learning [3.0294344089697596]
人間の注釈付き1044文とそのコンテキストのデータセットであるOp-Fedをリリースする。
我々は、意見、金融政策、金融政策に対するスタンスを分離する5段階の階層的スキーマを開発した。
分析の結果,ゼロショットの精度は0.80であるが,ゼロショットの精度は0.61に過ぎなかった。
論文 参考訳(メタデータ) (2025-09-16T21:07:17Z) - Pre-Trained Policy Discriminators are General Reward Models [81.3974586561645]
政策差別学習(POLAR)という,スケーラブルな事前学習手法を提案する。
POLARは報酬モデル(RM)を訓練し、同一のポリシーを識別し、異なるポリシーを識別する。
実証実験の結果、POLARは従来の非事前学習法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-07-07T16:56:31Z) - Fine-Tuning Language Models with Advantage-Induced Policy Alignment [80.96507425217472]
大規模言語モデルと人間の嗜好を整合させる新しいアルゴリズムを提案する。
言語タスクにおいてPPOを常に上回り、大きなマージンを持つことを示す。
また,損失関数の設計を支援する理論的正当性も提供する。
論文 参考訳(メタデータ) (2023-06-04T01:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。