論文の概要: HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior
- arxiv url: http://arxiv.org/abs/2610.07563v1
- Date: Tue, 06 Oct 2026 00:50:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.728845
- Title: HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior
- Title(参考訳): 家庭ベンチ:家庭の経済行動予測者としての大規模言語モデルの評価
- Abstract要約: 大規模言語モデル(LLM)は、家庭の意思決定の定量的モデルである経済において重要な目標を達成する可能性を持っている。
本研究では,米国世帯調査6件と予測タスク32件を統合した「House Bench」を新たに導入する。
本研究では,非変化ベースラインと勾配ブーストツリーモデルに対して,13のプロプライエタリかつオープンウェイトLLMを評価した。
- 参考スコア(独自算出の注目度): 11.073827220763102
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have the potential to meet a key goal in economics: a quantitative model of household decision making, across a variety of settings. Yet existing evaluations cover few surveys and outcomes, and do not study how households adjust to changing economic conditions. We introduce a new evaluation, HouseholdBench, which unites 6 U.S. household surveys and 32 prediction tasks spanning numeric, categorical and probabilistic outcomes, related to consumption, income, labor, expectations, and housing. Using past behavior, demographics and macroeconomic conditions, the tasks test whether LLMs predict behavior, including how households adjust to changes in various policies. We evaluate 13 proprietary and open-weight LLMs against a no-change baseline and a gradient-boosted tree model. Most LLMs outperform the no-change baseline, including for policy response tasks -- with the best model lowering error for numeric outcomes by 12.2%. Across most tasks, gradient-boosted trees rank first; leading proprietary LLMs approach their performance, but open-weight models lag. LLMs exhibit systematic over- and underprediction across different tasks. We identify methods that enable a 4 billion parameter open-weight model to match proprietary models' performance: fine-tuning and aggregating 16 predictions per observation. Improvements generalize to policy-response tasks, which are excluded from fine-tuning. We release our datasets, code, and leaderboard on our website: https://jn-huang.github.io/householdbench
- Abstract(参考訳): 大規模言語モデル(LLMs)は、経済において重要な目標を達成する可能性を持っている。
しかし、既存の評価では調査や成果がほとんどなく、世帯が経済状況の変化にどのように適応するかは研究していない。
消費、所得、労働、期待、住宅に関する数値的、カテゴリー的、確率的成果にまたがる6つの米国世帯調査と32の予測タスクを一体化する「House Bench」を新たに導入する。
過去の行動、人口統計、マクロ経済の状況を用いて、これらのタスクは、家庭が様々な政策の変化にどのように適応するかを含む、LCMが行動を予測するかどうかをテストする。
本研究では,非変化ベースラインと勾配ブーストツリーモデルに対して,13のプロプライエタリかつオープンウェイトLLMを評価した。
ほとんどのLCMは、ポリシー対応タスクを含む変更なしのベースラインよりも優れており、最も優れたモデルが数値結果のエラーを12.2%下げている。
ほとんどのタスクにおいて、勾配木が最初にランク付けされ、プロプライエタリなLLMがパフォーマンスに近づくが、オープンウェイトなモデルが遅れる。
LLMは様々なタスクにまたがって系統的な過度および過小評価を示す。
我々は,40億パラメータのオープンウェイトモデルをプロプライエタリなモデルの性能に適合させる手法を同定する。
改善は、微調整から除外されたポリシー応答タスクに一般化される。
データセット、コード、およびリーダボードをWebサイトに公開しています。
関連論文リスト
- Machine Learning Fairness in House Price Prediction: A Case Study of America's Expanding Metropolises [4.4701415309453285]
本稿では,構造的属性と近傍属性を組み合わせた機械学習モデルについて述べる。
特権群の様々な定義の下で、MLモデルの公正性に関する包括的な評価を行う。
異なるバイアス緩和ソリューションの性能について検討する。
論文 参考訳(メタデータ) (2025-05-02T21:26:21Z) - Scalable Best-of-N Selection for Large Language Models via Self-Certainty [75.1351701045874]
Best-of-N selectionは、Large Language Models(LLMs)の推論性能を改善するための重要なテクニックである。
本稿では, LLM出力の固有確率分布を利用して, 外部報酬モデルを必要としない応答品質を推定する, 新規で効率的な指標である自己確実性を提案する。
本研究は, LLM推論能力を向上させるための実用的で効率的な方法として, 自己確実性を確立した。
論文 参考訳(メタデータ) (2025-02-25T19:08:07Z) - Ranked from Within: Ranking Large Multimodal Models Without Labels [73.96543593298426]
ソフトマックス分布から導かれる不確実性スコアは,様々なタスクにまたがるランキングモデルに対して,ロバストな基礎となることを示す。
これにより、ラベルのないデータに対するLMMのランク付けが容易になり、手動のアノテーションを必要とせずに、多様なターゲットドメインのモデルを選択するための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2024-12-09T13:05:43Z) - CogBench: a large language model walks into a psychology lab [12.981407327149679]
本稿では,7つの認知心理学実験から得られた10の行動指標を含むベンチマークであるCogBenchを紹介する。
本稿では,CagBenchを35大言語モデル(LLM)に適用し,統計的多レベルモデリング手法を用いて解析する。
オープンソースモデルは、プロプライエタリなモデルよりもリスクが高く、コードの微調整は必ずしもLLMの振舞いを促進しない。
論文 参考訳(メタデータ) (2024-02-28T10:43:54Z) - Are You Sure? Challenging LLMs Leads to Performance Drops in The
FlipFlop Experiment [82.60594940370919]
大規模言語モデル(LLM)のマルチターン動作を研究するためのFlipFlop実験を提案する。
モデルが平均46%の時間で回答を反転させ、全てのモデルが最初の予測と最終予測の間に精度を低下させ、平均17%の低下(FlipFlop効果)を示す。
我々はオープンソースのLLMで微調整実験を行い、合成されたデータに対する微調整は、性能劣化を60%低減させることができるが、サイコファンティックな振る舞いを完全には解決できないことを発見した。
論文 参考訳(メタデータ) (2023-11-14T23:40:22Z) - Revisiting Out-of-distribution Robustness in NLP: Benchmark, Analysis,
and LLMs Evaluations [111.88727295707454]
本稿では,NLP分野におけるアウト・オブ・ディストリビューション(OOD)のロバスト性に関する研究を再検討する。
本稿では, 明確な分化と分散の困難さを保証するための, ベンチマーク構築プロトコルを提案する。
我々は,OODロバスト性の分析と評価のための事前学習言語モデルの実験を行った。
論文 参考訳(メタデータ) (2023-06-07T17:47:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。