論文の概要: Small Foundation Models of Human Cognition and Behaviour
- arxiv url: http://arxiv.org/abs/2608.05224v1
- Date: Wed, 05 Aug 2026 11:34:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.749744
- Title: Small Foundation Models of Human Cognition and Behaviour
- Title(参考訳): 人間の認知と行動の小さな基礎モデル
- Authors: Nick Oh, Fernand Gobet,
- Abstract要約: 135Mから14Bパラメータの14モデルを、Psych-101の4つのアーキテクチャファミリでトレーニングしています。
Psych-101は160の実験から1070万の試行レベルの選択のデータセットである。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models fine-tuned on human behavioural data have emerged as general-purpose cognitive proxies, but the scale this requires, and whether these models process task structure or exploit statistical shortcuts, remain open questions. We train fourteen models from 135M to 14B parameters across four architecture families on Psych-101, a dataset of 10.7 million trial-level choices from 160 experiments. In-distribution, scale barely matters. The models fall within a narrow band, as though against a ceiling, and 0.6B to 1B parameters suffice to match a 70B baseline on held-out participants. Out-of-distribution, that band opens into a markedly steeper scaling gradient, with larger models clearly advantaged in generalisation to novel task structure. To determine what information these models use, we run two diagnostics. We progressively strip four prompt channels -- task instructions, experimental stimuli, outcome feedback, and choice history -- across 27 experiments, and permute trial order. Masking the content of stimuli and feedback destroys 75.7% of learned information and pushes models below chance, demonstrating that choice history alone does not account for performance. Permutation reveals invariance on tasks with independent trials but sensitivity where trial order is determined by prior responses. Small cognitively fine-tuned models therefore show promise as noise ceiling estimators for psychological experiments, though their scope remains bounded by the paradigms seen in training.
- Abstract(参考訳): 人間の行動データに基づいて微調整された大きな言語モデルは、汎用的な認知プロキシとして登場したが、このスケールが必要であり、これらのモデルがタスク構造を処理するか、統計的ショートカットを利用するかは、未解決のままである。
我々は、160の実験から1070万の試行レベルの選択のデータセットであるPsych-101で、4つのアーキテクチャファミリにわたる135Mから14Bパラメータの14モデルをトレーニングする。
流通において、スケールはほとんど重要ではない。
モデルは天井のように狭い帯に落ち、0.6Bから1Bのパラメータは、ホールドアウト参加者の70Bベースラインと一致するのに十分である。
アウト・オブ・ディストリビューション(out-of-distribution)は、そのバンドが驚くほど急激なスケーリング勾配に開き、より大きなモデルは明らかに新しいタスク構造への一般化に有利である。
これらのモデルが使用する情報を決定するために、2つの診断を行う。
課題指示、実験刺激、結果フィードバック、選択履歴の4つのプロンプトチャネルを、27の実験から切り離し、パーミュートな試行順序で実行します。
刺激とフィードバックの内容を仮定すると、学習した情報の75.7%が破壊され、選択履歴だけがパフォーマンスを考慮しないことを示すモデルがチャンスを低くする。
置換は、独立した試行を伴うタスクで不変であるが、事前の反応によって試行順序が決定される感度を示す。
そのため、認知的に微調整された小さなモデルは、心理学実験のためのノイズ天井推定器として約束されるが、その範囲はトレーニングで見られるパラダイムに縛られている。
関連論文リスト
- Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Teaching Language Models to Forecast Research Success Through Comparative Idea Evaluation [4.702729080310267]
PapersWithCodeの客観的な結果に基づいて,11,488のアイデアペアのデータセットを構築した。
我々は、潜在的推論経路を発見するためにモデルを訓練し、解釈可能な正当化で71.35%を達成した。
この結果から,計算効率のよい小言語モデルが,有効で客観的な検証手段として有効であることが示唆された。
論文 参考訳(メタデータ) (2026-04-06T19:03:11Z) - The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning [9.898274894485107]
大きな言語モデルは、サージェントサーフェスキューが計算不可能な実行可能性制約と競合する場合に、体系的に失敗する。
診断・診断・ブリッジ・トリート・フレームワークを用いてこれを研究する。
論文 参考訳(メタデータ) (2026-03-30T21:36:09Z) - Finetuning LLMs for Human Behavior Prediction in Social Science Experiments [9.470846958372974]
過去の実験から個々のレベルの反応に直接、大きな言語モデル(LLM)を微調整することは、その精度を有意義に向上させる。
SocSci210は210の社会科学実験で400,491人の参加者から290万の回答を得たデータセットである。
我々の最強のモデルであるSocrates-Qwen-14Bは、多様な結果問題に対する人間の反応の分布に一致した26%の予測を生成する。
論文 参考訳(メタデータ) (2025-09-06T20:52:08Z) - Planted in Pretraining, Swayed by Finetuning: A Case Study on the Origins of Cognitive Biases in LLMs [51.00909549291524]
大型言語モデル(LLM)は認知バイアスを示す。
これらのバイアスはモデルによって異なり、命令チューニングによって増幅することができる。
これらのバイアスの違いが事前学習、微調整、あるいはランダムノイズに起因するかどうかは不明だ。
論文 参考訳(メタデータ) (2025-07-09T18:01:14Z) - DataDecide: How to Predict Best Pretraining Data with Small Experiments [67.95896457895404]
私たちはDataDecideのモデル、データ、評価を公開しています。
最大100Bトークン,最大1Bパラメータのモデルサイズ,および3つのランダムシードを用いて,25コーパスにわたる事前学習実験を行った。
論文 参考訳(メタデータ) (2025-04-15T17:02:15Z) - Dialectical Behavior Therapy Approach to LLM Prompting [1.433758865948252]
大規模言語モデルは、チェーン・オブ・シンクレット(CoT)プロンプト技術を適用する際に、様々な推論タスクに対して最先端の結果を示した。
弁証的行動療法(DBT)にインスパイアされた新しいプロンプト戦略を提案する。
提案手法を応用したプロンプトにより,より小さなモデルにおける結果が大幅に向上することを示す。
論文 参考訳(メタデータ) (2024-10-10T09:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。