論文の概要: Sparks of In Silico Cognitive Science: Theories from Simulated Data Can Generalize to Humans
- arxiv url: http://arxiv.org/abs/2609.08003v1
- Date: Mon, 07 Sep 2026 21:35:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.525483
- Title: Sparks of In Silico Cognitive Science: Theories from Simulated Data Can Generalize to Humans
- Title(参考訳): シリコン認知科学の火花:シミュレーションデータから人間に一般化できる理論
- Abstract要約: 行動基礎モデルは、設定を越えて人間の参加者のためのスタンドインとして提案されている。
それらから発見された理論が人間に一般化するか、単にシミュレータを特徴付けるだけなのかは定かではない。
我々は、エージェントが実験を設計し、応答を収集し、競合する理論を仲裁し、後継者を合成するクローズドループ発見システムを実行する。
- 参考スコア(独自算出の注目度): 27.855847876496238
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Behavioral foundation models have been proposed as stand-ins for human participants across settings, but it is unclear whether theories discovered on them generalize to humans or merely characterize the simulator. We ran the Automated Cognitive Scientist (\textsc{AutoCog}), a closed-loop discovery system in which LLM agents design theory-discriminating experiments, collect responses, arbitrate between competing theories, and synthesize successors, entirely on behavior simulated by Centaur, a foundation model of human behavior. In a multi-attribute decision-making setting, the theories \textsc{AutoCog} found on Centaur generalized to human data: they outperformed canonical theories on ten held-out experiments and were rivaled only by theories found by running the same loop on people. We argue that this succeeds despite the simulator's inevitable imperfections because a discovery loop that arbitrates between competing theories demands less of its simulator than estimation does. The simulator only needs to capture the regularities that distinguish the theories, and not necessarily reproduce behavior precisely. Imperfect simulators can therefore widen the search over theories, with human data then testing whether the surfaced theories generalize.
- Abstract(参考訳): 行動基礎モデルは, 設定の異なる参加者のスタンドインとして提案されているが, その上で発見された理論が人間に一般化するか, 単にシミュレータを特徴付けるだけなのかは定かではない。
私たちは、LLMエージェントが理論を識別する実験を設計し、反応を収集し、競合する理論を仲裁し、後継者を合成するクローズドループ発見システムであるAutomated Cognitive Scientist(\textsc{AutoCog})を実行しました。
マルチ属性決定設定において、センタウアで発見された理論 \textsc{AutoCog} は、人間のデータに一般化され、それらは10の実験において標準理論よりも優れ、人間に同じループを走らせることによって得られる理論にのみ競合した。
これはシミュレータが不完全であるにもかかわらず、競合する理論を仲裁する発見ループが、推定よりもシミュレータを少なく要求するためである、と我々は主張する。
シミュレーターは理論を区別する規則性を捉えるだけで、必ずしも正確に振る舞いを再現する必要はない。
したがって、不完全なシミュレーターは理論に対する探索を広げ、人間のデータは表面理論が一般化するかどうかをテストする。
関連論文リスト
- auto-psych: Automating the science of mind using agent-driven theory discovery and experimentation [30.489563356452255]
計算認知科学における理論生成プロジェクトに対して,自動発見技術を適用した。
認知心理学の古典的なケーススタディを用いて、コインフリップのどのシーケンスが、主観的にランダムに思えるかを判断する。
我々のシステムでは、ネストされたエージェントベースの発見ループを用いて人間の行動の説明理論を生成する。
論文 参考訳(メタデータ) (2026-06-24T23:43:01Z) - Closing the Loop to Discover Psychological Theories with an Automated Cognitive Scientist [26.846270187624636]
本稿では,完全自律型エージェントAIシステムであるAutomated Cognitive Scientist(AutoCog)を紹介する。
認知理論の構築を明示的で実行可能で累積的な科学に変えるためにどのように使用できるかを示す。
論文 参考訳(メタデータ) (2026-06-24T23:20:58Z) - Automated Adversarial Collaboration for Advancing Theory Building in the Cognitive Sciences [9.858210301644549]
本稿では,競合する理論間の共役を行うための自動対向協調フレームワークを提案する。
このシステムは、LCMに基づく理論エージェント、プログラム合成、閉ループにおける情報理論の実験設計を組み合わせる。
論文 参考訳(メタデータ) (2026-04-28T11:41:08Z) - Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces [81.41397370235102]
我々はOmniBehaviorを紹介した。OmniBehaviorは実世界のデータから構築された最初のユーザシミュレーションベンチマークである。
現在のモデルでは,コンテキストウィンドウが拡大しても,複雑な振る舞いを正確にシミュレートすることが困難であることを示す。
この結果、個人差や長い尾の挙動が失われ、将来の高忠実度シミュレーション研究における重要な方向性が浮き彫りになる。
論文 参考訳(メタデータ) (2026-04-09T15:26:21Z) - Large language models replicate and predict human cooperation across experiments in game theory [0.8166364251367626]
大きな言語モデルが実際の人間の意思決定をいかに反映しているかは、いまだに理解されていない。
我々は,ゲーム理論実験のディジタルツインを開発し,機械行動評価のためのシステマティック・プロンプトと探索の枠組みを導入する。
Llamaは人間の協調パターンを高い忠実度で再現し、合理的選択理論から人間の偏差を捉える。
論文 参考訳(メタデータ) (2025-11-06T16:21:27Z) - The Universal Landscape of Human Reasoning [60.72403709545137]
情報フロー追跡(IF-Track)を導入し,情報エントロピーの定量化と,各推論ステップにおけるゲインの定量化を行う。
IF-Trackは,本質的な推論特徴を捉え,系統的な誤りパターンを識別し,個人差を特徴付ける。
このアプローチは理論と測定の間の定量的な橋渡しを確立し、推論のアーキテクチャに関する機械的な洞察を提供する。
論文 参考訳(メタデータ) (2025-10-24T16:26:36Z) - SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors [58.87134689752605]
我々は,LLMシミュレーションの堅牢で再現可能な科学のための,最初の大規模標準ベンチマークであるSimBenchを紹介する。
現在、最高のLLMでさえシミュレーション能力が限られ(スコア: 40.80/100)、性能はモデルサイズと対数的にスケールする。
シミュレーション能力は、深い知識集約的推論と最も強く相関していることを示す。
論文 参考訳(メタデータ) (2025-10-20T13:14:38Z) - PolySim: Bridging the Sim-to-Real Gap for Humanoid Control via Multi-Simulator Dynamics Randomization [53.7088694598817]
複数の異種シミュレータを統合するWBCトレーニングプラットフォームであるPolySimを紹介する。
理論的には、PolySimは単シミュレータトレーニングよりもシミュレータ誘導バイアスの強い上限が得られることを示す。
論文 参考訳(メタデータ) (2025-10-02T06:31:42Z) - Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models [76.6028674686018]
エージェントの精神状態を追跡するための推論時間推論アルゴリズムである思考トレースを導入する。
提案アルゴリズムは,ベイズ理論をモデルとした。
本研究は,様々なベンチマークにおける思考トレーシングを評価し,大幅な性能向上を実証した。
論文 参考訳(メタデータ) (2025-02-17T15:08:50Z) - User Behavior Simulation with Large Language Model based Agents [116.74368915420065]
LLMベースのエージェントフレームワークを提案し,実際のユーザ動作をシミュレートするサンドボックス環境を設計する。
実験結果から,本手法のシミュレーション行動は実人の行動に非常に近いことが判明した。
論文 参考訳(メタデータ) (2023-06-05T02:58:35Z) - JECC: Commonsense Reasoning Tasks Derived from Interactive Fictions [75.42526766746515]
本稿では,人間のインタラクティブ・フィクション(IF)ゲームプレイ・ウォークスルーに基づく新しいコモンセンス推論データセットを提案する。
本データセットは,事実知識ではなく,機能的コモンセンス知識ルールの評価に重点を置いている。
実験の結果、導入したデータセットは、以前の機械読影モデルと新しい大規模言語モデルに難題であることが示されている。
論文 参考訳(メタデータ) (2022-10-18T19:20:53Z) - A consolidating review of Spekkens' toy theory [0.0]
スペケンスのおもちゃ理論は、単純な前提に基づいており、「もし我々が共通の古典理論を取り入れ、仮定として不確実性原理を加えたらどうだろう?
我々は、安定な形式主義や任意の次元への一般化を含む、スペケンスのおもちゃ理論に対する異なるアプローチを統合する。
論文 参考訳(メタデータ) (2021-05-07T14:10:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。