論文の概要: Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling
- arxiv url: http://arxiv.org/abs/2607.18310v1
- Date: Fri, 17 Jul 2026 15:45:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.177182
- Title: Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling
- Title(参考訳): 分散第一人口シミュレーション:非WIRD LLMペルソナモデルにおける崩壊・校正・リコール
- Abstract要約: 合成親和性ツールは、独立大規模言語モデル(LLM)エージェントとして各個人を動作させる。
このパラダイムには基本的な障害モードがあることを示し、分散優先の修正をそれに対して設定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic-population tools increasingly run every individual as an independent large language model (LLM) agent. Using real survey microdata, we show that this paradigm has a basic failure mode, and we set a distribution-first corrective against it, all measured with a deterministic, construct-validated verifier on non-WEIRD (Turkey-first) data. First, N independent LLM agents grounded on 2,414 real World Values Survey respondents fail to reproduce the population's response distribution: they pile onto a modal default (four scenarios x five seeds: concentration 0.36->0.69, entropy 1.46->0.77, 85% collapse, TVD=0.44), and the collapse is a predictable function of scenario structure (r=0.55 with a single-answer structure). Second, Verbalized Sampling (VS) fixes the field's chronic under-dispersion without training in three model families (fidelity +7 to +10; significant on Qwen, p=0.002, d=6.2), yet the same move universally overshoots into over-dispersion (SD-ratio 0.4-0.56 -> 1.26-1.37), a structural property of VS. Third, survey fidelity transfers only weakly to agentic behavior: in a single-model, single-domain booking task, a persona is dominated by a cheapest-default (~80%) that income modulates but does not override (comfort choice 0%->7%->32% across income bands). Fourth, a placebo-controlled memorization attack and an election backtest show VS keeps aggregate strength while subgroup and individual claims are contaminated by recall and underdetermination. We close with the corrective: model the distribution once (VS) and assign it to grounded characters at O(1) cost, with a budget-aware router whose honest AUC is 0.805, not the tautological 1.0 of a code-derived oracle. The central contribution needs no realism claim: it measures the internal inconsistency of the independent-agent route and the conditions under which the distribution-first route calibrates.
- Abstract(参考訳): 合成人口管理ツールは、独立大規模言語モデル(LLM)エージェントとして、各個人をますます運用している。
実測マイクロデータを用いて,本パラダイムは基本的な故障モードを有しており,非WEIRD(Turkey-first)データに対する決定論的・構成検証器を用いて,分布優先の補正を行う。
まず、2,414 実世界価値に基づく N 個の独立 LLM エージェント 回答者は人口の応答分布を再現できない: 4 つのシナリオ x 5 個の種子(濃度 0.36->0.69,エントロピー 1.46->0.77, 85% 崩壊, TVD=0.44)に積み重ね、崩壊はシナリオ構造(r=0.55)の予測可能な機能である。
第2に、Verbalized Sampling (VS) は、3つのモデルファミリーでトレーニングせずに、フィールドの慢性的な過分散を修復する(fidelity +7 to +10; Qwen, p=0.002, d=6.2)が、同じ動きは、VSの構造的特性であるオーバー分散(SD-ratio 0.4-0.56 -> 1.26-1.37)へと普遍的にオーバーシュートする(SD-ratio 0.4-0.56 -> 1.26-1.37)。
第4に、プラセボによる記憶障害と選挙バックテストは、VSが集団的強度を維持し、サブグループと個人的クレームはリコールと不確定によって汚染されることを示している。
正規の AUC が 0.805 で、コード由来のオラクルのタウトロジー 1.0 ではなく、予算に配慮したルータで、配布を1回(VS) モデル化し、O(1) のコストでグラウンドド文字に割り当てる。
中央のコントリビューションは現実主義的な主張を必要とせず、独立したエージェントルートの内部の不整合と、配布ファーストルートが校正される条件を計測する。
関連論文リスト
- Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation [6.047519836191728]
有限行動ポリシークラス上でプロトコルレベルの識別可能性監査を形式化する。
監査はモデルコールをゼロにし、診断ケースを解決します。
このケースは、モデル推論の前に、どのように評価設計の妥当性を構造的に確認できるかを示す。
論文 参考訳(メタデータ) (2026-08-13T14:49:47Z) - Located but Not Releasable: Silent Gate Inversion and Bounded Linear Release [0.0]
完全なパイプライン -- 検出、ローカライズ、リリース -- を、25.7Mトランス上で完全に事前登録されたストレステストに送信します。
中層層の観測エビデンスチャネルでの干渉は、他の抑圧された世界における標的の挙動を復元する。
配当外のキャリブレーションをゼロにするために調整された検出器は、6.9-7.3%の配当前の世代と、実際にそれを必要とする2,400世代のうちゼロにトリガーをトリガーする。
論文 参考訳(メタデータ) (2026-08-12T09:04:54Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - On-Policy Self-Distillation without Any Supervision [47.315224514076334]
我々は、内部整合性を通して、モデル自身の世代のみを用いて、政治上の自己蒸留を実現することができることを示す。
教師なしの政治自己蒸留(U-OPSD)を提案する。
論文 参考訳(メタデータ) (2026-08-06T17:18:23Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Attributing Emergence in Million-Agent Systems [68.53670424791751]
大規模言語モデル(LLM)は、個々のエージェントにおける人間のような推論と意思決定をシミュレートすることができる。
このような研究は、個々のエージェントにマクロな出現をもたらす必要がある。
Aumann--Shapley path-integral attribution to LLM-powered MAS at million-agent scale。
論文 参考訳(メタデータ) (2026-05-12T01:49:41Z) - Zero-Shot Confidence Estimation for Small LLMs: When Supervised Baselines Aren't Worth Training [0.0]
RouteLLMスタイルの教師付きベースラインは、3つの7-8Bモデルファミリと2つのデータセットで比較される。
トレーニングデータを必要としない平均トークンログ確率は、配布中の教師付きベースラインにマッチするか、超過する。
前世代の信号である検索条件自己評価は、ログプロビタビリティよりも3~10倍のレイテンシで、最大0.069 AUROCで裸の自己評価を改善する。
論文 参考訳(メタデータ) (2026-05-04T05:33:03Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - Epistemic Observability in Language Models [0.0]
製造時に高い信頼性を報告できるモデルがあることがわかりました。
正式な仮定では、これは能力ギャップではなく観察的なギャップである。
我々は,計算副産物を輸出することで不合理性から逃れるテンソルインタフェースを構築した。
論文 参考訳(メタデータ) (2026-03-20T21:59:34Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions [50.1404916337174]
大規模言語モデル(LLM)における母国語の確率的サンプリングの大規模,統計的に活用された最初の監査について述べる。
バッチ生成は, ほぼ完全に崩壊する一方, 中央値のパスレートが13%であり, 統計的妥当性はわずかであることがわかった。
現在のLCMには機能的な内部サンプルが欠如しており、統計的保証を必要とするアプリケーションに外部ツールを使う必要があると結論付けている。
論文 参考訳(メタデータ) (2026-01-08T22:33:12Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。