論文の概要: Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel
- arxiv url: http://arxiv.org/abs/2608.00979v1
- Date: Sun, 02 Aug 2026 04:10:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.04262
- Title: Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel
- Title(参考訳): パーソナミキシングと不正確な治療-応答推定をLLMのペルソナパネルで行う
- Abstract要約: 戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
変化は急激なインデクシングであったが、そのシェアは不確実性の仮定に依存していた。
結果は、1つの固定されたモデル・プロンプトパネルに関係し、人間の置換性を確立しない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly used as synthetic research participants and are often validated by whether their marginal responses resemble human data. We study a fixed panel of sixteen lightweight persona-conditioned GPT-4.1 configurations in repeated strategic games. The panel met preregistered broad-reference condition-mean criteria in three of four repeated-game cells; the sole miss was 0.011 below the lower reference bound. Variation was strongly prompt-indexed, but its share depended on uncertainty assumptions: fixed-panel symmetric-Dirichlet sensitivities produced median between-prompt shares of 63%-71% under Jeffreys alpha=0.5 and 47%-53% under alpha=1, while finite-opportunity plug-in estimates were 85%-96%. Aggregate continuation-probability contrasts were +0.083 and +0.078, with conservative simultaneous 95% intervals [-0.171, +0.330] and [-0.181, +0.330]. The treatment jointly changed the continuation process and its textual representation. A separate wording-and-position operation shifted cooperation from 0/40 to 37/40 in the bare configuration, and a label conflict also revealed representation control. The original persona-level p13 result was not prospectively family-controlled, while a post-adjudication exact gate was structurally underpowered; p13 is therefore a replication target rather than a finding. External review exposed family-error, dependence, construct, and boundary-uncertainty defects, and zero-call reanalysis changed the interpretation without rewriting the historical record. The registered marginal criteria could be passed without precisely estimating the treatment-response object. A public capsule verifies 4,916 confirmatory Phase 3-5 runs with no live model calls. The results concern one fixed model-prompt panel and do not establish human substitutability.
- Abstract(参考訳): 大規模な言語モデルは、合成研究参加者としてますます使われ、その限界応答が人間のデータに類似しているかどうかによって検証されることが多い。
戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
パネルは4つの繰り返しゲーム細胞のうち3つにおいて、事前登録された広範参照条件平均基準を満たした。
固定パネル対称性-ディリクレ感度は63%-71%, ジェフリースアルファ=0.5, アルファ=1で47%-53%, 有限機会プラグイン推定は85%-96%であった。
集合継続確率のコントラストは+0.083と+0.078で、保守的な95%間隔 [-0.171, +0.330] と [-0.181, +0.330] であった。
治療は継続過程とテキスト表現を共同で変更した。
0/40から37/40に分割し,ラベルの衝突により表現制御が可能となった。
元々のペルソナレベルp13はファミリーコントロールされていないが、適応後の正確なゲートは構造的に過小評価されていたため、p13は発見ではなく複製ターゲットである。
外部のレビューでは、家族エラー、依存、構成、境界不確かさの欠陥が明らかになり、ゼロコールの再分析は歴史的記録を書き換えることなく解釈を変更した。
登録された限界基準は、治療応答対象を正確に見積もることなく通過することができる。
パブリックカプセルは、ライブモデルコールなしで4,916の確認フェーズ3.5が実行されていることを確認している。
結果は、固定されたモデル・プロンプトパネル1つに関係し、人間の置換性を確立しない。
関連論文リスト
- Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources [0.013714053458441644]
ピア投票型ソーシャルプラットフォームテストベッドであるPV-SSTを紹介する。
実験は448の試験と112の完全なモデル・バイ・トピック・バイ・シードブロックで構成されている。
論文 参考訳(メタデータ) (2026-08-20T12:01:19Z) - Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps [9.710464466895521]
多数派の置換規則は、クエリの16.2%でシグナルを呼び出しながら、全体的な精度を82.44%から85.62%に向上させる。
HumanEval+/MBPP+では、16.2%のクエリでシグナルを呼び出しながら、多数派の置換規則が全体の精度を82.44%から85.62%に引き上げている。
論文 参考訳(メタデータ) (2026-08-07T08:14:46Z) - Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling [0.0]
合成親和性ツールは、独立大規模言語モデル(LLM)エージェントとして各個人を動作させる。
このパラダイムには基本的な障害モードがあることを示し、分散優先の修正をそれに対して設定する。
論文 参考訳(メタデータ) (2026-07-17T15:45:57Z) - Scaffold splits hide structural-frontier failures in ADMET models [25.408600489964726]
我々は,最も広く,最も物理化学的に遠隔的な足場群を予約するラベルフリーな構造フロンティアスプリットを導入する。
ADMETタスクを6つの公開実験またはキュレートしたADMETタスクで評価した。
論文 参考訳(メタデータ) (2026-07-12T12:25:50Z) - Multimodal Evaluator Preference Collapse: Cross-Modal Contagion in Self-Evolving Agents [1.0152838128195467]
EPC(Evaluator Preference Collapse)はマルチモーダル環境で劇的に増幅されていることを示す。
次に、クロスモーダル感染と呼ばれる新しい現象を示す。
我々は、モデル間評価器アーキテクチャを優先ドリフトの主なリスク要因とみなす。
論文 参考訳(メタデータ) (2026-06-15T13:18:20Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious [35.76482964927589]
202のマルチターン会話における66のターンレベルメトリクスの自己相関構造を特徴付ける。
標準プールテストでは,42%のアソシエーションがクラスタ・ロバスト補正に成功しなかった。
我々は、Chelton (1983) の有効自由度と会話レベルのブロックブートストラップを組み合わせた2段階補正フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-15T20:54:39Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers [34.31192184496381]
デンスレトリバーとリランカーは、検索強化世代(RAG)パイプラインの中心である。
我々は,これらのコンポーネントがベースとする大規模言語モデル(LLM)をどの程度の事実的能力で継承するか,あるいは失うかを評価する。
全ての埋め込みモデルにおいて、クエリと正しい完了の間のコサイン類似度スコアは、間違ったものよりも著しく高い。
論文 参考訳(メタデータ) (2025-08-28T04:13:51Z) - An Auditable Pipeline for Fuzzy Full-Text Screening in Systematic Reviews: Integrating Contrastive Semantic Highlighting and LLM Judgment [0.0]
フルテキストのスクリーニングは、体系的なレビューの大きなボトルネックです。
私たちは、ファジィな決定問題として包摂/排除を再設計する、スケーラブルで監査可能なパイプラインを提示します。
論文 参考訳(メタデータ) (2025-08-17T17:41:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。