論文の概要: Status Association Does Not Reliably Predict Decision Leakage
- arxiv url: http://arxiv.org/abs/2608.10089v1
- Date: Mon, 10 Aug 2026 18:02:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.773871
- Title: Status Association Does Not Reliably Predict Decision Leakage
- Title(参考訳): ステータス・アソシエーションは、意思決定の漏洩を確実に予測していない
- Authors: Abdullah X,
- Abstract要約: エリート符号の姓は、一般的な姓よりも高い確率質量を強制的に受け取っていた。
エリート-ミナス-一般的な決定効果は、ほとんどの系ではゼロに近かった。
潜伏した社会結社と 連続的な治療は 経験的に異なる構成物だ
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bias evaluations often move too quickly from evidence that a model encodes a social association to claims that the same association will alter consequential decisions. We test whether that inference is warranted using Chilean surnames as controlled socioeconomic probes. We evaluate eight frozen model-provider cells on 1,032 prompts each, yielding 8,256 verified primary responses. The design separates forced latent association from matched consequential decisions across academic selection, professional hiring, research fellowship selection, and legal-aid intake. Elite-coded surnames received higher forced high-status probability mass than common surnames in seven of eight models and higher mass than rare-frequency controls in all eight. Yet elite-minus-common decision effects were close to zero for most systems. Five models were statistically equivalent within a predeclared (Plus-Minus)0.10 standard-deviation margin, while the remaining three were imprecise or borderline, with no consistent elite advantage. Association strength did not reliably predict decision leakage across models (r = 0.201, p = 0.633) or across frozen surname-pair-by-model cells (r = 0.065, p = 0.565). The central result is a measurement dissociation: latent social association and consequential treatment are empirically distinct constructs. Evaluations should measure the transition from association to action directly.
- Abstract(参考訳): バイアス評価は、モデルが社会的協会を符号化する証拠から、同じ協会が連続的な決定を変更できると主張する証拠から素早く移動することが多い。
我々は、チリの姓を用いて推論が保証されているかどうかを、社会経済の制御調査として検証する。
1,032個のプロンプト上で8個の凍結型モデルプロジェクター細胞を評価し,8,256個のプライマリ応答を得た。
このデザインは、学術的選択、専門職の雇用、研究フェローシップの選択、および法的援助の取り決めを、強制的な潜伏者協会と区別している。
エリート符号の姓は8つのモデルのうち7つのモデルのうち7つのモデルにおいて、一般的な姓よりも高い確率質量、そして8つのモデルにおいてまれな周波数制御よりも高い質量を与えられた。
しかし、エリート-ミナス-一般的な決定効果は、ほとんどのシステムではゼロに近かった。
5つのモデルは事前宣言された(Plus-Minus)0.10の標準偏差の範囲内で統計的に等価であったが、残りの3つは不正確か境界線であり、一貫したエリート優位性は無かった。
関係強度は, モデル間の決定漏れ(r = 0.201, p = 0.633) や凍結したリズミカルペア・バイ・モデル細胞(r = 0.065, p = 0.565) を確実に予測しなかった。
中心的な結果は、測定の解離である:潜伏した社会関係と連続的な治療は、経験的に異なる構成である。
評価は、協会から行動への移行を直接測定するべきである。
関連論文リスト
- Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel [0.0]
戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
変化は急激なインデクシングであったが、そのシェアは不確実性の仮定に依存していた。
結果は、1つの固定されたモデル・プロンプトパネルに関係し、人間の置換性を確立しない。
論文 参考訳(メタデータ) (2026-08-02T04:10:11Z) - Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions [6.575315179481716]
視覚言語モデルでは、信頼スコアを示さないインターフェースを通して、構造化胸部画像像を返却する。
胸部X線写真コーパスを用いた3つの生成視覚言語モデルについて検討した。
論文 参考訳(メタデータ) (2026-08-01T16:18:59Z) - Can Large Language Models Represent Urban Publics? Behavioral Replication and Population Mismatch in an Affordable-Housing Experiment [1.7984459258809926]
大規模言語モデルでは,集団構造の維持に失敗しながら,1つの集合コントラストを近似することができることを示す。
都市計画におけるモデル評価は、この空間構造と社会構造が、平均的な効果だけでなくシミュレーションを生き残るかどうかを検証すべきである。
論文 参考訳(メタデータ) (2026-07-29T16:27:36Z) - RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning [42.80742579670377]
RareLensは、まれな疾患の軌跡全体にわたる臨床的意思決定を支援するシステムである。
RareBenchは、33のOrphanetカテゴリと7000以上の条件にまたがる157,525件の実際のデータセットである。
検診で0.917、診断と治療で65.5%、89.8%の成績を収めた。
論文 参考訳(メタデータ) (2026-07-25T16:58:10Z) - Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution [0.0]
予測市場は、不確実な出来事を予測するために集合的なインテリジェンスを集約する。
既存のオラクルシステムは、高速だが不安定な自動化と、正確だがコストのかかる人間の仲裁とをトレードオフする。
マルチエージェントLLMアーキテクチャが単一モデルベースラインよりもオラクル分解能を向上できるかどうかを評価する。
論文 参考訳(メタデータ) (2026-05-29T03:44:19Z) - Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation [0.0]
政策シミュレーションにおいて,大規模言語モデル(LLM)を用いたマルチエージェント検討システムの提案が進んでいる。
評価エージェントは、割り当てられた値の観点に関わらず、同じ選択肢に収束する。
我々は、三段階の審議フレームワークであるAI Councilを提示し、2つの介入をテストするための2つの政策シナリオにわたる120の審議を行う。
論文 参考訳(メタデータ) (2026-04-29T11:47:28Z) - Complementing Self-Consistency with Cross-Model Disagreement for Uncertainty Quantification [41.04503562937318]
大規模言語モデル(LLM)は、しばしば自信を持って不正確な応答を生成する。
AU(aleatoric uncertainty)を推定するための自己整合性は、モデルが過信されているときに崩壊する。
AUが低い場合, モデル間のセマンティックな不一致が, 正確な解に対して高いことを示す。
論文 参考訳(メタデータ) (2026-04-18T19:00:27Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Prospect Theory Fails for LLMs: Revealing Instability of Decision-Making under Epistemic Uncertainty [41.94502767947584]
プロスペクト理論が現代の大規模言語モデルに適用されるかどうかは、まだ明らかになっていない。
PT下でのLCMの意思決定動作をモデル化するための,より汎用的で正確な評価フレームワークを提案する。
以上の結果から,LPMのPTによる意思決定のモデル化は信頼性が低いことが示唆された。
論文 参考訳(メタデータ) (2025-08-12T15:02:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。