論文の概要: Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language
- arxiv url: http://arxiv.org/abs/2607.03882v2
- Date: Fri, 10 Jul 2026 15:01:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.400283
- Title: Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language
- Title(参考訳): 一貫性はあるがミススカラー化:自然言語におけるリスクコミュニケーションのLLM制限の評価
- Abstract要約: 9個のLCMが2段階予測パイプライン内で要求を満たすかどうかを評価する。
我々は,上流モデルからの予測を,そのモードと先行サンプルサイズによってパラメータ化されたベータ分布からサンプルを取り出すことによりシミュレートする。
LLMは概して整合性はあるが誤校正され,不確実性に対する性能は確率的タスクよりも著しく低下することがわかった。
- 参考スコア(独自算出の注目度): 15.221434185896541
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMs are increasingly deployed as post-hoc explainers of AI-generated outputs, yet it remains unclear whether they can reliably communicate probabilistic information in natural language. For this role to be viable, models must produce identical verbal descriptions for identical inputs, and select descriptions that accurately reflect the magnitude of the underlying numerical quantities. We evaluate whether nine LLMs meet these requirements within a two-stage prediction pipeline, in which an upstream model has produced probabilistic outputs characterized by their likelihood and uncertainty, and LLMs are tasked with selecting an appropriate verbal descriptor for each. We simulate predictions from an upstream model by taking samples from a Beta distribution parameterized by its mode and prior sample size. We then prompt LLMs to explain these predictions under six domain contexts and with ten temperature settings, and repeating each experiment ten times. We find that LLMs are generally consistent but miscalibrated, with substantially weaker performance on uncertainty than on likelihood tasks. Providing models with precomputed summary statistics (mode and prior sample size) reduced sensitivity to contextual framing but did not resolve the underlying miscalibration, suggesting that the bottleneck resides in the verbalization step itself. These findings indicate that current LLMs do not yet constitute reliable zero-shot standalone risk communication tools for probabilistic predictions.
- Abstract(参考訳): LLMはAIが生成するアウトプットのポストホックな説明としてますます使われていますが、自然言語で確率的な情報を確実に伝達できるかどうかは不明です。
この役割が実現するためには、モデルは同一の入力に対して同一の言語記述を生成し、基礎となる数値の大きさを正確に反映した記述を選択する必要がある。
我々は、上流モデルが確率的出力を生成し、その確率と不確実性を特徴とする2段階予測パイプラインにおいて、9つのLLMがこれらの要件を満たすか否かを評価し、それぞれのLLMに対して適切な言語記述子を選択することを課題とする。
我々は,上流モデルからの予測を,そのモードと先行サンプルサイズによってパラメータ化されたベータ分布からサンプルを取り出すことによりシミュレートする。
次に、LLMに対して、これらの予測を6つのドメインコンテキストと10の温度設定で説明させ、各実験を10回繰り返すように促します。
LLMは概して整合性はあるが誤校正され,不確実性に対する性能は確率的タスクよりも著しく低下することがわかった。
事前計算された要約統計(モードと先行サンプルサイズ)を持つモデルを提供することで、文脈的フレーミングに対する感受性は低下するが、根底にある誤解は解決されず、ボトルネックは動詞化のステップ自体に存在することが示唆された。
これらの結果から,現在のLCMは,確率論的予測のための信頼性の高いゼロショット型リスクコミュニケーションツールをまだ構成していないことが示唆された。
関連論文リスト
- Set-Valued Prediction for Large Language Models with Feasibility-Aware Coverage Guarantees [11.874705280173387]
本稿では,設定値予測のための原則的フレームワークを提案する。
LLM生成の有限サンプリングの性質を考えると、カバレッジは必ずしも達成可能であるとは限らない。
次に,サンプル応答から予測セットを構成するデータ駆動キャリブレーション手法を開発した。
論文 参考訳(メタデータ) (2026-03-24T09:00:07Z) - Eliciting Numerical Predictive Distributions of LLMs Without Autoregression [46.67044415202221]
本研究では,LLM予測の分布特性を明示的な自己回帰生成なしに復元できるかどうかを検討した。
以上の結果から,LLMの埋め込みは予測分布の要約統計に関する情報的信号を運ぶことが示唆された。
論文 参考訳(メタデータ) (2026-03-03T12:13:40Z) - Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions [50.1404916337174]
大規模言語モデル(LLM)における母国語の確率的サンプリングの大規模,統計的に活用された最初の監査について述べる。
バッチ生成は, ほぼ完全に崩壊する一方, 中央値のパスレートが13%であり, 統計的妥当性はわずかであることがわかった。
現在のLCMには機能的な内部サンプルが欠如しており、統計的保証を必要とするアプリケーションに外部ツールを使う必要があると結論付けている。
論文 参考訳(メタデータ) (2026-01-08T22:33:12Z) - Language Bottleneck Models: A Framework for Interpretable Knowledge Tracing and Beyond [55.984684518346924]
我々は、知識追跡を逆問題として再考する: 過去の回答を説明できる最小限の自然言語要約を学習し、将来の回答を予測できる。
我々のLanguage Bottleneck Model(LBM)は、解釈可能な知識要約を書くエンコーダLLMと、その要約テキストのみを使用して生徒の反応を再構成し予測しなければならないフリーズデコーダLLMで構成されている。
合成算術ベンチマークと大規模Eediデータセットの実験により、LBMは最先端のKT法と直接LLM法の精度に匹敵する一方で、受講者軌道のオーダーを少なくすることを示した。
論文 参考訳(メタデータ) (2025-06-20T13:21:14Z) - Flipping Against All Odds: Reducing LLM Coin Flip Bias via Verbalized Rejection Sampling [59.133428586090226]
大規模言語モデル(LLM)は、しばしば自然言語を用いて確率分布を正確に記述することができる。
このミスマッチはモンテカルロ法、エージェントベースのシミュレーション、ランダム化された意思決定などの信頼性を必要とするタスクでの使用を制限する。
本稿では,古典的リジェクションサンプリングの自然言語適応であるVerbalized Rejection Smpling (VRS)を紹介する。
論文 参考訳(メタデータ) (2025-06-11T17:59:58Z) - Semantic Probabilistic Control of Language Models [27.866585120174484]
セマンティック制御は、微妙な非語彙的制約を満たすためにLM世代を操る。
我々は、検証者の情報勾配を利用して、対象属性を満たす全ての世代を効率的に推論する。
高確率で制約を満たす世代を産出するLMの毒性, 感情, 話題順守の制御におけるアプローチの有効性を評価する。
論文 参考訳(メタデータ) (2025-05-04T01:21:28Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z) - Conformal Language Modeling [61.94417935386489]
生成言語モデル(LM)の共形予測のための新しい手法を提案する。
標準共形予測は厳密で統計的に保証された予測セットを生成する。
我々は,オープンドメイン質問応答,テキスト要約,ラジオロジーレポート生成において,複数のタスクに対するアプローチの約束を実証する。
論文 参考訳(メタデータ) (2023-06-16T21:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。