論文の概要: LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting
- arxiv url: http://arxiv.org/abs/2609.01337v1
- Date: Tue, 01 Sep 2026 14:49:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.77452
- Title: LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting
- Title(参考訳): LEAP:LLMに基づく確率予測のための類似の緩和と集約
- Authors: Yufei Chen, Yiran Zhao, Xiaogang Xu, Qipeng Xie, Jiafei Wu, Zhe Liu,
- Abstract要約: 予測段階でどのように収集された証拠が使用されるかを再編成するLEAPを提案する。
LEAPは、それぞれのエビデンス項目を別々に調査し、ターゲットに対する影響を説明する可能性パラメーターを抽出する。
再現可能なエビデンスコントリビューションを維持しながら、継続的、単一選択、複数選択予測をサポートする。
- 参考スコア(独自算出の注目度): 20.194319347066404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based forecasting systems have improved on real-world tasks such as financial markets and sports outcomes, largely through stronger search and tool use. Many systems still ask an LLM to read all collected evidence together and produce the final forecast. We call this design Monolithic Prediction. It can obscure how individual evidence items affect the result and collapse uncertainty across competing outcomes. We propose LEAP (Likelihood Elicitation and Aggregation for Probabilistic forecasting), which reorganizes how collected evidence is used in the prediction stage. LEAP examines each evidence item separately and elicits likelihood parameters that describe its implications for the target. An explicit prior and a deterministic probabilistic model then combine these likelihoods into a posterior distribution. This procedure supports continuous, single-choice, and multi-choice forecasts while preserving reproducible evidence contributions. We build a benchmark covering forecasting, information-seeking, and browsing tasks, and evaluate LEAP on our own agent loop and several agent CLI frameworks. Given the same evidence, LEAP improves most prediction and calibration metrics across models and remains stronger under controlled comparisons of prior access, inference budget, and aggregation.
- Abstract(参考訳): LLMベースの予測システムは、金融市場やスポーツ結果などの現実的なタスクにおいて改善されており、主に検索とツールの使用が強化されている。
多くのシステムは依然としてLLMに、収集されたすべての証拠をまとめて読み上げ、最終的な予測を作成するよう求めている。
この設計をモノリシック予測と呼ぶ。
個々のエビデンス項目が結果にどのように影響し、競合する結果間で不確実性を崩壊させるかは明らかではない。
予測段階で収集された証拠をどのように利用するかを再編成したLEAP(Likelihood Elicitation and Aggregation for Probabilistic forecasting)を提案する。
LEAPは、それぞれのエビデンス項目を別々に調査し、ターゲットに対する影響を説明する可能性パラメーターを抽出する。
明示的な事前および決定論的確率モデルは、これらの確率を後続分布に結合する。
この手順は、再現可能なエビデンスコントリビューションを保持しながら、連続、単選択、複数選択予測をサポートする。
我々は、予測、情報検索、ブラウジングタスクをカバーするベンチマークを構築し、独自のエージェントループといくつかのエージェントCLIフレームワーク上でLEAPを評価する。
同じ証拠を前提として、LEAPはモデル全体の予測とキャリブレーションの指標を改善し、事前アクセス、推論予算、集約の制御された比較の下では依然として強力である。
関連論文リスト
- LLM-based Agents for Forecasting and Prediction: Methods, Training, Evaluation, and Applications [76.41731220830714]
大規模言語モデル(LLM)は、言語ベースの推論と時間的データ、エビデンス検索、外部ツール、反復予測を組み合わせた予測システムをサポートするようになった。
ファイナンス、天気、健康、エネルギー、オペレーションの応用について検討し、評価に使用されるベンチマークとデータセットを要約する。
論文 参考訳(メタデータ) (2026-08-24T10:02:39Z) - LEAF: A Living Benchmark for Event-Augmented Forecasting [78.94019460534442]
LEAFは、イベント拡張予測タスクの最初の生きたベンチマークである。
我々は最先端のプロプライエタリかつオープンウェイトなLLMを評価した。
LLMは、より予測し易いと自信を持って判断し、より優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-09T03:17:59Z) - Interpretable Probability Estimation with LLMs via Shapley Reconstruction [21.224475598322538]
PRISM: シェープ測度による確率再構成は、確率推定に透明性と精度をもたらすフレームワークです。
実験では,PRISMにより直接的プロンプトよりも予測精度が向上することを示した。
ケーススタディでは、個々の要因が最終見積もりをどう形成するかを可視化し、LCMに基づく意思決定支援システムの信頼構築を支援する。
論文 参考訳(メタデータ) (2026-01-14T04:45:36Z) - The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification [74.64864354503204]
本稿では,Large Language Models (LLM) を利用した予測自動監視システムであるThe Forecast Criticを提案する。
LLMの時系列予測品質を評価する能力を評価する。
合成および実世界の予測データを含む3つの実験を行った。
論文 参考訳(メタデータ) (2025-12-12T21:59:53Z) - What do Language Model Probabilities Represent? From Distribution Estimation to Response Prediction [16.63148156570219]
異なる設定が3つの異なる意図された出力分布につながると我々は主張する。
NLP研究はこれらの分布がよく似ていると仮定し、実験結果の誤解釈につながることを実証する。
論文 参考訳(メタデータ) (2025-05-04T11:46:48Z) - LLM-Select: Feature Selection with Large Language Models [64.5099482021597]
大規模言語モデル(LLM)は、データサイエンスの標準ツールに匹敵するパフォーマンスで、最も予測可能な機能を選択することができる。
以上の結果から,LSMはトレーニングに最適な機能を選択するだけでなく,そもそもどの機能を収集すべきかを判断する上でも有用である可能性が示唆された。
論文 参考訳(メタデータ) (2024-07-02T22:23:40Z) - Do Large Language Models Exhibit Cognitive Dissonance? Studying the Difference Between Revealed Beliefs and Stated Answers [13.644277507363036]
Revealed Beliefは,不確実性を考慮した推論を必要とするタスクに対して,Large Language Models (LLMs)を評価する評価フレームワークである。
以上の結果から,LSMは正しい回答をしばしば述べるが,Revealed Beliefは確率質量を不整合に割り当てることが多く,体系的な偏見を示し,新しい証拠が提示された時にその信念を適切に更新することができないことが示唆された。
論文 参考訳(メタデータ) (2024-06-21T08:56:35Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。