Fugu-MT 論文翻訳(概要): Evaluating LLMs on Real-World Forecasting Against Human Superforecasters

論文の概要: Evaluating LLMs on Real-World Forecasting Against Human Superforecasters

arxiv url: http://arxiv.org/abs/2507.04562v2
Date: Fri, 01 Aug 2025 03:18:44 GMT
ステータス: 翻訳完了
システム内更新日: 2025-08-04 14:06:53.470073
Title: Evaluating LLMs on Real-World Forecasting Against Human Superforecasters
Title（参考訳）: ヒトスーパープレキャストに対するリアルタイム予測におけるLCMの評価
Authors: Janna Lu,
Abstract要約: 大規模言語モデル(LLM)は、様々なタスクにまたがる顕著な能力を示したが、将来の事象を予測する能力はまだ検討されていない。メタキュラスから464個の質問を予測し,その性能をヒトのスーパーフォアキャスターと比較した。
参考スコア（独自算出の注目度）: 0.0
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Large language models (LLMs) have demonstrated remarkable capabilities across diverse tasks, but their ability to forecast future events remains understudied. A year ago, large language models struggle to come close to the accuracy of a human crowd. I evaluate state-of-the-art LLMs on 464 forecasting questions from Metaculus, comparing their performance against human superforecasters. Frontier models achieve Brier scores that ostensibly surpass the human crowd but still significantly underperform a group of superforecasters.
Abstract（参考訳）: 大規模言語モデル(LLM)は、様々なタスクにまたがる顕著な能力を示したが、将来の事象を予測する能力はまだ検討されていない。 1年前、大きな言語モデルは、人間の群衆の精度に近づくのに苦労しました。メタキュラスから464個の質問を予測し,その性能をヒトのスーパーフォアキャスターと比較した。フロンティアモデルは、人間の群衆を目覚ましげに上回るブライアスコアを達成しているが、それでもスーパーフォアキャスターのグループを著しく下回っている。

関連論文リスト

Large Language Models Can Self-Improve in Long-context Reasoning [100.52886241070907]
大規模言語モデル(LLM)は、長いコンテキストの処理においてかなりの進歩を遂げているが、それでも長いコンテキストの推論に苦慮している。我々はこの目的のために特別に設計されたアプローチである我々の提案する。人類の専門家や先進的なモデルによるデータに依存する従来のアプローチと比べて優れたパフォーマンスを達成しています
論文参考訳（メタデータ） (2024-11-12T19:53:00Z)
Abstract2Appendix: Academic Reviews Enhance LLM Long-Context Capabilities [6.0211447492146]
大規模言語モデル(LLM)は、様々なタスクで顕著なパフォーマンスを示しているが、長文読み出しの処理能力は依然として困難である。本研究では, 高品質な学術的査読データを微調整LDMに活用し, 長期的文脈能力を高める効果について検討した。
論文参考訳（メタデータ） (2024-11-07T22:57:02Z)
A Survey on Human Preference Learning for Large Language Models [81.41868485811625]
近年の多目的大言語モデル(LLM)の急激な増加は、より有能な基礎モデルと人間の意図を優先学習によって整合させることに大きく依存している。本調査では、選好フィードバックのソースとフォーマット、選好信号のモデリングと使用、および、整列 LLM の評価について述べる。
論文参考訳（メタデータ） (2024-06-17T03:52:51Z)
Can Language Models Use Forecasting Strategies? [14.332379032371612]
実世界の出来事と関連する人間の予測の新たなデータセットを用いた実験について述べる。モデルはまだ、未来に関する正確な予測に苦戦している。
論文参考訳（メタデータ） (2024-06-06T19:01:42Z)
Wisdom of the Silicon Crowd: LLM Ensemble Prediction Capabilities Rival Human Crowd Accuracy [1.999925939110439]
我々は12大言語モデル(LLM)の群集からなるアンサンブルアプローチを使用する。我々は,31の2進数質問に対するLLM予測を,3ヶ月の予測トーナメントにおける人的予測者の群集の予測と比較した。両モデルの予測精度は、中央値の人間の予測を情報として暴露することで得られる。
論文参考訳（メタデータ） (2024-02-29T17:27:59Z)
Large Language Models: A Survey [66.39828929831017]
大規模言語モデル(LLM)は、広範囲の自然言語タスクにおける強力なパフォーマンスのために、多くの注目を集めている。 LLMの汎用言語理解と生成能力は、膨大なテキストデータに基づいて数十億のモデルのパラメータを訓練することで得られる。
論文参考訳（メタデータ） (2024-02-09T05:37:09Z)
Humans vs Large Language Models: Judgmental Forecasting in an Era of Advanced AI [0.0]
本研究では,小売業における人的専門家と大規模言語モデル(LLM)の予測精度について検討した。本分析は, 統計モデル(ベースライン, 高度), 製品が促進されているか, 外的影響の性質など, 予測性能に及ぼす因子の影響に着目した。
論文参考訳（メタデータ） (2023-12-12T02:28:12Z)
Evaluating Large Language Models at Evaluating Instruction Following [54.49567482594617]
我々は,命令追従出力の識別におけるLLM評価器の能力をテストするために,挑戦的なメタ評価ベンチマーク LLMBar を導入する。異なる評価器がLLMBarに対して異なる性能を示し、最高の評価器でさえ改善の余地があることが判明した。
論文参考訳（メタデータ） (2023-10-11T16:38:11Z)
Are Large Language Models Really Robust to Word-Level Perturbations? [68.60618778027694]
本稿では,事前学習した報酬モデルを診断ツールとして活用する,新たな合理的評価手法を提案する。より長い会話は、質問を理解する能力の観点から言語モデルの包括的把握を示す。この結果から,LLMは日常言語でよく使われる単語レベルの摂動に対する脆弱性をしばしば示している。
論文参考訳（メタデータ） (2023-09-20T09:23:46Z)
Large Language Models are Not Yet Human-Level Evaluators for Abstractive Summarization [66.08074487429477]
抽象的な要約のための自動評価器として,大規模言語モデル(LLM)の安定性と信頼性について検討する。また、ChatGPTとGPT-4は、一般的に使われている自動測定値よりも優れていますが、人間の代替品として準備ができていません。
論文参考訳（メタデータ） (2023-05-22T14:58:13Z)
Benchmarking Large Language Models for News Summarization [79.37850439866938]
大規模言語モデル(LLM)は自動要約を約束しているが、その成功の背景にある理由はよく分かっていない。 LLMのゼロショット要約能力の鍵は、モデルサイズではなく、命令チューニングにある。
論文参考訳（メタデータ） (2023-01-31T18:46:19Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。