論文の概要: SocietyBench: Forecasting Counterfactual Social-World Evolution
- arxiv url: http://arxiv.org/abs/2608.04009v1
- Date: Tue, 04 Aug 2026 17:59:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.307121
- Title: SocietyBench: Forecasting Counterfactual Social-World Evolution
- Title(参考訳): SocietyBench: 対実的社会世界の進化を予測
- Authors: Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi,
- Abstract要約: 補完的な社会的能力、すなわち、モデルが実際の社会的事象の展開方法を理解し、予測する方法は、ほとんど測定されていない。
私たちはSocietyBenchを紹介します。これはエンドツーエンドのベンチマークで、1行のイベントトピックを取り上げ、5つのプラットフォームでWebニュースやソーシャルメディアの投稿を収集します。
質問は2つの100点軸(確率校正と時間精度)でスコアされる。
- 参考スコア(独自算出の注目度): 1.4943316571343976
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs), and the agents built on top of them, are now benchmarked heavily on whether they can finish a task -- fix a bug, drive a browser, operate a GUI. A complementary social ability, namely how well a model understands and forecasts the way real social events unfold, has barely been measured. We introduce SocietyBench, an end-to-end benchmark that takes a one-line event topic, collects Web news and social-media posts across five platforms, distills them into a date-indexed timeline that keeps factual events and a public-opinion layer separate, and then turns every cutoff date on that timeline into an audited bank of forecasting questions. Questions are scored on two orthogonal 100-point axes: probability calibration and temporal accuracy. Before any model sees a timeline, a three-phase procedure replaces every named entity and shifts every date by a per-event constant, turning a real arc into a counterfactual social world -- structurally identical to what happened, but stripped of the surface labels a model could match against pre-training memory. On five heterogeneous events and 125 prediction points in Chinese and English editions, the strongest of six frontier LLMs reaches only 75.0 out of 100, against a trivial anchor of 50. The two axes come apart: a model can be calibration-strong but time-weak, or the reverse. Three agent frameworks built on a shared base model fail to improve on that base, and two model-free heuristics trail every LLM. Per-event gaps reach 21.4 points on a single axis, which is our main argument for evaluating on several events rather than one. All anonymized timelines, question banks, ground truth, and scoring code are released.
- Abstract(参考訳): 大規模言語モデル(LLM)とその上に構築されたエージェントは、バグを修正し、ブラウザを駆動し、GUIを運用するタスクを完了できるかどうか、大きくベンチマークされている。
補完的な社会的能力、すなわち、モデルが実際の社会的事象の展開方法を理解し、予測する方法は、ほとんど測定されていない。
エンドツーエンドのベンチマークであるSocietyBenchを紹介します。これは、1行のイベントトピックを取り、Webニュースとソーシャルメディアのポストを5つのプラットフォームで収集し、それらを日付付きタイムラインに抽出し、事実イベントとパブリックオピニオンレイヤを分離し、そのタイムライン上のすべてのカットオフ日を、予測された質問の監査された銀行にします。
質問は2つの直交100点軸(確率キャリブレーションと時間精度)でスコアされる。
任意のモデルがタイムラインを見る前に、3フェーズのプロシージャは、名前付きエンティティをすべて置き換え、日付ごとに定数をシフトし、実際のアークを反現実的な社会世界に変えます。
中国語版と英語版では5つの異種イベントと125の予測ポイントがあり、最強の6つのフロンティアLSMは100点中75.0点にしか達していない。
2つの軸は分解され、モデルはキャリブレーション・ストロングでもよいが、時間弱、あるいは逆である。
共有ベースモデル上に構築された3つのエージェントフレームワークは、そのベースで改善に失敗し、2つのモデルフリーヒューリスティックスがLLM毎にパスする。
イベントごとのギャップは1軸で21.4ポイントに達します。
匿名化されたタイムライン、質問銀行、地上の真実、スコアコードはすべてリリースされます。
関連論文リスト
- ForecastBench-Sim: A Simulated-World Forecasting Benchmark [11.4807141145402]
ForecastBench-SimはFreecivのゲームロールアウト上に構築されたシミュレーションワールド予測ベンチマークである。
予測者は固定された世界報告を受け取り、隠された将来の国家に関する質問に答える。
世界はシミュレートされているので、同じ設定で連続的または二分予測の質問を生成することができる。
論文 参考訳(メタデータ) (2026-06-17T04:52:41Z) - SURGE: An Event-Centric Social Media Sentiment Time Series Benchmark with Interaction Structure [22.207187269398545]
SURGEは、イベント内の投稿をリンクするテキストとインタラクション構造を整列したイベントレベルの時系列をペアリングする、マルチイベントのソーシャルメディアベンチマークである。
SURGE 上では,数値のみの予測,テキスト拡張予測,高対話評価,残余のカテゴリアウト一般化のためのベンチマークプロトコルを定義する。
論文 参考訳(メタデータ) (2026-05-20T13:59:32Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test [62.17144846428715]
我々は、Embodied Turing Testベンチマーク: WoW-World-Eval (Wow,wo,val)を紹介する。
Wow-wo-valは知覚、計画、予測、一般化、実行の5つのコア能力を調べる。
Inverse Dynamic Model Turing Testでは、まずIMMを用いて、実世界におけるビデオ基盤モデルの実行精度を評価する。
論文 参考訳(メタデータ) (2026-01-07T17:50:37Z) - Inferring Events from Time Series using Language Models [13.414101942484582]
時系列データは、時間とともに環境がどのように変化するかを測定し、金融や医療といった重要な領域における意思決定を促進する。
本研究では,Large Language Models (LLMs) が時系列データから自然言語で記述された事象を推測できるかどうかを初めて検討する。
現在のLLMはいくつかの有望な能力を示しており、OpenAIのo1は最高だが、DS-R1-distill-Qwen-32BはGPT-4oのようなプロプライエタリなモデルより優れている。
論文 参考訳(メタデータ) (2025-03-18T12:07:33Z) - Sundial: A Family of Highly Capable Time Series Foundation Models [47.27032162475962]
Sundialはネイティブでフレキシブルでスケーラブルな時系列基盤モデルのファミリーです。
我々のモデルは、事前の分布を指定せずに事前訓練されており、複数の確率予測を生成することができる。
Sundialは、ジャスト・イン・タイムの推論速度で、ポイントと確率予測ベンチマークの両方で最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-02-02T14:52:50Z) - Promises and Pitfalls of Generative Masked Language Modeling: Theoretical Framework and Practical Guidelines [74.42485647685272]
GMLM(Generative Masked Language Models)に焦点を当てる。
我々は,マルコフ連鎖の入力として使用されるマスキングにより,データ分布の条件付き確率に適合するモデルを訓練し,モデルからサンプルを抽出する。
我々は,T5モデルを並列デコーディングに適応させ,最小品質の犠牲を伴って機械翻訳における2~3倍の高速化を実現した。
論文 参考訳(メタデータ) (2024-07-22T18:00:00Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。