論文の概要: BenCSSmark: Making the Social Sciences Count in LLM Research
- arxiv url: http://arxiv.org/abs/2605.04886v1
- Date: Wed, 06 May 2026 13:20:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.830763
- Title: BenCSSmark: Making the Social Sciences Count in LLM Research
- Title(参考訳): BenCSSmark: LLM研究における社会科学のカウント化
- Abstract要約: 計算社会科学者によって注釈付けされたデータセットからなるベンチマークであるBenCSSmarkを紹介する。
BenCSSmarkは、社会的科学的視点をベンチマークに組み込むことで、より堅牢で透明で、社会的に関係のあるAIシステムを促進することを目指している。
- 参考スコア(独自算出の注目度): 4.600406541537971
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This position paper argues that the under-representation of social science tasks in contemporary LLM benchmarks limits advances in both LLM evaluation and social scientific inquiry. Benchmarks -- standardized tools for assessing computational systems -- are pivotal in the development of artificial intelligence (AI), including large language models (LLMs). Benchmarks do more than measure progress -- they actively structure it, shaping reputations, research agendas, and commercial outcomes. Despite this central role, the social sciences are largely absent from mainstream evaluation frameworks, even though scholars in these fields generate dozens of rigorously annotated, context-sensitive datasets each year. Integrating this work into benchmark design could significantly improve the generalization and robustness of AI models. In turn, models trained on social scientific tasks would likely yield better performance on classic and contemporary tasks in disciplines as diverse as history, sociology, political science or economics. This is all the more pressing as these disciplines are quickly turning to LLMs for assistance. To address this gap, we introduce BenCSSmark, a benchmark composed of datasets annotated by computational social scientists. By integrating social scientific perspectives into benchmarking, BenCSSmark seeks to promote more robust, transparent, and socially relevant AI systems and to foster efficient collaboration.
- Abstract(参考訳): 本稿では,現代LLMベンチマークにおける社会科学課題の表現不足が,LLM評価と社会科学調査の両面での進歩を制限することを主張する。
ベンチマーク -- 計算システムを評価するための標準化されたツール -- は、大規模言語モデル(LLM)を含む人工知能(AI)の開発において重要な要素である。
ベンチマークは進捗を測る以上のことをする -- 積極的に構成し、評判、研究課題、商業的な成果を形作る。
この中心的な役割にもかかわらず、社会科学は主流評価の枠組みを欠いているが、これらの分野の学者は毎年何十もの厳密な注釈付き文脈に敏感なデータセットを生成する。
この作業をベンチマーク設計に統合することで、AIモデルの一般化と堅牢性を大幅に向上させることができる。
逆に、社会科学的タスクで訓練されたモデルは、歴史、社会学、政治科学、経済学など様々な分野の古典的および現代的タスクにおいて、より良いパフォーマンスをもたらす可能性が高い。
これらの規律は、すぐにLLMに助けを求めています。
このギャップに対処するために、計算社会科学者によって注釈付けされたデータセットからなるベンチマークであるBenCSSmarkを紹介する。
BenCSSmarkは、社会的科学的視点をベンチマークに組み込むことで、より堅牢で透明で社会的に関連するAIシステムを促進し、効率的なコラボレーションを促進することを目指している。
関連論文リスト
- Knowing Your Uncertainty -- On the application of LLM in social sciences [37.703249716862054]
大規模言語モデル(LLM)は、計算社会科学研究に急速に統合されている。
本稿では, LLMを社会科学的タスクに適用するには, 不確実性を明確に評価する必要があると論じる。
論文 参考訳(メタデータ) (2025-12-05T06:36:15Z) - SocialEval: Evaluating Social Intelligence of Large Language Models [70.90981021629021]
ソーシャルインテリジェンス(英語版) (SI) は、社会的目標を達成するために社会的相互作用をナビゲートする際に賢明に行動する対人能力を持つ人間を装備する。
結果指向の目標達成評価とプロセス指向の対人能力評価という,運用評価パラダイムを提示する。
スクリプトベースのバイリンガルSIベンチマークであるSocialEvalを提案する。
論文 参考訳(メタデータ) (2025-06-01T08:36:51Z) - How Social is It? A Benchmark for LLMs' Capabilities in Multi-user Multi-turn Social Agent Tasks [6.487500253901779]
大規模言語モデル(LLM)は、マルチユーザ、マルチターンソーシャルエージェントタスクにおいて役割を果たす。
我々は LLM の社会的能力を評価するために, 新たなベンチマーク "How Social Is It" (以下 HSII と呼ぶ) を提案する。
HSIIは、フォーマット解析、ターゲット選択、ターゲット切替会話、安定した会話の4段階から構成され、LLMのコミュニケーションとタスク完了能力を総合的に評価する。
論文 参考訳(メタデータ) (2025-04-04T08:59:01Z) - IdeaBench: Benchmarking Large Language Models for Research Idea Generation [19.66218274796796]
大規模言語モデル(LLM)は、人々が人工知能(AI)システムと対話する方法を変革した。
包括的データセットと評価フレームワークを含むベンチマークシステムであるIdeanBenchを提案する。
私たちのデータセットは、さまざまな影響力のある論文のタイトルと要約と、参照された作品で構成されています。
まず、GPT-4oを用いて、新規性や実現可能性などのユーザ固有の品質指標に基づいて、アイデアをランク付けし、スケーラブルなパーソナライズを可能にする。
論文 参考訳(メタデータ) (2024-10-31T17:04:59Z) - Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence [5.147767778946168]
我々は、23の最先端のLarge Language Models (LLMs)ベンチマークを批判的に評価する。
私たちの研究は、バイアス、真の推論、適応性、実装の不整合、エンジニアリングの複雑さ、多様性、文化的およびイデオロギー規範の見落としなど、重大な制限を明らかにしました。
論文 参考訳(メタデータ) (2024-02-15T11:08:10Z) - SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents [107.4138224020773]
人工エージェントと人間との複雑な社会的相互作用をシミュレートするオープンエンド環境であるSOTOPIAを提案する。
エージェントは、複雑な社会的目標を達成するために協調し、協力し、交換し、互いに競い合う。
GPT-4は,人間よりも目標達成率が著しく低く,社会的常識的推論や戦略的コミュニケーション能力の発揮に苦慮していることがわかった。
論文 参考訳(メタデータ) (2023-10-18T02:27:01Z) - Training Socially Aligned Language Models on Simulated Social
Interactions [99.39979111807388]
AIシステムにおける社会的アライメントは、確立された社会的価値に応じてこれらのモデルが振舞うことを保証することを目的としている。
現在の言語モデル(LM)は、トレーニングコーパスを独立して厳格に複製するように訓練されている。
本研究は,シミュレートされた社会的相互作用からLMを学習することのできる,新しい学習パラダイムを提案する。
論文 参考訳(メタデータ) (2023-05-26T14:17:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。