論文の概要: Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning
- arxiv url: http://arxiv.org/abs/2607.16057v2
- Date: Tue, 21 Jul 2026 00:25:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.278242
- Title: Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning
- Title(参考訳): ビジネス分野におけるフロンティアAIのパフォーマンス--知識労働と分析的推論のケーススタディ付きベンチマーク
- Abstract要約: 大規模言語モデル(LLM)は、ベンチマークスコアに反映されるように、急速に改善されている。
十分に測定されていないのは、ホワイトカラーのプロフェッショナルが毎日行う分析知識に関するAIの進歩だ。
BusinessCaseBenchは18の分野にわたるビジネスケースから引き出された数百の質問にまたがるベンチマークである。
- 参考スコア(独自算出の注目度): 31.30983543437293
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are improving rapidly as reflected in benchmark scores, yet these AI benchmarks largely test capabilities such as factual recall, narrow question answering, mathematical problem-solving, and coding and agentic tool-use. What remains poorly measured is AI progress on the analytical knowledge work white-collar professionals perform daily, including synthesizing complex information, exercising judgment under uncertainty and incomplete information, applying strategic and adversarial thinking in multi-stakeholder settings, weighing trade-offs, and producing defensible, structured analyses. This gap is even more pronounced for subjective components of such work, where success can be challenging to define. The "case method" form of education practiced by top business schools provides a natural foundation for addressing this measurement gap, and we construct BusinessCaseBench, a benchmark spanning hundreds of questions drawn from business cases across eighteen disciplines, each paired with a grading rubric derived from the expert-written instructor case solution. On BusinessCaseBench, frontier AI models already score highly against instructor rubrics, and capability within one model family improves substantially over two years. These results provide strong evidence that AI performance on this class of work is already high and rapidly improving, with implications for business schools, where case pedagogy trains undergraduates and MBAs in this kind of analytical reasoning, and for entry-level professional roles, where such skills have historically anchored early-career work.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ベンチマークスコアに反映されるように急速に改善されているが、これらのAIベンチマークは、事実的リコール、狭い質問応答、数学的問題解決、コーディングとエージェントツールの使用など、主にテスト機能をテストする。
ホワイトカラーの専門家は、複雑な情報の合成、不確実性と不完全な情報による判断の行使、マルチステークホルダー設定における戦略的および敵対的思考の適用、トレードオフの重み付け、防御可能な構造化された分析など、分析的知識の業務におけるAIの進歩が依然として不十分である。
このギャップは、そのような仕事の主観的なコンポーネントに対してさらに顕著であり、成功を定義するのが困難である。
トップビジネススクールが実施する「ケースメソッド」形式の教育は、この測定ギャップに対処するための自然な基盤を提供し、ビジネスケースベンチ(BusinessCaseBench)を構築します。
BusinessCaseBenchでは、フロンティアAIモデルはすでにインストラクターのルーリックに対して高いスコアを得ており、1つのモデルファミリー内の能力は2年以上にわたって大幅に改善されている。
これらの結果は、このクラスのAIのパフォーマンスが既に高く、急速に向上していることを示す強力な証拠となり、ビジネススクールでは、このような分析的推論において、学部生やMBAの教育訓練や、そのようなスキルが昔から早期キャリアの仕事を支えてきたエントリーレベルの専門職に影響を及ぼす。
関連論文リスト
- Transferable Expertise for Autonomous Agents via Real-World Case-Based Learning [6.277598389891074]
本稿では,過去のタスクから経験を再利用可能な知識資産に変換するケースベースの学習フレームワークを提案する。
事前訓練された知識や静的なプロンプトに基づく手法とは異なり、我々のフレームワークはタスク関連知識の抽出と再利用に重点を置いている。
論文 参考訳(メタデータ) (2026-04-14T13:31:47Z) - AIDABench: AI Data Analytics Benchmark [62.45908988324612]
AIDABenchは、複雑なデータ分析タスクのAIシステムをエンドツーエンドで評価するためのベンチマークである。
AIDABenchは、質問応答、データビジュアライゼーション、ファイル生成という3つのコア機能ディメンションにまたがる600以上の多様なドキュメント分析タスクを含んでいる。
AIDABenchの11の最先端モデルを評価し、プロプライエタリ(Claude Sonnet 4.5、Gemini 3 Pro Previewなど)とオープンソース(Qwen3-Max-2026-01-23-Thinkingなど)の両方を対象とする。
論文 参考訳(メタデータ) (2026-02-27T08:58:05Z) - Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study [0.9424565541639368]
化学領域における大規模言語モデルの構成的推論能力を評価するために,キュレートされたデータセットと定義された評価プロセスからなる新しいベンチマークを導入する。
我々の手法はOpenAI推論モデルと名前付きエンティティ認識(NER)システムを統合し、最近の文献から化学物質を抽出し、外部知識ベースで拡張して知識グラフを形成する。
実験により, 最先端モデルでさえ, マルチホップ構成推論において重要な課題に直面していることが明らかとなった。
論文 参考訳(メタデータ) (2025-04-23T04:36:19Z) - Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1) [66.51642638034822]
推論は人間の知性の中心であり、多様なタスクにまたがる構造化された問題解決を可能にする。
大規模言語モデル(LLM)の最近の進歩は、算術、常識、記号領域における推論能力を大幅に向上させてきた。
本稿では,テキストおよびマルチモーダルLLMにおける推論手法の簡潔かつ洞察に富んだ概要について述べる。
論文 参考訳(メタデータ) (2025-04-04T04:04:56Z) - Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation [2.2241228857601727]
本稿では,定量的なベンチマーク手法の欠点を論じる,約100の学術研究の学際的メタレビューを示す。
これは、より広範な社会技術的問題を伴うベンチマークの設計と適用において、多くのきめ細かい問題をもたらす。
レビューではまた、不正なインセンティブ、妥当性の問題の構築、未知の未知、ベンチマーク結果のゲームに関する問題など、現在のプラクティスにおける一連のシステム的欠陥についても取り上げている。
論文 参考訳(メタデータ) (2025-02-10T15:25:06Z) - Evaluation of OpenAI o1: Opportunities and Challenges of AGI [100.85218639544654]
o1-previewは目覚ましい能力を示し、しばしば人間レベルまたは優れたパフォーマンスを実現した。
このモデルは、様々な分野にわたる複雑な推論と知識の統合を必要とするタスクに優れていた。
総合的な結果は、人工知能への大きな進歩を示している。
論文 参考訳(メタデータ) (2024-09-27T06:57:00Z) - AR-LSAT: Investigating Analytical Reasoning of Text [57.1542673852013]
テキストの分析的推論の課題を研究し、1991年から2016年までのロースクール入学試験からの質問からなる新しいデータセットを紹介します。
我々は,この課題をうまくこなすために必要な知識理解と推論能力を分析する。
論文 参考訳(メタデータ) (2021-04-14T02:53:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。