論文の概要: EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks
- arxiv url: http://arxiv.org/abs/2608.04549v1
- Date: Wed, 05 Aug 2026 07:39:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.774795
- Title: EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks
- Title(参考訳): ユーロエクステック:先進国向け言語モデル、欧州の幹部決定で専門家の判断に届かず
- Authors: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro,
- Abstract要約: 我々は, 4000人以上の専門家に, この問題に対処する6つのフロンティアLSMの選定を依頼した。
このような結論を抽出する最善の方法は、人間の評価装置を用いて、厳密な統計分析を通じて、その一貫性を慎重に確認することであり、また、実世界のオープンエンド問題に対する主観的根拠真理による評価において、自動測定が不足していることも観察できる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier LLMs are increasingly put to use on open-ended complex questions, different in nature from the ones they are typically evaluated on. We dedicate more than 4,000 human expert hours to evaluate a selection of six frontier LLMs on a member of this class of problems: EuroExec, our introduced human expert-based benchmark composed of 413 open-ended long-form European executive tasks authored by 47 vetted domain experts, each question drawn from experience in a real case. Every response is manually evaluated through a multi-attribute rubric, an item-specific checklist of requirements, and a preference rank ordering, extracting an aggregate metric "Solve Rate". The strongest model solves only 56.9% of tasks, while expert-written reference answers judged blindly are solved at near-ceiling levels and are preferred over every model response in 74% of direct rankings, placing frontier generative systems well below the professional standard of work they are already used for. We see that the best way to extract this kind of conclusion is by employing human evaluators, carefully checking their consistency through rigorous statistical analysis, and observe that automatic measurements also fall short when evaluating on this case of real-world open-ended problems with a subjective ground truth.
- Abstract(参考訳): 最前線のLSMは、一般に評価されるものとは異なる、オープンエンドの複雑な質問で使われることが増えています。
エウロエク(EuroExec)は、47の審査済みドメインエキスパートによって書かれた413のオープンエンドのロングフォームヨーロッパエグゼクティブタスクで構成され、実際のケースでの経験から各質問が引き出された。
各応答は、複数属性のルーブリック、要件の項目固有のチェックリスト、優先ランクの順序付けを通じて手動で評価され、総量"ソルブレート"を抽出する。
最強のモデルは56.9%のタスクしか解決しないが、専門家による参照回答は盲目で判断され、直接ランク付けの74%で全てのモデル応答よりも好まれる。
このような結論を抽出する最善の方法は、人間の評価装置を用いて、厳密な統計分析を通じて、その一貫性を慎重に確認することであり、また、実世界のオープンエンド問題に対する主観的根拠真理による評価において、自動測定が不足していることも観察できる。
関連論文リスト
- SemEval-2026 Task 7: Everyday Knowledge Across Diverse Languages and Cultures [93.36078244548077]
タスクデータは、手動で構築したBLEnDベンチマーク(Myung et al. 2024)の拡張バージョンで構成され、30以上の言語培養ペアをカバーする。
このタスクは厳密に評価のために設計されているため、参加者はトレーニング、微調整、数発の学習、その他のモデル修正のためにデータを使用することは許されなかった。
その結果を報告し、最も優れたシステムと最も広く採用されているアプローチについて分析する。
論文 参考訳(メタデータ) (2026-05-04T13:49:44Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation [32.5154721488471]
LLM(Large Language Models)は、従来のベンチマークで高い性能を示す。
既存のフレームワークは、狭いドメインカバレッジ、ジェネラリストのタスクへの依存、あるいは自己評価バイアスに悩まされている。
XpertBench(英語版)は、真の専門分野にわたるLSMを評価するために開発された高忠実度ベンチマークである。
論文 参考訳(メタデータ) (2026-03-27T11:28:15Z) - DEER: A Comprehensive and Reliable Benchmark for Deep-Research Expert Reports [49.217247659479476]
ディープリサーチシステムは、多段階の推論とエビデンスベースの合成を通じて専門家レベルのレポートを生成することができる。
既存のベンチマークは、エキスパートレポートの体系的な基準を欠いていることが多い。
専門家レベルのディープリサーチレポートを評価するためのベンチマークであるDEERを紹介する。
論文 参考訳(メタデータ) (2025-12-19T16:46:20Z) - PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional Reasoning [18.32501228579171]
Professional Reasoning Bench (PRBench) は、ファイナンス・アンド・ローにおける現実的な問題の現実的で、オープンで、困難なベンチマークである。
私たちは1,100人の専門家によるタスクと19,356人の専門家による基準をオープンソース化しました。
論文 参考訳(メタデータ) (2025-11-14T18:55:12Z) - OutboundEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Outbound Evaluation of Xbench's Professional-Aligned Series [36.88936933010042]
OutboundEvalは、インテリジェントなアウトバウンドコールシナリオにおいて、大きな言語モデル(LLM)を評価するための包括的なベンチマークである。
6つの主要なビジネスドメインと30の代表的なサブシナリオにまたがるベンチマークを設計します。
本稿では,タスク実行の正確性,専門知識の適用性,適応性,ユーザエクスペリエンスの質を評価するために,タスクのバリエーションに適応する動的評価手法を提案する。
論文 参考訳(メタデータ) (2025-10-24T08:27:58Z) - LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads? [5.835205320809048]
LiveOIBenchは403のOlympiadレベルの競合プログラミング問題と60のエキスパート設計テストケースを特徴とするベンチマークである。
この問題は2023年から2025年の間に行われた、72の公式のインフォマティクス・オリンピアード(英語版)から直接引き起こされている。
LiveOIBenchは,詳細なサブタスクと広範なプライベートテストケースを備えた,厳密にキュレートされた高品質なタスクという,4つの重要な機能を通じて,自分自身を区別する。
論文 参考訳(メタデータ) (2025-10-10T17:54:24Z) - SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories [55.161075901665946]
Superは、機械学習(ML)と自然言語処理(NLP)の研究リポジトリを扱う研究者が直面する現実的な課題を捉えることを目的としている。
本ベンチマークでは,注釈付きエキスパートソリューションを用いたエンドツーエンド問題45,特定の課題に焦点をあてたエキスパートソリューションから導いた152,大規模開発のための602の問題を自動生成する。
我々は、最先端のアプローチが、最良のモデル(GPT-4o)でこれらの問題を解決するのに苦労していることを示し、エンド・ツー・エンドの16.3%と46.1%のシナリオを解決した。
論文 参考訳(メタデータ) (2024-09-11T17:37:48Z) - ExpertQA: Expert-Curated Questions and Attributed Answers [51.68314045809179]
我々は,様々な属性と事実の軸に沿って,いくつかの代表システムからの応答を人為的に評価する。
我々は32分野にわたる484人の被験者から専門家による質問を収集し、同じ専門家に自身の質問に対する反応を評価する。
分析の結果は,32分野にまたがる2177の質問と,回答の検証とクレームの属性を備えた高品質な長文QAデータセットであるExpertQAである。
論文 参考訳(メタデータ) (2023-09-14T16:54:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。