論文の概要: ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge
- arxiv url: http://arxiv.org/abs/2609.12366v1
- Date: Fri, 11 Sep 2026 02:36:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.590242
- Title: ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge
- Title(参考訳): ORQA: LLM専門知識のための職業・リアリスティックな質問・回答フレームワーク
- Authors: Shreyas Krishnan, Serina Chang, Abhishek Nagaraj,
- Abstract要約: ORQAは、大規模言語モデルにおける職業レベルの知識をテストする方法である。
O*NETの職業を信頼された職業特有のウェブサイトに接続する。
自動パイプラインとヒューマンレビューの組み合わせは、高品質な質問のセットを生み出します。
- 参考スコア(独自算出の注目度): 5.218089081443592
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present ORQA, a method for testing occupation-level knowledge in large language models. Prior methods either map abstract LLM skills to occupations via task definitions or utilize expert knowledge which is difficult to obtain at scale and expensive. ORQA complements both of these methods by connecting O*NET occupations to trusted occupation-specific websites (such as regulatory agencies, licensing bodies, professional organizations, and government publications) and converting these into source-traceable question-answer pairs. A combination of an automated pipeline and human review produces a set of high quality questions about occupations. The question set created via our method covers 116 occupations from all 21 major groups in the SOC, with 480 questions sourced from 187 different websites. Each question is designed to probe a real-world skill question that is relevant to the occupation in question. We test 15 state-of-the-art frontier and open-weight models via this method. Claude Opus 4.6, GPT-5.4 and Claude Sonnet 4.6 all perform the best at approximately 58-62% while smaller open-weight models achieve approximately 33-41% performance. Performance varies significantly across occupations. Healthcare-related occupations achieve the highest performance (78%) while Office and Administrative Support achieve approximately 40%. Performance on individual occupations (e.g. Sheet Metal Workers and Fish and Game Wardens) is essentially zero. We also find that open-ended questions and weighting by wage bill do not significantly affect the ranking of models on this benchmark. We believe that leveraging existing trusted occupation-specific information to test LLM knowledge in professional domains may be a scalable and useful method for evaluating occupation-level AI performance in the future. Results and data are available at orqabench.org.
- Abstract(参考訳): 本稿では,職業レベルの知識を大規模言語モデルで検証するORQAを提案する。
従来の手法では、抽象的なLLMスキルをタスク定義を介して職業にマッピングするか、大規模かつ高価で入手が困難な専門家の知識を活用するかのどちらかであった。
ORQAは、O*NETの職業を信頼できる職業に特化したウェブサイト(規制機関、ライセンス機関、専門機関、政府出版物など)に接続し、これらをソース追跡可能な質問応答ペアに変換することによって、これらの手法を補完する。
自動パイプラインとヒューマンレビューの組み合わせは、職業に関する高品質な質問のセットを生み出します。
提案手法を用いて作成した質問セットは,SOCの21の主要グループすべてから116件の職業をカバーし,異なる187のウェブサイトから480件の質問が得られた。
それぞれの質問は、問題の職業に関連する現実世界のスキル質問を探索するように設計されている。
この手法を用いて15の最先端フロンティアおよびオープンウェイトモデルをテストする。
クロード・オプス4.6、GPT-5.4、クロード・ソネット4.6はいずれも58-62%で、より小型のオープンウェイトモデルでは33-41%のパフォーマンスを達成した。
成績は職業によって大きく異なる。
医療関連の職業は最高パフォーマンス(78%)を達成し、オフィスと行政支援はおよそ40%を達成している。
個々の職業(例えば、金属労働者、魚、ゲームウォーデン)のパフォーマンスは基本的にゼロです。
また、オープンエンドの質問や賃金請求による重み付けが、このベンチマークのモデルランキングに大きく影響しないこともわかりました。
我々は、既存の信頼された職業特化情報を活用して専門分野のLLM知識をテストすることは、将来、職業レベルのAIパフォーマンスを評価するためのスケーラブルで有用な方法であると信じている。
結果とデータはorqabench.orgで公開されている。
関連論文リスト
- Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills [86.15447717549154]
私たちは、スキルを創造し、研究中にそれらを使用する、スキル駆動型研究エージェントであるDisCoを紹介します。
私たちはこの欠落したレイヤの運用知識を、メソッドの知識を機能させるのと分離するノウハウと呼んでいる。
論文 参考訳(メタデータ) (2026-09-02T15:49:41Z) - RubberDuckBench: A Benchmark for AI Coding Assistants [5.198865387380684]
RubberDuckBench: コードに関する質問のベンチマークと、回答を評価するための詳細なルーリックを紹介します。
これらの疑問に答える上で,我々は20のLLM(プロパティおよびオープンソース)を多種多様なセットで評価する。
Grok 4 (69.29%)、Claude Opus 4 (68.5%)、GPT-5 (67.8%) は総合的に最高の成績を上げているが、次の9つの最高のパフォーマンスモデルよりも2倍の優位性を示すことはない。
論文 参考訳(メタデータ) (2026-01-23T05:28:48Z) - SPARQL Query Generation with LLMs: Measuring the Impact of Training Data Memorization and Knowledge Injection [81.78173888579941]
大規模言語モデル(LLM)は、質問応答機能の品質を高めるのに適した方法と考えられている。
LLMはWebデータに基づいてトレーニングされており、ベンチマークや知識グラフがトレーニングデータに含まれているかどうかを研究者は制御できない。
本稿では,自然言語質問からSPARQLクエリを生成し,LLMの品質を評価する手法を提案する。
論文 参考訳(メタデータ) (2025-07-18T12:28:08Z) - OccuQuest: Mitigating Occupational Bias for Inclusive Large Language
Models [73.49209444768057]
emphOccuQuestという名前のインストラクションチューニングデータセットを作成し、26の職業カテゴリで1,000以上の職業をカバーする11000以上のプロンプト補完ペアと30,000以上の対話を含む。
次に、OccuQuest上でLLaMAを微調整し、OccuLLaMAを得る。
論文 参考訳(メタデータ) (2023-10-25T10:06:17Z) - OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models [26.590755599827993]
大規模言語モデル(LLM)用に設計された総合的なタスク指向のOpsベンチマークであるOpsEvalを提示する。
このベンチマークには、英語と中国語で7184の質問と1736の質問回答(QA)形式が含まれている。
評価の信頼性を確保するため、何十人ものドメインエキスパートを招待して、質問を手動でレビューします。
論文 参考訳(メタデータ) (2023-10-11T16:33:29Z) - Self-Knowledge Guided Retrieval Augmentation for Large Language Models [59.771098292611846]
大規模言語モデル(LLM)はタスク固有の微調整なしで優れた性能を示す。
検索に基づく手法は、非パラメトリックな世界知識を提供し、質問応答のようなタスクのパフォーマンスを向上させることができる。
SKR(Self-Knowledge guided Retrieval augmentation)は、LLMがこれまで遭遇した質問を参照できるようにする、シンプルで効果的な方法である。
論文 参考訳(メタデータ) (2023-10-08T04:22:33Z) - ExpertQA: Expert-Curated Questions and Attributed Answers [51.68314045809179]
我々は,様々な属性と事実の軸に沿って,いくつかの代表システムからの応答を人為的に評価する。
我々は32分野にわたる484人の被験者から専門家による質問を収集し、同じ専門家に自身の質問に対する反応を評価する。
分析の結果は,32分野にまたがる2177の質問と,回答の検証とクレームの属性を備えた高品質な長文QAデータセットであるExpertQAである。
論文 参考訳(メタデータ) (2023-09-14T16:54:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。