論文の概要: Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge
- arxiv url: http://arxiv.org/abs/2607.01829v1
- Date: Thu, 02 Jul 2026 07:49:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.725059
- Title: Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge
- Title(参考訳): Pre-Flight: 航空操作知識に基づく大規模言語モデル評価ベンチマーク
- Abstract要約: Pre-Flightは、国際標準と空港の地上運用資料から得られた300の選択肢に関するオープンソースのベンチマークである。
Inspect評価フレームワークを用いて、現代の商用およびオープンウェイトモデルの評価を行う。
評価された最強モデルでさえ82.7%に達し、2025年初頭の約75%から徐々に改善されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly proposed for aviation business operations, from documentation and training generation to customer facing assistants. General purpose benchmarks do not measure whether a model reasons safely and correctly about aviation specific operational knowledge, and the high stakes, regulated nature of the domain makes that gap consequential. We present Pre-Flight, an open source benchmark of 300 multiple choice questions drawn from international standards and airport ground operations material, covering international airport ground operations, ICAO and US FAA regulations, aviation general knowledge and complex operational scenarios. Questions were authored and reviewed by practitioners with experience in air traffic management, ground operations and commercial flying. We evaluate a range of contemporary commercial and open weight models using the Inspect evaluation framework, scoring by accuracy under a standard multiple choice protocol, and we maintain the leaderboard on a rolling basis as new models are released. Against an informal expert reference of around 95%, obtained from a low sample quiz of aviation professionals at a conference, even the strongest model evaluated (released in 2026) reaches 82.7%, having improved only gradually from roughly 75% in early 2025. A substantial and persistent gap below expert level reliability therefore remains. We release the dataset, the evaluation harness and the results, and the benchmark is available within the community evaluations package distributed with inspect_evals. We argue that domain specific evaluation of this kind is a necessary precondition for responsible deployment of generative AI in non safety critical aviation operations.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ドキュメントやトレーニング生成から顧客向けアシスタントまで、航空業務のためにますます提案されている。
汎用ベンチマークでは、モデルが航空固有の運用知識に対して安全かつ正確に理由を定めていないことや、ドメインの規制された性質が高いことが、そのギャップを連続させる。
我々は、国際標準と空港地上作戦資料から得られた300の選択肢に関するオープンソースのベンチマークであるPre-Flightについて、国際空港地上作戦、ICAOおよび米国連邦航空局の規制、航空一般知識、複雑な運用シナリオについて紹介する。
航空交通管理、地上作戦、商業飛行の経験のある実践者によって、質問が作成され、レビューされた。
我々は、Inspect評価フレームワークを用いて、標準的な多重選択プロトコルの下での精度による評価を行い、新しいモデルがリリースされるにつれて、リーダーボードをローリングベースで維持する、現代の商業およびオープンウェイトモデルの範囲を評価した。
会議における航空専門家の低いサンプルクイズから得られる95%の非公式な専門家参照に対して、評価された最強のモデル(2026年にリリース)でさえ82.7%に達し、2025年初頭の約75%から徐々に改善している。
そのため、専門家レベルの信頼性よりも相当で永続的なギャップが残っている。
データセット、評価ハーネス、結果をリリースし、ベンチマークはspector_evalsで配布されたコミュニティ評価パッケージ内で利用可能です。
我々は、このタイプのドメイン固有の評価が、非安全クリティカル航空業務における生成AIの責任を負うための前提条件であると主張している。
関連論文リスト
- Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation [141.29138788636013]
任意のエージェントを評価するために80以上のベンチマークを移植するベンチマークアダプタを開発した。
54のベンチマークで,機能レベルにまたがる8モデルの大規模評価を行う。
私たちは29のベンチマークにまたがる82の難易度、多様性、高品質なタスクをキュレートしたHarbor-Indexを紹介します。
論文 参考訳(メタデータ) (2026-09-03T16:26:20Z) - AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment [9.576288529585241]
大型言語モデル(LLM)エージェントは、複雑な決定とタスク実行でフライトクルーを支援することができる。
静的知識を中心とした既存の航空評価は、手続き実行と安全コンプライアンスの体系的なテストをサポートしない。
本稿では,対話型バーチャルコックピットテスト環境と2層航空エージェント評価ベンチマークであるAeroCopilotBenchについて述べる。
論文 参考訳(メタデータ) (2026-08-17T09:53:52Z) - AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning [28.18995637655191]
地上共同推論における視覚言語モデル(VLM)の評価のためのベンチマークであるAeroGroundを紹介する。
AeroGroundは、様々なオープン環境から約29,000のマルチモーダル観測グループを含む、模擬空中地上データセット上に構築されている。
実験では、現在のモデルと人間のパフォーマンスの間に大きなギャップがあり、最良のモデルの平均精度は54.4%、人間は93.3%に達する。
論文 参考訳(メタデータ) (2026-08-12T07:31:15Z) - EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks [0.0]
我々は, 4000人以上の専門家に, この問題に対処する6つのフロンティアLSMの選定を依頼した。
このような結論を抽出する最善の方法は、人間の評価装置を用いて、厳密な統計分析を通じて、その一貫性を慎重に確認することであり、また、実世界のオープンエンド問題に対する主観的根拠真理による評価において、自動測定が不足していることも観察できる。
論文 参考訳(メタデータ) (2026-08-05T07:39:49Z) - From Sentiment to Actionable Insights: A Data-Driven Public Sentiment Analysis of Advanced Air Mobility [0.8749675983608171]
アドバンスト・エアモビリティ(Advanced Air Mobility, AAM)は、低高度航空輸送システムである。
AAMに対する大衆の感情を理解することは、社会的障壁を特定し、採用戦略を伝えるために不可欠である。
本研究では、RedditとQuoraから収集した306,009個の人文テキストを分析し、AIベースのモデルを用いてAAMに関する公開談話を調べる。
論文 参考訳(メタデータ) (2026-06-18T03:07:47Z) - ACCORD: Action-Conditioned Contextual Grounding for Language Agents [69.73525608707764]
ACCORD(Action-Conditioned Contextual Grounding)は、適応的なグラウンドのためのエージェントフレームワークである。
現状のエージェントは、しばしばそうすることができないことを示す。それらは、観察された特定の情報よりもむしろ仮定から行動し、収集した可能性のある情報を見落とし、既に返された証拠を組み込むことに失敗する。
論文 参考訳(メタデータ) (2026-06-15T09:05:55Z) - Towards Automated Air Traffic Safety Assessment Around Non-Towered Airports Using Large Language Models [37.909132464953196]
大型言語モデル(LLM)を用いた空港の飛行後安全分析の枠組みについて検討する。
自然言語における転写CTAF無線通信を解析するための汎用視覚言語モデル(VLM)を提案する。
我々は,Gemini 2.5 Proを用いて,実際の飛行データに関する枠組みを質的に評価し,権利侵害の正確な識別を実証した。
論文 参考訳(メタデータ) (2026-05-12T16:15:15Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning [53.065247112514534]
ATLASは、現実世界の旅行計画タスクにおける制約意識の複雑な性質を扱うために設計された汎用マルチエージェントフレームワークである。
我々はTravelPlannerベンチマークで最先端のパフォーマンスを示し、最終パスレートを23.3%から44.4%に改善した。
論文 参考訳(メタデータ) (2025-09-29T23:23:52Z) - PentestJudge: Judging Agent Behavior Against Operational Requirements [0.0]
PentestJudgeは、侵入テストエージェントの操作を評価するシステムである。
判定エージェントとして機能するモデルをいくつか評価し、最良のモデルがF1スコア0.83まで到達した。
論文 参考訳(メタデータ) (2025-08-04T21:52:50Z) - Is BERTopic Better than PLSA for Extracting Key Topics in Aviation Safety Reports? [0.0]
本研究は,航空安全レポートから有意義なトピックを抽出する上で,BERTopic と Probabilistic Latent Semantic Analysis (PLSA) の有効性を比較した。
2000年から2020年にかけてのNTSB(National Transportation Safety Board)のデータセットを使用して、BERTopicはトランスフォーマーベースの埋め込みと階層的なクラスタリングを採用した。
その結果, BERTopicはPLSAのトピックコヒーレンスに優れ, PLSA 0.37に比べてCvスコア0.41の成績を示した。
論文 参考訳(メタデータ) (2025-05-30T19:27:11Z) - Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering [87.76784654371312]
Embodied Question Answeringでは、エージェントが動的に3D環境を探索し、視覚情報を積極的に収集し、質問に答えるために多段階の推論を行う必要がある。
既存のデータセットはしばしばバイアスや事前の知識を導入し、非身体的推論につながる。
探索能力と推論能力の両方を評価するために特別に設計された最大のデータセットを構築します。
論文 参考訳(メタデータ) (2025-03-14T06:29:47Z) - On the Generalization Properties of Deep Learning for Aircraft Fuel Flow Estimation Models [2.7336487680215815]
本稿では,燃料消費予測におけるディープラーニングモデルの一般化能力について検討する。
本稿では,ニューラルネットワークアーキテクチャとドメイン一般化技術を統合する新しい手法を提案する。
以前は目に見えない航空機に対して、航空機へのノイズの導入とエンジンパラメーターはモデルの一般化を改善した。
論文 参考訳(メタデータ) (2024-10-10T08:34:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。