論文の概要: ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
- arxiv url: http://arxiv.org/abs/2603.22763v1
- Date: Tue, 24 Mar 2026 03:47:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.287351
- Title: ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
- Title(参考訳): ENC-Bench:電子ナビゲーションチャート理解のためのマルチモーダル大言語モデル評価ベンチマーク
- Authors: Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu,
- Abstract要約: ENC-Benchは、プロのEMC理解に特化した最初のベンチマークである。
ENC-Benchは840個のNOAA ENCから20,490個の専門家検証されたサンプルを含んでいる。
我々は、ゼロショットプロトコルを統一した10の最先端MLLMを評価する。
- 参考スコア(独自算出の注目度): 15.389211077659771
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Electronic Navigational Charts (ENCs) are the safety-critical backbone of modern maritime navigation, yet it remains unclear whether multimodal large language models (MLLMs) can reliably interpret them. Unlike natural images or conventional charts, ENCs encode regulations, bathymetry, and route constraints via standardized vector symbols, scale-dependent rendering, and precise geometric structure -- requiring specialized maritime expertise for interpretation. We introduce ENC-Bench, the first benchmark dedicated to professional ENC understanding. ENC-Bench contains 20,490 expert-validated samples from 840 authentic National Oceanic and Atmospheric Administration (NOAA) ENCs, organized into a three-level hierarchy: Perception (symbol and feature recognition), Spatial Reasoning (coordinate localization, bearing, distance), and Maritime Decision-Making (route legality, safety assessment, emergency planning under multiple constraints). All samples are generated from raw S-57 data through a calibrated vector-to-image pipeline with automated consistency checks and expert review. We evaluate 10 state-of-the-art MLLMs such as GPT-4o, Gemini 2.5, Qwen3-VL, InternVL-3, and GLM-4.5V, under a unified zero-shot protocol. The best model achieves only 47.88% accuracy, with systematic challenges in symbolic grounding, spatial computation, multi-constraint reasoning, and robustness to lighting and scale variations. By establishing the first rigorous ENC benchmark, we open a new research frontier at the intersection of specialized symbolic reasoning and safety-critical AI, providing essential infrastructure for advancing MLLMs toward professional maritime applications.
- Abstract(参考訳): 電子航法チャート(Electronic Navigational Charts、ENCs)は、現代の海洋航法において安全に重要なバックボーンであるが、マルチモーダル大規模言語モデル(MLLMs)がそれらを確実に解釈できるかどうかは不明である。
自然画像や従来のチャートとは異なり、ECCは標準化されたベクトルシンボル、スケール依存のレンダリング、正確な幾何学的構造を通じて、規則、水位測定、ルート制約をエンコードしている。
ENC-Benchは、プロのEMC理解に特化した最初のベンチマークである。
ENC-Benchは、認証(シンボルと特徴認識)、空間推論(コーディネート・ローカライゼーション、ベアリング、距離)、海洋決定(複数の制約の下での緊急計画)という3段階の階層に組織された840の国立海洋大気庁(NOAA)から20,490人の専門家によって検証されたサンプルを含んでいる。
すべてのサンプルは、自動整合性チェックと専門家レビューを備えたキャリブレーションベクター・ツー・イメージパイプラインを通じて生のS-57データから生成される。
GPT-4o, Gemini 2.5, Qwen3-VL, InternVL-3, GLM-4.5V などの10種類の最先端MLLMを統一ゼロショットプロトコルで評価した。
最良のモデルは47.88%の精度しか達成せず、シンボリックグラウンド、空間計算、多重制約推論、照明とスケールの変動に対する堅牢性といった体系的な課題がある。
最初の厳格なEMCベンチマークを確立することで、特別な象徴的推論と安全クリティカルなAIの交差点に新たな研究フロンティアを開き、MLLMをプロの海洋アプリケーションに向けて前進させるために必要なインフラを提供します。
関連論文リスト
- One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation [18.529673835965745]
ナビゲート可能なエージェントは、高いレベルの意味的指示と正確な空間知覚の両方を理解する必要がある。
本稿では,低レベルの空間状態推定と高レベルのセマンティックプランニングを分離する疎結合設計を提案する。
我々はシミュレートされた環境と実世界の環境の両方で包括的な実験を行う。
論文 参考訳(メタデータ) (2026-02-17T07:13:48Z) - LiM-YOLO: Less is More with Pyramid Level Shift and Normalized Auxiliary Branch for Ship Detection in Optical Remote Sensing Imagery [3.2425852744760184]
LiM-YOLOは、ドメイン固有の競合を解決するために設計された特殊な検出器である。
船舶の規模を統計的に分析し,検出ヘッドをP2-P4に緩和するピラミッドレベルシフト戦略を導入する。
LiM-YOLOは最先端モデルに比べて検出精度と効率が優れている。
論文 参考訳(メタデータ) (2025-12-10T14:48:58Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios [3.099103925863002]
UAVBenchは、大規模言語モデル(LLM)によって生成されたUAV飛行シナリオのオープンベンチマークベンチマークである。
UAVBench_MCQは,10の認知的・倫理的推論スタイルにまたがる5万の多重選択質問を含む推論指向の拡張である。
GPT-5, ChatGPT-4o, Gemini 2.5 Flash, DeepSeek V3, Q3wenwenB, ERNIE 4.5 300B を含む32 の最先端 LLM を評価し, 認識・政策推論において高い性能を示した。
論文 参考訳(メタデータ) (2025-11-14T12:51:48Z) - A Modular, Data-Free Pipeline for Multi-Label Intention Recognition in Transportation Agentic AI Applications [12.25149118082394]
輸送におけるエージェントAIアプリケーションに対して,マルチラベル意図認識のためのモジュール型データフリーパイプラインを提案する。
大規模で注釈付きコーパスに依存する従来の意図認識システムとは異なり、当社のアプローチはコストのかかるデータ収集の必要性を排除している。
我々のシステムはユーザクエリをタスク固有のモジュールにシームレスにルーティングし、完全な自律的意図認識エージェントの基盤となる。
論文 参考訳(メタデータ) (2025-11-05T11:08:08Z) - Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond [116.65158801881984]
MLLMの表情推論能力の向上を目的とした後学習戦略を提案する。
We developed a unified and interpretable FER foundation model called UniFER-7B。
論文 参考訳(メタデータ) (2025-11-01T03:53:00Z) - CMT: A Cascade MAR with Topology Predictor for Multimodal Conditional CAD Generation [59.76687657887415]
境界表現(B-Rep)に基づくCAD生成のための最初のマルチモーダルフレームワークであるトポロジ予測器(CMT)を用いたカスケードMARを提案する。
具体的には、カスケードMARは、B-Repsに必須のエッジカウンタ面の先行情報を効果的にキャプチャすることができる。
マルチモーダルアノテーション付きB-Repモデルを含む大規模マルチモーダルCADデータセットmmABCを開発した。
論文 参考訳(メタデータ) (2025-04-29T14:52:28Z) - SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models [15.50826328938879]
視覚言語モデル(VLM)の空間的推論能力を評価するためのベンチマークであるSURDSを紹介する。
nuScenesデータセットに基づいて構築されたSURDSは、41,080の視覚要求回答トレーニングインスタンスと9,250の評価サンプルで構成されている。
本研究では,空間的に接地された報酬信号を利用した強化学習に基づくアライメント手法を提案する。
論文 参考訳(メタデータ) (2024-11-20T08:14:01Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - SEA: Bridging the Gap Between One- and Two-stage Detector Distillation
via SEmantic-aware Alignment [76.80165589520385]
細粒度情報を抽象化する性質から,SEA (SEmantic-Aware Alignment) 蒸留法を命名した。
1段検出器と2段検出器の両方において、挑戦的な物体検出タスクにおいて、最先端の新たな結果が得られる。
論文 参考訳(メタデータ) (2022-03-02T04:24:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。