論文の概要: LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios
- arxiv url: http://arxiv.org/abs/2609.09790v1
- Date: Wed, 09 Sep 2026 06:42:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.921076
- Title: LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios
- Title(参考訳): LogiScope-VQA:産業シナリオにおけるロジスティックス同定のためのビジョンランゲージモデルのベンチマーク
- Abstract要約: LogiScope-VQAは、2,476枚の画像と、2,918本の動画で構成され、主に現実世界の物流公園から供給されている。
18のコアオブジェクトと20のリスクタイプを基盤として,産業的要素認識,倉庫の知識理解,潜在的なリスク推論という3つの主要なテーマに沿った39のサブタスクを考案した。
大規模な実験では、GPT-5.5、Gemini-3.1-Pro、Claude-Opus-4.7といった強力なプロプライエタリなモデルでさえ、人間のパフォーマンスに対して大きな差があることが示されている。
- 参考スコア(独自算出の注目度): 6.531830438566794
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Multimodal Models (LMMs) large-scale deployment in industrial warehouse settings specifically necessitates that models exhibit human-expert-level hazard-oriented perception, understanding, and reasoning capabilities. However, the scarcity of real industrial data, tightly coupled to commercial terms, significantly hampers further advancement. To bridge this gap, we curate LogiScope-VQA to investigate the practical applicability of mainstream LMMs in real-world logistics operations. LogiScope-VQA comprises 2,476 images and 2,918 videos primarily sourced from real-world logistics parks, along with 10,274 VQAs meticulously curated and validated by human annotators. Grounded in 18 core objects and 20 risk types, we devise 39 subtasks aligned with three principal themes: industrial element perception, warehouse knowledge understanding, and potential risk reasoning. Furthermore, we incorporate dynamic thinking-budget configurations and dual-dimensional risk bias analyses to elucidate the properties of LMMs. Extensive experiments unveil that even powerful proprietary models, including GPT-5.5, Gemini-3.1-Pro, and Claude-Opus-4.7, exhibit a significant gap relative to human performance. The unique challenge of jointly integrating perception, understanding, and reasoning for hazard identification poses substantial headroom for further improvement on LogiScope-VQA. We additionally reveal the pervasive security bias issue that impedes LLMs' practical deployment in real-world settings. The industrial dataset is publicly available under the CC BY-NC-SA 4.0 license.
- Abstract(参考訳): 大規模マルチモーダルモデル (LMM) 産業倉庫における大規模展開は、人間の専門レベルのハザード指向の認識、理解、推論能力を示すモデルを必要とする。
しかし、商業用語と密接に結びついた実際の産業データの不足は、さらなる進歩を著しく妨げた。
このギャップを埋めるため,我々はLogiScope-VQAをキュレートし,現実の物流業務における主流LMMの実用性について検討する。
LogiScope-VQAは、2,476枚の画像と2,918本のビデオで構成されており、実際のロジスティクスパークから主に供給されている。
18のコアオブジェクトと20のリスクタイプを基盤として,産業的要素認識,倉庫の知識理解,潜在的なリスク推論という3つの主要なテーマに沿った39のサブタスクを考案した。
さらに,LMMの特性を解明するために,動的思考予算構成と2次元リスクバイアス分析を取り入れた。
大規模な実験では、GPT-5.5、Gemini-3.1-Pro、Claude-Opus-4.7といった強力なプロプライエタリなモデルでさえ、人間のパフォーマンスに対して大きな差があることが示されている。
認知、理解、そして危険識別のための推論を共同で統合するというユニークな課題は、LogiScope-VQAをさらに改善するために、かなりのヘッドルームを生じさせる。
また,LLMの現実的な展開を阻害するセキュリティバイアスの問題も明らかにした。
産業データセットはCC BY-NC-SA 4.0ライセンスで公開されている。
関連論文リスト
- Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines [50.471211036005286]
大規模マルチモーダル・インダストリアル・オープン・クローズド・ベンチマーク(MMIOC-1M)を導入する。
MMIOC-1Mは、オープンボキャブラリとクローズドセットの工業検出をサポートする最初の統一された最大のベンチマークである。
本稿では,3つの重要なイノベーションを取り入れたRTVPNetを提案する。
論文 参考訳(メタデータ) (2026-06-06T03:06:10Z) - IndustryAssetEQA: A Neurosymbolic Operational Intelligence System for Embodied Question Answering in Industrial Asset Maintenance [2.4078554988694183]
エピソードテレメトリ表現とフェールモード効果分析知識グラフ(FMEA-KG)を組み合わせたニューロシンボリックオペレーショナルインテリジェンスシステムであるIndustrialAssetEQAを提案する。
本研究では, 回転機械, ターボファンエンジン, 油圧システム, サイバー物理生産システムを含む4種類の産業資産について検討した。
IndustryAssetEQA は、構造的妥当性を最大 0.51 まで改善し、対実的精度を最大 0.47 まで改善し、説明的含意を 0.64 まで改善し、専門家評価の厳しい誇張を 28% から 2% に減らした。
論文 参考訳(メタデータ) (2026-04-25T21:11:41Z) - FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios [58.34124792457706]
製造業セクターは、単純な認識から自律的な実行に移行するために、MLLM(Multimodal Large Language Models)をますます採用している。
進捗は、データの不足と、既存のデータセットにおけるきめ細かいドメインセマンティクスの欠如によって妨げられている。
まず、実世界の2D画像と3Dポイントクラウドを組み合わせて、微粒なドメインセマンティクスを付加した高品質なデータセットを構築します。
次に, 3 つの製造課題,すなわち, 構造面検査, 組立検査, 組立検証の18の最先端MLLMを評価し, 大幅な性能差を明らかにした。
論文 参考訳(メタデータ) (2026-04-08T12:23:27Z) - An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs [20.181876038751156]
INS-S1は、新しいエンドツーエンドアライメントパラダイムによってトレーニングされた保険特有なLarge Language Modelsファミリーである。
INS-S1はドメインタスクでのSOTAパフォーマンスを実現し、DeepSeek-R1とGemini-2.5-Proを大きく上回っている。
本結果は,汎用知能を損なうことなく,厳密な領域の特殊化を実現することができることを示す。
論文 参考訳(メタデータ) (2026-03-15T16:13:37Z) - IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation [56.43007596544299]
IndustryNavは、アクティブな空間推論のための最初の動的産業用ナビゲーションベンチマークである。
9つの最先端のVisual Large Language Modelsの研究によると、クローズドソースモデルは一貫した優位性を維持している。
論文 参考訳(メタデータ) (2025-11-21T16:48:49Z) - Real-IAD Variety: Pushing Industrial Anomaly Detection Dataset to a Modern Era [110.83702639978469]
Real-IAD Varietyは、160の異なる対象カテゴリにわたる198,960の高解像度画像からなる、最大かつ最も多様なIADベンチマークである。
その多様性は、28の産業、24の素材タイプ、22のカラーバリエーションを包括的にカバーすることで保証されている。
この重要な分野のイノベーションを促進するために、Real-IAD Varietyが公開される。
論文 参考訳(メタデータ) (2025-11-01T12:58:02Z) - IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios [46.421243185923814]
既存のEmbodied Question Answering (EQA)ベンチマークは主に家庭環境に焦点を当てている。
安全クリティカルな倉庫シナリオにおけるエンボディエージェント能力を評価するための最初のベンチマークであるIndustrialEQAを紹介する。
このベンチマークには、機器の安全性、人間の安全性、オブジェクト認識、属性認識、時間的理解、空間的理解の6つのカテゴリをカバーする豊富なアノテーションが含まれている。
論文 参考訳(メタデータ) (2025-05-27T02:36:17Z) - Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind [16.96145027280737]
我々は農業リモートセンシング(RS)のベンチマークであるAgroMindを紹介する。
AgroMindは、空間知覚、オブジェクト理解、シーン理解、シーン推論の4つのタスクディメンションをカバーしている。
AgroMind上で20のオープンソースLMMと4つのクローズドソースモデルを評価する。
論文 参考訳(メタデータ) (2025-05-18T02:45:19Z) - Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection? [5.979778557940213]
従来の産業異常検出モデルは、しばしば柔軟性と適応性に苦しむ。
MLLM(Multimodal Large Language Models)の最近の進歩は、これらの制限を克服することを約束している。
IADのためのMLLM性能を向上させるために設計された,新しいマルチエキスパートフレームワークであるEchoを提案する。
論文 参考訳(メタデータ) (2025-01-27T05:41:10Z) - MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection [66.05200339481115]
本稿では,産業異常検出における最初のフルスペクトルMLLMベンチマークであるMMADを提案する。
産業検査におけるMLLMの7つの重要なサブタスクを定義し,MMADデータセットを生成するための新しいパイプラインを設計した。
MMADを用いて,様々な最先端MLLMの包括的,定量的評価を行った。
論文 参考訳(メタデータ) (2024-10-12T09:16:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。