論文の概要: Towards Systematic Qualification of Vision-Language Models for Automotive Perception Systems
- arxiv url: http://arxiv.org/abs/2609.25945v1
- Date: Tue, 22 Sep 2026 09:51:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.315049
- Title: Towards Systematic Qualification of Vision-Language Models for Automotive Perception Systems
- Title(参考訳): 自動車知覚システムのための視覚言語モデルの体系的検証に向けて
- Abstract要約: 視覚言語モデルは幻覚を起こす傾向がある。
自動車の領域内では、VLMは交通物体を幻覚させるだけでなく、実際に存在する交通物体を特定することもできなかった。
本稿では,ランタイムモニタリングを補完する設計時資格ワークフローを提案する。
- 参考スコア(独自算出の注目度): 39.58376169229681
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The field of Artificial Intelligence has been adopted for many application domains. Vision Language Models are one of the recently advanced AI techniques that have been explored to support automotive features such as vehicle perception, and safety assurance. However, such language models are prone to hallucinations, posing a potential threat to the safety of automotive systems that may incorporate them. Within the automotive domain, VLMs could not only hallucinate traffic objects, but could also fail to identify traffic objects that are actually present, which may potentially lead to dangerous situations. Though we have observed a growing body of literature that proposes verification and validation techniques for safe and trustworthy AI, these methods are often studied in isolation, focusing either on run-time or design-time phases. Such isolated techniques could be insufficient in safety-critical, realistic contexts such as automotive perception systems. In this paper, we analyze design-time and run-time verification and validation techniques based on a taxonomy presented by Huang et al. We present an automotive study in which a design-time qualification workflow is proposed to complement run-time monitoring. This workflow combines a fixed safety-relevant ontology-based structured annotation system together with a synonym-based evaluation process to statistically evaluate three state-of-the-art VLMs against data from the nuScenes dataset. We observed that the proposed technique enables deterministic and repeatable quantification of the hallucinations VLMs generate in automotive perception-related tasks. The proposed workflow supports model comparison and deployment-oriented engineering decisions within the design-time verification and validation process and will contribute to a holistic verification strategy that strives towards trustworthy automotive perception systems
- Abstract(参考訳): 人工知能の分野は多くのアプリケーション領域で採用されている。
ビジョン言語モデル(Vision Language Models)は、自動車の認識や安全保証といった自動車機能をサポートするために研究されている、最近開発されたAI技術の1つである。
しかし、そのような言語モデルは幻覚を起こす傾向があり、それらを組み込んだ自動車システムの安全性を脅かす可能性がある。
自動車の領域内では、VLMは交通物体を幻覚させるだけでなく、実際に存在する交通物体の特定にも失敗し、危険な状況につながる可能性がある。
安全で信頼性の高いAIの検証と検証技術を提案する文献が増えているのを我々は見てきたが、これらの手法は多くの場合、実行時または設計時のフェーズに焦点をあてて、独立して研究されている。
このような孤立した技術は、自動車認識システムのような安全クリティカルで現実的な文脈では不十分である。
本稿では,Huangらによって提示された分類に基づいて,設計時の検証と実行時の検証手法を解析し,実行時のモニタリングを補完する設計時の資格ワークフローを提案する。
このワークフローは、固定された安全関連オントロジーに基づく構造化アノテーションシステムと同義語に基づく評価プロセスを組み合わせて、3つの最先端VLMをnuScenesデータセットのデータに対して統計的に評価する。
提案手法は,自動車の知覚関連タスクにおいて発生する幻覚VLMを決定論的かつ反復的に定量化することを可能にする。
提案したワークフローは,設計時検証および検証プロセスにおけるモデル比較とデプロイメント指向のエンジニアリング決定をサポートし,信頼性の高い自動車認識システムに向けた総合的検証戦略に寄与する。
関連論文リスト
- Vision and language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning [2.1379801460200416]
視覚言語モデル(VLM)は、視覚観察を自然言語の概念と整合させる強力な表現学習システムとして登場した。
本稿では、視覚言語表現が、認識、予測、計画パイプラインに統合された場合、シーンの安全性評価と意思決定をどのようにサポートするかを検討する。
論文 参考訳(メタデータ) (2026-02-07T20:04:21Z) - Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving [55.13109926181247]
離散拡散による安全な軌道生成のためのリフレクション機構を統合した学習ベースのフレームワークであるReflectDriveを紹介する。
我々のアプローチの中心は、勾配のない反復的な自己補正を行う、安全を意識した反射機構である。
本手法は目標条件付き軌道生成から始まり,マルチモーダル運転動作をモデル化する。
論文 参考訳(メタデータ) (2025-09-24T13:35:15Z) - Image Segmentation with Large Language Models: A Survey with Perspectives for Intelligent Transportation Systems [6.908972852063454]
本調査は,LLM強調画像セグメンテーションの新たな分野を体系的にレビューする。
これらのイノベーションは、自動運転、交通監視、インフラのメンテナンスのための道路シーン理解をいかに向上させるかを強調します。
リアルタイムのパフォーマンスや安全性クリティカルな信頼性など、重要な課題を特定します。
論文 参考訳(メタデータ) (2025-06-17T01:20:50Z) - Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review [14.611584622270405]
本稿では,道路の安全性と移動性を高めるため,大規模言語モデル(LLM)の適用とカスタマイズについて概説する。
重要な焦点は、LLMがアーキテクチャ、トレーニング、プロンプト、マルチモーダル戦略を通じて、交通機関のユニークな時間的および物理的データで"モダリティギャップ"を埋める方法である。
潜在的な可能性にもかかわらず、固有のLLM制限(ハロシン化、推論欠陥)、データガバナンス(プライバシ、バイアスの複雑さ)、複雑さ(シモン・トゥ・リアル、レイテンシ)、厳格な安全保証に関する課題が続いている。
論文 参考訳(メタデータ) (2025-05-19T21:51:18Z) - SafeAuto: Knowledge-Enhanced Safe Autonomous Driving with Multimodal Foundation Models [63.71984266104757]
我々は、構造化されていない知識と構造化されていない知識の両方を取り入れることで、MLLMベースの自動運転を強化するフレームワークであるSafeAutoを提案する。
安全知識を明示的に統合するため,交通ルールを一階述語論理に変換する推論コンポーネントを開発した。
我々のマルチモーダル検索・拡張生成モデルは、過去の運転経験から学ぶために、ビデオ、制御信号、環境特性を活用する。
論文 参考訳(メタデータ) (2025-02-28T21:53:47Z) - CurricuVLM: Towards Safe Autonomous Driving via Personalized Safety-Critical Curriculum Learning with Vision-Language Models [1.6612510324510592]
CurricuVLMは、自律運転エージェントのためのパーソナライズされたカリキュラム学習を可能にする新しいフレームワークである。
我々のアプローチでは、エージェントの動作を分析し、パフォーマンスの弱点を特定し、動的に調整されたトレーニングシナリオを生成するために、視覚言語モデル(VLM)を利用する。
CurricuVLMは、通常のシナリオと安全クリティカルなシナリオの両方において、最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-02-21T00:42:40Z) - AIDE: An Automatic Data Engine for Object Detection in Autonomous Driving [68.73885845181242]
本稿では,問題を自動的に識別し,データを効率よくキュレートし,自動ラベル付けによりモデルを改善する自動データエンジン(AIDE)を提案する。
さらに,AVデータセットのオープンワールド検出のためのベンチマークを構築し,様々な学習パラダイムを包括的に評価し,提案手法の優れた性能を低コストで実証する。
論文 参考訳(メタデータ) (2024-03-26T04:27:56Z) - Empowering Autonomous Driving with Large Language Models: A Safety Perspective [82.90376711290808]
本稿では,Large Language Models (LLM) の自律運転システムへの統合について検討する。
LLMは行動計画におけるインテリジェントな意思決定者であり、文脈的安全学習のための安全検証シールドを備えている。
適応型LLM条件モデル予測制御(MPC)と状態機械を用いたLLM対応対話型行動計画スキームという,シミュレーション環境における2つの重要な研究について述べる。
論文 参考訳(メタデータ) (2023-11-28T03:13:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。