論文の概要: Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset
- arxiv url: http://arxiv.org/abs/2606.02273v1
- Date: Mon, 01 Jun 2026 13:59:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:32.185884
- Title: Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset
- Title(参考訳): ドライバモニタリングシステムのための視覚言語モデル:ドライバアクティビティ記述データセット
- Authors: David J. Lerch, Sarath Mulugurthi, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen,
- Abstract要約: 微妙なドライバー動作を理解することは、信頼性の高いドライバー監視システムを構築する上で不可欠である。
既存のビジョンモデル(VLM)は、一般的なデータセットに基づいてトレーニングされており、ドライバーの振る舞いの微妙な区別に苦慮している。
本稿では、Drive&Actデータセットの詳細な自然言語バージョンを作成することで、この制限に対処する。
- 参考スコア(独自算出の注目度): 23.24793168118322
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding subtle driver actions is essential for building reliable driver monitoring systems. Existing visionlanguage models (VLMs) are trained on general datasets and struggle to recognize fine distinctions in driver behaviors. This paper addresses this limitation by creating a detailed natural language version of the Drive&Act dataset. We evaluate three VLMs on our new benchmark using LLM-based scoring methods. Their performance on the new benchmark shows that they cannot reliably generate accurate fine-grained driver activity descriptions. Based on the labeled Drive&Act dataset we create a new Drive&Act description dataset containing finegrained descriptions to train VLMs on driver activity understanding. Cross dataset evaluation on the Driver Monitoring Dataset (DMD) shows that the VLM fine-tuned on our new Drive&Act description dataset generalizes well to actions in the DMD dataset. The VLM fine-tuned on our Drive&Act description dataset achieves an ACCR score of 76 outperforming the zero-shot VLM baseline with an ACCR score of 66. These findings demonstrate that adapting VLMs with richly described driver actions can significantly improve their ability to interpret driver behavior while also highlighting the need for more diverse datasets to support broader generalization in future applications. Our Drive&Act description dataset and code will be publicly available on GitHub.
- Abstract(参考訳): 微妙なドライバー動作を理解することは、信頼性の高いドライバー監視システムを構築する上で不可欠である。
既存の視覚言語モデル(VLM)は、一般的なデータセットに基づいて訓練されており、運転者の行動の微妙な区別に苦慮している。
本稿では、Drive&Actデータセットの詳細な自然言語バージョンを作成することで、この制限に対処する。
LLMに基づくスコアリング手法を用いて,新しいベンチマークで3つのVLMを評価した。
新しいベンチマークでのパフォーマンスは、正確できめ細かなドライバーアクティビティ記述を確実に生成できないことを示している。
ラベル付きDrive&Actデータセットに基づいて、ドライバアクティビティ理解に基づいてVLMをトレーニングするためのきめ細かい記述を含む、新しいDrive&Act記述データセットを作成します。
ドライバモニタリングデータセット(DMD)のクロスデータセット評価は、新しいDrive&Act記述データセットに微調整されたVLMが、DMDデータセットのアクションによく適応していることを示している。
Drive&Act記述データセットで微調整したVLMは、ACCRスコアが76で、ゼロショットVLMベースラインを66で上回ります。
これらの結果から,ドライバ動作を豊かに記述したVLMを適用することで,ドライバ動作の解釈能力を大幅に向上するとともに,将来のアプリケーションにおける広範な一般化をサポートするための,より多様なデータセットの必要性を強調した。
Drive&Act記述データセットとコードはGitHubで公開されます。
関連論文リスト
- PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior [21.53769783882118]
本稿では、パーソナライズドドライバ動作の詳細な理解のためのベンチマークであるPDB-Evalを紹介する。
私たちのベンチマークは、PDB-XとPDB-QAの2つの主要コンポーネントで構成されています。
詳細な説明や説明に関する微調整MLLMは、MLLMと駆動領域のギャップを効果的に埋めることができる。
論文 参考訳(メタデータ) (2025-07-24T14:33:06Z) - DriveLM: Driving with Graph Visual Question Answering [57.51930417790141]
本研究では,Webスケールデータに基づいて学習した視覚言語モデル(VLM)を,エンド・ツー・エンドの運転システムに統合する方法について検討する。
グラフVQAとエンドツーエンド駆動を併用するVLMベースラインアプローチ(DriveLM-Agent)を提案する。
論文 参考訳(メタデータ) (2023-12-21T18:59:12Z) - Driving with LLMs: Fusing Object-Level Vector Modality for Explainable
Autonomous Driving [6.728693243652425]
大規模言語モデル(LLM)は、特に一般化と解釈可能性において、自動運転分野において有望であることを示している。
我々は,ベクトル化された数値を事前学習したLLMにマージして,運転状況における文脈理解を改善する,ユニークなオブジェクトレベルのマルチモーダルLLMアーキテクチャを提案する。
論文 参考訳(メタデータ) (2023-10-03T11:05:14Z) - DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model [84.29836263441136]
本研究は,マルチモーダル大言語モデル(MLLM)に基づく新しい解釈可能なエンドツーエンド自動運転システムであるDriveGPT4を紹介する。
DriveGPT4は、車両動作の解釈を促進し、関連する推論を提供し、ユーザによるさまざまな質問に効果的に対処する。
論文 参考訳(メタデータ) (2023-10-02T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。