論文の概要: AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2604.20878v1
- Date: Sat, 11 Apr 2026 09:38:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:14.137297
- Title: AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models
- Title(参考訳): AITP:マルチモーダル大言語モデルによる交通事故責任割当
- Authors: Zijin Zhou, Songan Zhang,
- Abstract要約: 本稿では,AITP(Artificial Intelligence Traffic Police)について紹介する。
67,941の注釈付きビデオと195,821の質問応答対で10の交通事故推論タスクを統合したデカタラ型ベンチマークを提案する。
- 参考スコア(独自算出の注目度): 3.6393796347315974
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) have achieved remarkable progress in Traffic Accident Detection (TAD) and Traffic Accident Understanding (TAU). However, existing studies mainly focus on describing and interpreting accident videos, leaving room for deeper causal reasoning and integration of legal knowledge. Traffic Accident Responsibility Allocation (TARA) is a more challenging task that requires multi-step reasoning grounded in traffic regulations. To address this, we introduce AITP (Artificial Intelligence Traffic Police), a multimodal large language model for responsibility reasoning and allocation. AITP enhances reasoning via a Multimodal Chain-of-Thought (MCoT) mechanism and integrates legal knowledge through Retrieval-Augmented Generation (RAG). We further present DecaTARA, a decathlon-style benchmark unifying ten interrelated traffic accident reasoning tasks with 67,941 annotated videos and 195,821 question-answer pairs. Extensive experiments show that AITP achieves state-of-the-art performance across responsibility allocation, TAD, and TAU tasks, establishing a new paradigm for reasoning-driven multimodal traffic analysis.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は,交通事故検出(TAD)と交通事故理解(TAU)において顕著な進歩を遂げている。
しかし、既存の研究は主に事故ビデオの説明と解釈に重点を置いており、より深い因果推論と法的知識の統合のための余地を残している。
交通事故責任割当(TARA)は、交通規制に根ざした多段階の推論を必要とする、より困難な作業である。
そこで我々は,AITP(Artificial Intelligence Traffic Police)という,責任推論とアロケーションのためのマルチモーダルな大規模言語モデルを導入する。
AITPは、Multimodal Chain-of-Thought(MCoT)メカニズムによる推論を強化し、Retrieval-Augmented Generation(RAG)を通じて法的知識を統合する。
さらに,67,941本の注釈付きビデオと195,821本の質問応答対で10件の交通事故推論タスクを統合したデカタラについて紹介する。
大規模な実験により、AITPは責任割り当て、TAD、TAUタスクにまたがる最先端のパフォーマンスを実現し、推論駆動型マルチモーダルトラフィック分析のための新しいパラダイムを確立した。
関連論文リスト
- ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation [15.229240986097304]
本稿では,高速道路のための事前学習型マルチモーダル大言語モデルであるExpressMindを構築し,知的高速道路運転の認知的コアとして機能する。
本稿では,交通情報テキスト,緊急推論チェーン,注釈付きビデオイベントを含む,業界初のフルスタック高速道路データセットを構築した。
新たにリリースしたマルチモーダル高速道路ベンチマークの実験では、ExpressMindはイベント検出、安全応答生成、複雑なトラフィック解析において、既存のベースラインを総合的に上回ります。
論文 参考訳(メタデータ) (2026-03-17T13:22:53Z) - DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving [34.19974984127512]
合成トラフィックルール推論のためのテキストベースのベンチマークであるDriveComboを提案する。
人間のドライバの認知発達に触発されて,系統的な5レベル認知層を提案する。
また,言語ベースの交通ルールを動的運転シーンにマッピングするルール2Scene Agentを提案する。
論文 参考訳(メタデータ) (2026-03-02T09:12:40Z) - RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System [15.222742182076459]
RoadSceneVQAは、ロードサイドシナリオに特化した、大規模な視覚的質問応答データセットである。
データセットは、様々な天候、照明、交通条件の下で収集された34,736種類のQAペアで構成されている。
RoadSceneVQAは、明示的な認識と暗黙的な常識推論の両方を実行するモデルに挑戦する。
論文 参考訳(メタデータ) (2025-11-23T04:40:50Z) - Traffic-MLLM: A Spatio-Temporal MLLM with Retrieval-Augmented Generation for Causal Inference in Traffic [8.754321713184483]
本稿では,詳細なトラフィック解析に適した多モーダル大規模言語モデルであるTraffic-LMを提案する。
我々のモデルは、高品質な交通特化マルチモーダルデータセットを活用し、軽量な微調整にLowRanktemporal Adaptation (LoRA) を用いる。
また、検索ロッドジェネレーション(LoRAG)による最先端推論を融合した革新的な知識モジュールも導入する。
論文 参考訳(メタデータ) (2025-09-14T08:53:06Z) - VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning [69.44871115752055]
本稿では,PCuRL(Progressive Curriculum Reinforcement Learning)フレームワークを用いて学習した高度なマルチモーダル推論モデルを提案する。
PCuRLは、難易度が徐々に増大するタスクを通じてモデルを体系的にガイドし、多様なマルチモーダルコンテキストにおける推論能力を大幅に向上させる。
本フレームワークは,(1)連続するRLトレーニング段階におけるトレーニング難度を動的に調整するオンライン難易度重み付け機構,(2)タスク複雑度に応じて推論経路長を適応的に調整する動的長報奨機構,の2つの重要なイノベーションを紹介する。
論文 参考訳(メタデータ) (2025-07-30T12:23:21Z) - Progressive Multimodal Reasoning via Active Retrieval [64.74746997923967]
多段階多モーダル推論タスクは、大規模言語モデル(MLLM)に重大な課題をもたらす
本稿では,MLLMの推論能力の向上を目的とした汎用フレームワークAR-MCTSを提案する。
我々は,AR-MCTSがサンプリングの多様性と精度を最適化し,信頼性の高いマルチモーダル推論を実現することを示す。
論文 参考訳(メタデータ) (2024-12-19T13:25:39Z) - A Study of Situational Reasoning for Traffic Understanding [63.45021731775964]
トラフィック領域における状況推論のための3つの新しいテキストベースのタスクを考案する。
先行作業における言語推論タスクにまたがる一般化能力を示す知識強化手法を4つ採用する。
本稿では,データ分割におけるモデル性能の詳細な解析を行い,モデル予測を分類的に検討する。
論文 参考訳(メタデータ) (2023-06-05T01:01:12Z) - Intelligent Traffic Monitoring with Hybrid AI [78.65479854534858]
マルチモーダルコンテキスト理解のためのニューロシンボリックアーキテクチャであるHANSを紹介する。
HANSが交通監視に関わる課題にどのように対処するかを示すとともに,幅広い推論手法と統合可能であることを示す。
論文 参考訳(メタデータ) (2022-08-31T17:47:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。