論文の概要: CommandLM: Data driven behavior level descriptor for ego vehicles
- arxiv url: http://arxiv.org/abs/2607.22078v1
- Date: Fri, 24 Jul 2026 08:23:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.082432
- Title: CommandLM: Data driven behavior level descriptor for ego vehicles
- Title(参考訳): CommandLM: ego 車両のデータ駆動行動レベル記述子
- Authors: Boris Tokic, Constantin Selzer, Fabian B. Flohr,
- Abstract要約: 我々は,エゴ車両の簡潔で可読な動作記述を生成するマルチモーダルな大規模言語モデルであるCommandLMを紹介した。
我々のモデルは,Q-Formerアダプタを用いて,LiDARとマルチカメラ入力から時間的に融合した鳥眼ビュー表現を処理している。
CommandLM-nuScenesデータセットに基づいてトレーニングされたCommandLMは、プランナーの監督と安全監査に適した意図認識、解釈可能なキャプションを生成します。
- 参考スコア(独自算出の注目度): 0.2905751301655124
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As autonomous driving systems move toward real-world deployment, interpretable, behavior-level decision-making is essential for safety, trust, and regulation. We introduce CommandLM, a multimodal large language model that generates concise, human-readable behavior descriptions for ego vehicles from fused multi-sensor data. Our model processes temporally fused bird's-eye view representations from LiDAR and multi-camera inputs via a Q-Former adapter connected to a quantized, LoRA-fine-tuned large language model. Trained on our CommandLM-nuScenes dataset, CommandLM produces intent-aware, interpretable captions suitable for planner supervision and safety auditing. Experiments demonstrate strong linguistic and behavioral alignment, achieving CIDEr 0.67, and BERT-F1 0.88, substantially outperforming the BLIP-2 baseline (CIDEr 0.52, BERT-F1 0.86). In human evaluation, 58% of the generated descriptions were rated accurate, efficient and rule-compliant, confirming their real-world plausibility. While the remaining descriptions may not always select the most efficient, goal-oriented behavior, CommandLM's interpretable outputs enable downstream validation systems to identify and correct such cases, making it an effective tool for transparent behavior auditing. These results show that integrating multimodal fusion with language reasoning yields efficient and transparent behavior-level understanding for autonomous driving. We release our code and dataset at: https://github.com/b-tok/CommandLM
- Abstract(参考訳): 自律運転システムが現実の展開に向かって進むにつれ、安全、信頼、規制にとって行動レベルの意思決定は不可欠である。
融合型マルチセンサデータから,エゴ車両の簡潔で可読な動作記述を生成するマルチモーダルな大規模言語モデルであるCommandLMを紹介する。
本モデルでは,LDARからの鳥眼ビュー表現とQ-Formerアダプタによるマルチカメラ入力を,量子化されたLoRA微調整型大言語モデルに接続して処理する。
CommandLM-nuScenesデータセットでトレーニングされたCommandLMは、プランナーの監督と安全監査に適した意図認識、解釈可能なキャプションを生成する。
CIDEr 0.67とBERT-F1 0.88はBLIP-2ベースライン(CIDEr 0.52, BERT-F1 0.86)を大幅に上回っている。
人間の評価では、生成した記述の58%が正確で効率的で規則に準拠しており、実際の妥当性が確認された。
残りの記述は、常に最も効率的でゴール指向の振る舞いを選択するわけではないが、CommandLMの解釈可能な出力は、下流のバリデーションシステムでこれらのケースを識別し、修正することができるので、透過的な振る舞い監査のための効果的なツールである。
これらの結果から,多モード融合と言語推論の統合は,自律運転における効率的かつ透過的な行動レベルの理解をもたらすことが示唆された。
私たちは、コードとデータセットをhttps://github.com/b-tok/CommandLMでリリースします。
関連論文リスト
- OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models [69.2503510410147]
予め訓練されたVLM上に構築した統合自動運転フレームワークを提案する。
トレーニング済みのVLMアテンションは、純粋言語モデリング以上の強い伝達性を示すことを示す。
エンドツーエンドの自動運転ベンチマークの実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-04-20T07:50:00Z) - Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification [17.67273082468732]
検証 -- エージェントの振る舞いに報酬を割り当てる関数 -- は、数学やボードゲームのような分野におけるAIの進歩の鍵となっている。
我々は,Multimodal Large Language Models (MLLM) を,Webナビゲーション,コンピュータ利用,ロボット操作におけるエージェントトラジェクトリの検証手段として評価した。
本稿では,MLLMの知識と推論をより効果的に活用する軽量な手法である自己検証(SGV)を提案する。
論文 参考訳(メタデータ) (2025-07-15T18:50:29Z) - REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering [26.428347164111926]
推論時ステアリングは、パラメータを変更することなく、大きな言語モデルの応答を変更することを目的としている。
既存のアプローチはしばしば単純化的なキューやアドホックな一般化に依存している。
本稿では,Transformerモデルにおける振る舞い関連モジュールを識別するフレームワークであるREALを紹介する。
論文 参考訳(メタデータ) (2025-06-10T02:16:50Z) - LANGTRAJ: Diffusion Model and Dataset for Language-Conditioned Trajectory Simulation [102.1527101235251]
LangTrajは、トラフィックシナリオにおけるすべてのエージェントの共同動作をシミュレートする、言語条件のシーン拡散モデルである。
自然言語入力を条件付けすることで、LangTrajはインタラクティブな振る舞いを柔軟かつ直感的に制御できる。
LangTraj氏は、リアリズム、言語制御性、言語条件の安全クリティカルなシミュレーションにおいて、強力なパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-04-15T17:14:06Z) - SafeAuto: Knowledge-Enhanced Safe Autonomous Driving with Multimodal Foundation Models [63.71984266104757]
我々は、構造化されていない知識と構造化されていない知識の両方を取り入れることで、MLLMベースの自動運転を強化するフレームワークであるSafeAutoを提案する。
安全知識を明示的に統合するため,交通ルールを一階述語論理に変換する推論コンポーネントを開発した。
我々のマルチモーダル検索・拡張生成モデルは、過去の運転経験から学ぶために、ビデオ、制御信号、環境特性を活用する。
論文 参考訳(メタデータ) (2025-02-28T21:53:47Z) - DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral
Planning States for Autonomous Driving [69.82743399946371]
DriveMLMは、現実的なシミュレータでクローズループの自律運転を実行するためのフレームワークである。
モジュールADシステムの動作計画モジュールをモデル化するために,MLLM (Multi-modal LLM) を用いる。
このモデルは、Apolloのような既存のADシステムでプラグイン・アンド・プレイすることで、クローズループ運転を行うことができる。
論文 参考訳(メタデータ) (2023-12-14T18:59:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。