論文の概要: MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving
- arxiv url: http://arxiv.org/abs/2608.02449v1
- Date: Mon, 03 Aug 2026 16:24:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.705337
- Title: MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving
- Title(参考訳): Moral: エッジ指向自動運転に向けた小型VLMのためのセンサ周囲のBEV推論
- Authors: Ambarish Govindarajulu Kaliamurthi, Kaikai Liu,
- Abstract要約: MoRALはCosmos-Reason2-2Bに、まず物理コード化されたBird's Eye Viewの表現を読み、その後、決定を下すためにそれを推論するように教えている。
モラルは4倍のパラメータを使用するにもかかわらず、ゼロショット8Bベースラインで8つの質問タイプのうち7つを勝ち取る。
これらの結果は、モバイルエッジプラットフォーム上でのコンパクトな物理基底VLM推論のための再現可能な基盤を確立する。
- 参考スコア(独自算出の注目度): 1.6664447029145368
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying vision-language models (VLMs) for safety-critical spatial reasoning on resource-constrained autonomous driving platforms requires both compact model size and reliable metric grounding. We present MoRAL (Multimodal Reasoning for Autonomous Language Models), a two-stage fine-tuning pipeline that teaches Cosmos-Reason2-2B to first read a physics-encoded Bird's Eye View (BEV) representation and then reason over it for driving decisions. The BEV image encodes LiDAR metric distance as color bands, object class as cluster morphology, and radar Doppler velocity as directional wedge overlays, externalizing spatial perception into the input image so that no learned 3D backbone is required at inference. Stage 1 fine-tunes the vision encoder on 60,000 grounding records; zero-shot baselines produce no parseable BEV outputs, confirming the vocabulary requires explicit training. Stage 2 fine-tunes the full model (52M parameters, 2.4% of total) on 57,696 chain-of-thought records generated by Cosmos-Reason2-8B as teacher, spanning eight driving question types. On 2,304 held-out nuScenes frames evaluated by Gemma 4 (31B) calibrated against human review, MoRAL wins seven of eight question types over a zero-shot 8B baseline despite using four times fewer parameters, with the largest margins on question types requiring structured multi-step physics reasoning. Emergency braking recall improves from 10.8% to 47.8%, output degeneration falls from 94.1% to 20.8%, and the full pipeline fits a consumer 8 GB GPU at 42 tok/s without quantization. These results establish a reproducible foundation for compact, physics-grounded VLM reasoning on mobile edge platforms.
- Abstract(参考訳): 資源制約された自律走行プラットフォーム上での安全クリティカルな空間推論のための視覚言語モデル(VLM)の展開には、コンパクトなモデルサイズと信頼性の高い計量グラウンド化が必要である。
われわれはMoral(Multimodal Reasoning for Autonomous Language Models)という,Cosmos-Reason2-2Bに物理エンコードされたBird's Eye View(BEV)表現を最初に読み取って,それを判断する2段階の微調整パイプラインを紹介した。
BEV画像は、LiDAR距離をカラーバンド、オブジェクトクラスをクラスタ形態として、レーダードップラー速度を指向性ウェッジオーバーレイとして符号化し、入力画像に空間知覚を外部化することにより、推論時に学習した3Dバックボーンを必要としないようにする。
ステージ1では、視覚エンコーダを6万の接地記録に微調整し、ゼロショットベースラインはパース可能なBEV出力を生成せず、語彙が明示的な訓練を必要とすることを確認します。
ステージ2では、教師としてコスモス・レーソン2-8Bが生成した57,696のチェーン・オブ・シークレット・レコード上で、全モデル(52Mパラメータ、2.4%)を微調整した。
Gemma 4 (31B)により評価された2,304個の保留されたnuScenesフレームでは、ゼロショット8Bベースラインに対して8つの質問タイプのうち7つの質問タイプに勝利した。
緊急ブレーキリコールは10.8%から47.8%に改善され、出力デジェネレーションは94.1%から20.8%に低下し、完全なパイプラインは量子化なしでコンシューマ8GBのGPUに適合する。
これらの結果は、モバイルエッジプラットフォーム上でのコンパクトな物理基底VLM推論のための再現可能な基盤を確立する。
関連論文リスト
- FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog [0.0]
データ中心のエンジニアリングと堅牢な機械学習をブリッジする、厳格に校正されたデータセットであるFogDriveを紹介します。
FogDriveには、4つの同期カメラ(RGB、深さ、セマンティックセグメンテーション)、LiDARとセマンティック-LiDARペア、フロントレーダの660のシーンが含まれている。
物理的に一貫した霧は、3つの校正された視界でカメラチャンネルとLiDARチャンネルを独立にモデル化する。
8k画像に対するセマンティックセグメンテーションに基づく品質監査では、アノテーションは95.1%の精度で、40m以内の車のリコールは99%以上である。
論文 参考訳(メタデータ) (2026-07-18T06:53:56Z) - Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective [76.02772556944073]
環境錯覚は自然に存在するが、現実の運転環境では見過ごされている現象である。
視覚的知覚を妨害し、シーンの誤解を招き、自動運転システムに深刻な安全リスクをもたらす。
最初のベンチマークであるLanEvil++を導入し、環境錯覚下での車線知覚の堅牢性を評価する。
論文 参考訳(メタデータ) (2026-07-07T03:15:00Z) - Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning [48.438568700670835]
モデルから潜在的知識を読み出す標準的な方法は、視覚言語モデルがイメージに根ざしたものを体系的に上書きすることができる。
本研究では,空間的推論において,一直線因果制御によって露呈した探究と操舵の両方に誤差が見えないことを示す。
論文 参考訳(メタデータ) (2026-06-30T07:33:18Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - Iterative Visual Thinking: Teaching Vision-Language Models Spatial Self-Correction through Visual Feedback [0.023227405857540805]
視覚言語モデル(VLM)は、強い単一ショット空間グラウンドを達成するが、自身の予測を観察し修正するメカニズムは欠如している。
本稿では,モデルが境界ボックスを予測するクローズドループフレームワークであるIterative Visual Thinking (IVT)を提案する。
すべてのトレーニングでは、単一のGPU上で2400のサンプルしか使用せず、空間的な自己補正が、適度なスケールで注入できる学習可能な能力であることを実証している。
論文 参考訳(メタデータ) (2026-06-11T10:27:29Z) - An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers [0.0]
車両のボディタイプは、クラッシュを乗り越える際のサイクリストの重傷の重症度を決定づける重要な要因であるが、車両を分類するための自動ツールがオープンな文献には存在しない。
本稿では、未学習のRT-DETR検出器と微調整の視覚変換器を組み合わせたオープンソースの2段コンピュータビジョンパイプラインを提案する。
信頼に基づく棄権機構は、ソフトマックス出力が0.60未満になるとステージ2の予測を保ち、無音の誤分類ではなく未知のラベルを生成する。
論文 参考訳(メタデータ) (2026-06-03T17:53:33Z) - D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving [10.860896159477264]
D2-V2Xは,空間認識型質問応答(QRA)ベンチマークで8500個の三重項を特徴とする。
構造化された出力に先立って、自然言語のリコール合理性を強制することにより、我々のモデルは空間的関係を明確に表現せざるを得ない。
このモデルではF1スコアを53.5の関数的に決定するが、3次元から2次元の投影を現在のVLMアーキテクチャの基本的なボトルネックとみなす。
論文 参考訳(メタデータ) (2026-05-22T18:05:10Z) - Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images [52.50752250573993]
MLLM(Multimodal Large Language Models)は、視覚的知覚が強いが、視点の変化による空間の推論には限界がある。
本研究では、この課題を全方位360度画像におけるパースペクティブ・コンディションド・スペース・推論(PCSR)として検討する。
我々は2,600全方位画像から84,373組の質問応答対の診断ベンチマークであるPCSR-Benchを紹介する。
論文 参考訳(メタデータ) (2026-05-12T17:11:17Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B [12.229008422568192]
本稿では,SSP(Spectrum-to-Signal Principle)を用いた1.5Bパラメータ密度モデルであるVibeThinker-1.5Bを紹介する。
VibeThinker-1.5Bの総トレーニングコストは7800ドルに過ぎず、クローズドソースモデルよりも優れた推論能力を示している。
注目すべきは、3つのベンチマークで400倍のDeepSeek R1を上回っていることだ。
論文 参考訳(メタデータ) (2025-11-09T04:37:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。