論文の概要: Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment
- arxiv url: http://arxiv.org/abs/2608.02470v1
- Date: Mon, 03 Aug 2026 16:37:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.710412
- Title: Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment
- Title(参考訳): 細粒化車両損傷評価のためのディディケートセグメンテーション付き接地エージェントVLM
- Abstract要約: 視覚言語モデル(VLM)は、現実のビジュアルアセスメントパイプラインにおける推論エージェントとして、ますます多くデプロイされている。
現状のVLM (Qwen-VL) は, このタスクにおいて強い意味分類精度 (87.3%) を達成するが, 空間レベルでは体系的に非基底化されていることを示す。
空間接地を専用マルチタスクセグメンテーションモデルに委譲するハイブリッドアーキテクチャであるTinyDamageを提案する。
本研究は, 報告の幻覚率を92% (テキストのみ) と78% (画像のみ) から31% (画像のみ) に低下させることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) are increasingly deployed as reasoning agents in real-world visual assessment pipelines, yet their spatial grounding remains unreliable for fine-grained, visually ambiguous targets. We study this gap in the context of automated vehicle damage assessment, where fine-grained defects such as scratches and hairline cracks occupy few pixels, produce weak gradient signal, and are easily confused with reflections and surface texture. We show that a state-of-the-art VLM (Qwen-VL) achieves strong semantic classification accuracy (87.3%) on this task but is systematically ungrounded at the spatial level: it hallucinates damage in reflective regions, misses elongated scratches entirely, and produces spatially inconsistent outputs when prompted for localization. We propose TinyDamage, a hybrid architecture that delegates spatial grounding to a dedicated multi-task segmentation model while reserving the VLM for semantic reasoning and report generation. On the segmentation side, we find that the choice of loss function has an outsized and underexplored effect on tiny-object grounding: focal loss, widely used for class imbalance, collapses tiny-damage detection to zero, while a supervised contrastive objective measurably improves damage/background separability. We integrate the segmentation model into a 7-node LangGraph agent pipeline that grounds every VLM generation step in the segmentation output, and show that this grounding reduces the report hallucination rate from 92% (text-only) and 78% (image-only) to 31% in a controlled evaluation on 100 human-verified reports. We introduce DET_l, a permissive per-category detection metric for evaluating tiny-object grounding under class imbalance, and report latency and reliability characteristics of the deployed pipeline.
- Abstract(参考訳): 視覚言語モデル(VLM)は、現実世界のビジュアルアセスメントパイプラインにおける推論エージェントとしてますますデプロイされているが、その空間的接地は、きめ細かな視覚的曖昧なターゲットに対しては信頼性が低いままである。
このギャップは,スクラッチやヘアラインクラックなどの微細な欠陥が画素数が少なく,勾配信号が弱く,反射や表面テクスチャと容易に混同される,自動車両損傷評価の文脈において検討される。
現状のVLM (Qwen-VL) は,このタスクにおいて強い意味分類精度 (87.3%) を達成するが,空間レベルでは体系的にアングラウンド化されている。
本稿では,空間的接地を専用マルチタスクセグメンテーションモデルに委譲するハイブリッドアーキテクチャであるTinyDamageを提案する。
セグメンテーション側では、損失関数の選択が小物体のグラウンドリングに過小評価され、焦点損失はクラス不均衡に広く用いられ、小損傷検出はゼロに崩壊するが、教師付きコントラスト目的は損傷/バックグラウンドの分離性を確実に改善する。
セグメンテーションモデルを7ノードのLangGraphエージェントパイプラインに統合し、セグメンテーション出力におけるVLM生成ステップの全てをグルーピングし、このグルーピングにより、レポートの幻覚率が92%(テキストのみ)と78%(画像のみ)から31%に低下することを示す。
我々は,クラス不均衡下での微小物体の接地評価のためのパーミッシブ・パー・カテゴリ検出指標であるDET_lを導入し,デプロイパイプラインの遅延特性と信頼性特性を報告する。
関連論文リスト
- Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery [3.016488960368601]
本稿では,損傷評価から検出を分離するハイブリッドフレームワークを提案する。
CVモデルはまず建物を検知し、画像上の境界ボックスを生成し、損傷分類と文脈解釈のためにLVLMに渡される。
我々はRescueNetとFloodNetの2つの実世界のベンチマークでフレームワークを評価した。
論文 参考訳(メタデータ) (2026-08-03T08:39:59Z) - Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking [58.338848435042536]
RGB-Eventトラッキングは、イベントセンサからRGB外観テクスチャと高密度時間運動キューを融合することにより、ローカライズを改善する。
現実世界のシーンは、従来のマルチモーダル融合を妨げる多様な構造的な信号劣化に悩まされる。
本稿では,RGBイベント追跡に適した階層的摂動・検索フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-24T23:34:06Z) - PASTA: Vision Transformer Patch Aggregation for Weakly Supervised Target and Anomaly Segmentation [4.14197005718384]
PASTAは、自己教師型視覚変換器の特徴空間における分布解析を通して、ターゲットと異常オブジェクトを識別する。
我々のパイプラインは、セグメンション・エキシング・モデル3を介して意味的なテキスト・プロンプトを使用して、ゼロショットオブジェクトのセグメンテーションを誘導する。
本手法は, ドメインに依存しないが, 工業・農業領域において優れたターゲット(最大88.3%IoU)と異常(最大3.5%IoU6IoU)のセグメンテーション性能を達成する。
論文 参考訳(メタデータ) (2026-04-07T08:29:11Z) - VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - Deep Global Clustering for Hyperspectral Image Segmentation: Concepts, Applications, and Open Challenges [1.9116784879310027]
ハイパースペクトルイメージング(HSI)解析は、利用可能なメモリを超える大量のデータ量のために計算ボトルネックに直面している。
本稿では,メモリ効率の高いHSIセグメンテーションの概念フレームワークであるDeep Global Clustering (DGC)について述べる。
DGCは、重複するリージョンを持つ小さなパッチを使用して一貫性を強制し、コンシューマハードウェア上で30分未満のトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-12-30T12:10:43Z) - SINDER: Repairing the Singular Defects of DINOv2 [61.98878352956125]
大規模なデータセットでトレーニングされたビジョントランスフォーマーモデルは、抽出したパッチトークンにアーティファクトを表示することが多い。
本稿では,小さなデータセットのみを用いて構造欠陥を補正するスムーズなスムーズな正規化を提案する。
論文 参考訳(メタデータ) (2024-07-23T20:34:23Z) - GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features [68.14842693208465]
GeneralADは、意味的、ほぼ分布的、産業的設定で動作するように設計された異常検出フレームワークである。
本稿では,ノイズ付加やシャッフルなどの簡単な操作を施した自己教師付き異常生成モジュールを提案する。
提案手法を10のデータセットに対して広範囲に評価し,6つの実験結果と,残りの6つの実験結果を得た。
論文 参考訳(メタデータ) (2024-07-17T09:27:41Z) - 2D Feature Distillation for Weakly- and Semi-Supervised 3D Semantic
Segmentation [92.17700318483745]
合成訓練された2Dセマンティックセマンティックセグメンテーションネットワークから高レベル特徴情報を蒸留するアイデアに基づく画像誘導ネットワーク(IGNet)を提案する。
IGNetは、ScribbleKITTI上の弱い教師付きLiDARセマンティックセマンティックセグメンテーションの最先端の結果を達成し、8%のラベル付きポイントしか持たない完全な教師付きトレーニングに対して最大98%のパフォーマンスを誇っている。
論文 参考訳(メタデータ) (2023-11-27T07:57:29Z) - Semi-signed neural fitting for surface reconstruction from unoriented
point clouds [53.379712818791894]
より優れた符号付き距離場を再構成するためのSN-Fittingを提案する。
SSNフィッティングは半署名の監督と損失に基づく領域サンプリング戦略で構成されている。
我々は,SSN-Fittingが,異なる設定下で最先端の性能を達成することを示す実験を行う。
論文 参考訳(メタデータ) (2022-06-14T09:40:17Z) - FSNet: A Failure Detection Framework for Semantic Segmentation [9.453250122818808]
画素レベルの誤分類を識別するための故障検出フレームワークを提案する。
セグメンテーションモデルの内部機能を利用して、障害検出ネットワークで同時にトレーニングする。
我々は,最先端手法に対する提案手法の評価を行い,12.30%,9.46%,9.65%の性能改善を実現した。
論文 参考訳(メタデータ) (2021-08-19T15:26:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。