論文の概要: Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis
- arxiv url: http://arxiv.org/abs/2608.08935v1
- Date: Sun, 09 Aug 2026 21:53:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.998504
- Title: Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis
- Title(参考訳): 検索・拡張推論・オブジェクトセンシング・損傷解析のための統合型マルチモーダルAIシステム
- Abstract要約: 本研究では,損傷評価のための統合型マルチモーダルAIシステムを提案する。
検索強化生成(RAG)モデル、熱スペクトル知覚、ビジョン基礎モデルパイプライン、探索無線信号センシングを統合している。
- 参考スコア(独自算出の注目度): 4.6225800903606515
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This work presents a unified multimodal AI system for damage assessment that integrates retrieval-augmented generation (RAG) models, thermal spectrum perception, vision foundation model pipelines, and exploratory wireless signal sensing. A RAG component is developed to ground a locally hosted language model in project-specific documentation, including specialized damage level classification criteria to mitigate hallucinations during inference. Controlled comparisons against static few-shot prompting demonstrate that dynamic retrieval improves grounding and factual consistency. We further compare vector-based RAG with a knowledge graph variant constructed via entity-relation extraction, and show that graph-based retrieval produces stronger responses for damage assessment queries requiring cross-document reasoning, motivating hybrid dense, sparse, and graph-aware retrieval. To address limitations of EO imagery under adverse lighting and weather conditions, infrared (IR)/thermal sensing is employed for object detection and segmentation. Our detectors generate candidate detections, yielding improved segmentation of a broad array of objects. Paired IR versus visible spectrum tracking experiments reveal failure modes, motivating multimodal fusion for robust object detection and damage analysis. Vision foundation and vision-language models are leveraged to generate synthetic damage imagery and classify damage severity with high accuracy, supporting training and validation of downstream damage assessment models. Finally, exploratory Wireless-based sensing demonstrates potential to detect presence, motion, and post-event environmental changes where EO and IR sensing are ineffective.
- Abstract(参考訳): 本研究は、検索強化生成(RAG)モデル、熱スペクトル知覚、ビジョン基礎モデルパイプライン、探索的無線信号センシングを統合した、損傷評価のための統合型マルチモーダルAIシステムを提案する。
RAGコンポーネントは、プロジェクト固有の文書にローカルにホストされた言語モデルを構築するために開発され、推論中の幻覚を軽減するための特別な損傷レベル分類基準を含む。
静的なショットプロンプトに対する制御された比較は、動的検索がグラウンディングと事実整合性を改善することを示す。
さらに、ベクトルベースRAGと、エンティティ関係抽出によって構築された知識グラフ変種を比較し、グラフベース検索が、クロスドキュメント推論、ハイブリッド密度、スパース、グラフ認識検索を必要とする損傷評価クエリに対して、より強力な応答を生成することを示す。
悪照明および気象条件下でのEO画像の限界に対処するために、赤外線/熱センシングを用いて物体の検出とセグメンテーションを行う。
我々の検出器は候補検出を生成し、広い範囲の物体のセグメンテーションを改善した。
赤外線対可視光追跡実験により、障害モードが明らかになり、堅牢な物体検出と損傷解析のためのマルチモーダル融合が動機となった。
視覚基礎モデルと視覚言語モデルを用いて、合成損傷画像を生成し、高精度に損傷重症度を分類し、下流損傷評価モデルのトレーニングと検証を支援する。
最後に、探索的ワイヤレスセンシングは、EOおよびIRセンシングが非有効である場合の、存在、動き、および後の環境変化を検出する可能性を示す。
関連論文リスト
- RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations [12.753436440584409]
VisRAG(Retrieval-Augmented Generation)は、視覚言語モデル(VLM)を活用して、関連する視覚文書を共同で検索し、マルチモーダルな証拠に基づいて根拠付き回答を生成する。
既存のVisRAGモデルは、視覚入力がぼやけ、ノイズ、低光、シャドーなどの歪みに悩まされるときに性能が低下する。
因果誘導型デュアルパスフレームワークであるRobustVisRAGを導入し,効率とゼロショットの一般化を保ちながら,VisRAGの堅牢性を向上させる。
論文 参考訳(メタデータ) (2026-02-25T15:27:57Z) - Reason-IAD: Knowledge-Guided Dynamic Latent Reasoning for Explainable Industrial Anomaly Detection [85.29900916231655]
Reason-IADは、説明可能な産業異常検出のための知識誘導型動的潜在推論フレームワークである。
実験により、Reason-IADは最先端の手法よりも一貫して優れていることが示された。
論文 参考訳(メタデータ) (2026-02-10T14:54:17Z) - DCCS-Det: Directional Context and Cross-Scale-Aware Detector for Infrared Small Target [4.318503966844226]
赤外線小目標検出(IRSTD)は、リモートセンシングや監視などのアプリケーションにおいて重要である。
本稿では,DSEブロックとLatent-aware Semantic extract and Aggregation (LaSEA)モジュールを組み込んだ新しい検出器DCCS-Detを提案する。
実験により、DCCS-Detは複数のデータセットをまたいだ競合効率で最先端の検出精度を達成することが示された。
論文 参考訳(メタデータ) (2026-01-23T03:53:59Z) - Cascading multi-agent anomaly detection in surveillance systems via vision-language models and embedding-based classification [0.0]
この研究は、補完パラダイムをコヒーレントで解釈可能なアーキテクチャに統一するカスケーディングマルチエージェントフレームワークを導入している。
初期モジュールは再構成ゲートフィルタリングとオブジェクトレベルの評価を行い、高レベルの推論エージェントは、意味的に曖昧な事象を解釈するために選択的に呼び出される。
このフレームワークは、早期出力効率、適応型マルチエージェント推論、説明可能な異常属性を組み合わせることで、従来の検出パイプラインを超えて進歩し、スケーラブルなインテリジェントなビジュアル監視のための再現可能でエネルギー効率の良い基盤を確立する。
論文 参考訳(メタデータ) (2026-01-08T11:31:47Z) - Seeing the Unseen: Towards Zero-Shot Inspection for Wind Turbine Blades using Knowledge-Augmented Vision Language Models [10.230967860299504]
本稿では,ゼロショット指向の検査フレームワークを提案し,視覚言語モデルとRetrieval-Augmented Generationを統合した。
技術ドキュメント、代表参照画像、ドメイン固有のガイドラインを含むマルチモーダル知識ベースを構築する。
各種損傷カテゴリをカバーする30のラベル付きブレード画像上での枠組みの評価を行った。
論文 参考訳(メタデータ) (2025-10-26T23:19:28Z) - Rethinking Evaluation of Infrared Small Target Detection [105.59753496831739]
本稿では,画素レベルと目標レベルのパフォーマンスを取り入れたハイブリッドレベルのメトリクスを導入し,システム的エラー解析手法を提案し,クロスデータセット評価の重要性を強調した。
標準化されたベンチマークを容易にするオープンソースツールキットがリリースされた。
論文 参考訳(メタデータ) (2025-09-21T02:45:07Z) - Towards a Multi-Agent Vision-Language System for Zero-Shot Novel Hazardous Object Detection for Autonomous Driving Safety [0.0]
視覚言語推論とゼロショットオブジェクト検出を統合したマルチモーダル手法を提案する。
予測ハザードとバウンディングボックスアノテーションを一致させるために,OpenAIのCLIPモデルを取り入れたオブジェクト検出を改良する。
その結果,現在の視覚言語に基づくアプローチの長所と短所が明らかになった。
論文 参考訳(メタデータ) (2025-04-18T01:25:02Z) - Understanding and Improving Training-Free AI-Generated Image Detections with Vision Foundation Models [68.90917438865078]
顔合成と編集のためのディープフェイク技術は、生成モデルに重大なリスクをもたらす。
本稿では,モデルバックボーン,タイプ,データセット間で検出性能がどう変化するかを検討する。
本稿では、顔画像のパフォーマンスを向上させるContrastive Blurと、ノイズタイプのバイアスに対処し、ドメイン間のパフォーマンスのバランスをとるMINDERを紹介する。
論文 参考訳(メタデータ) (2024-11-28T13:04:45Z) - Innovative Horizons in Aerial Imagery: LSKNet Meets DiffusionDet for
Advanced Object Detection [55.2480439325792]
本稿では,LSKNetのバックボーンをDiffusionDetヘッドに統合したオブジェクト検出モデルの詳細な評価を行う。
提案手法は平均精度(MAP)を約45.7%向上させる。
この進歩は、提案された修正の有効性を強調し、航空画像解析の新しいベンチマークを設定する。
論文 参考訳(メタデータ) (2023-11-21T19:49:13Z) - Adversarially-Aware Robust Object Detector [85.10894272034135]
本稿では,ロバスト検出器 (RobustDet) を提案する。
本モデルは, クリーン画像の検出能力を維持しながら, 傾きを効果的に解き, 検出堅牢性を著しく向上させる。
論文 参考訳(メタデータ) (2022-07-13T13:59:59Z) - Target-aware Dual Adversarial Learning and a Multi-scenario
Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection [65.30079184700755]
本研究は、物体検出のために異なるように見える赤外線と可視画像の融合の問題に対処する。
従来のアプローチでは、2つのモダリティの根底にある共通点を発見し、反復最適化またはディープネットワークによって共通空間に融合する。
本稿では、融合と検出の連立問題に対する二段階最適化の定式化を提案し、その後、核融合と一般的に使用される検出ネットワークのためのターゲット認識デュアル逆学習(TarDAL)ネットワークに展開する。
論文 参考訳(メタデータ) (2022-03-30T11:44:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。