論文の概要: Search-Based Metamorphic Testing of Vision-Language Models in Autonomous Underwater Robotic Software
- arxiv url: http://arxiv.org/abs/2609.17007v1
- Date: Tue, 15 Sep 2026 11:19:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.470493
- Title: Search-Based Metamorphic Testing of Vision-Language Models in Autonomous Underwater Robotic Software
- Title(参考訳): 自律型水中ロボットソフトウェアにおける視覚言語モデルの探索に基づくメタモルフィックテスト
- Abstract要約: 本稿では,水中画像上の最小限の変換を識別する検索ベースメタモルフィックテスト手法(MetaVLM)を提案する。
我々は、NSGA-IIを多目的探索アルゴリズムとして採用し、オープンソースの視覚言語モデルに対して評価する。
この結果をもとに,VLMベースのソフトウェアシステムの品質保証に取り組むソフトウェア技術者や研究者に教訓を導出する。
- 参考スコア(独自算出の注目度): 11.787013371593458
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Our industry partner focuses on quality assurance for industrial systems across multiple domains, including maritime systems, such as overwater vessels and autonomous underwater robots (AURs). Despite the strong performance of vision-language models (VLMs) in scene understanding, image captioning, and object recognition, their use in AUR software operating in underwater environments is underexplored. Therefore, in this context, it is important to evaluate the quality of VLMs for integration into AUR software and, so, automated software testing tools are needed to assess their suitability and improve their dependability. To this end, we propose a search-based metamorphic testing approach (MetaVLM) that identifies a minimal set of transformations on underwater images to induce incorrect model predictions, thereby revealing VLM failures. We employ NSGA-II as a multi-objective search algorithm and evaluate it over open-source VLMs, BLIP and CLIP, against a random search baseline. Results demonstrate the strengths and limitations of each VLM in the context of AUR software systems. Based on the results, we derive lessons for software engineering practitioners and researchers working on quality assurance of VLM-based software systems.
- Abstract(参考訳): 我々の業界パートナーは、オーバーウォーター船や自律水中ロボット(AURs)といった海洋システムを含む、複数のドメインにわたる産業システムの品質保証に重点を置いています。
映像理解、画像キャプション、物体認識における視覚言語モデル(VLM)の性能は高いが、水中環境で動作するAURソフトウェアでの利用は過小評価されている。
したがって、この文脈では、AURソフトウェアに統合するためのVLMの品質を評価することが重要であり、その適合性を評価し、信頼性を向上させるためには、自動ソフトウェアテストツールが必要である。
そこで本研究では,海底画像上の最小限の変換を識別し,誤ったモデル予測を誘導し,VLMの故障を明らかにする検索ベースメタモルフィックテスト手法を提案する。
NSGA-IIを多目的探索アルゴリズムとして使用し,オープンソースのVLM,BLIP,CLIPに対してランダムな探索ベースラインに対して評価する。
その結果、AURソフトウェアシステムにおける各VLMの強みと限界が示された。
この結果をもとに,VLMベースのソフトウェアシステムの品質保証に取り組むソフトウェア技術者や研究者に教訓を導出する。
関連論文リスト
- Assessing Vision-Language Models for Perception in Autonomous Underwater Robotic Software [11.787013371593458]
Vision-Language Models (VLMs) は自律型水中ロボット(AURs)に有望なソリューションを提供する
AURソフトウェアにおけるVLMに基づく知覚モジュールの実証評価について述べる。
論文 参考訳(メタデータ) (2026-02-11T08:59:44Z) - Failure Modes in LLM Systems: A System-Level Taxonomy for Reliable AI Applications [0.0]
大規模言語モデル(LLM)は、意思決定支援ツール、自動化、AI対応ソフトウェアシステムに急速に統合されている。
本稿では,現実のLLMアプリケーションで発生する15の隠れ障害モードのシステムレベルでの分類について述べる。
論文 参考訳(メタデータ) (2025-11-25T05:19:23Z) - VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality [0.20482269513546458]
本稿では,学術評価と企業要件のギャップを埋める包括的枠組みであるVLM-in-the-Wild(ViLD)を紹介する。
我々は,ロゴ検出,OCR,オブジェクト検出,人間の存在と人口統計分析,人間の活動と外観分析,シーン検出,カメラ視点とメディア品質評価,支配的な色,包括的記述,NSFW検出の10つのビジネスクリティカルタスクを定義した。
ViLDの有効性を示すために,実世界の100万枚の画像とビデオのコーパスから慎重に階層化された7500種類のサンプルのベンチマークデータセットを構築した。
論文 参考訳(メタデータ) (2025-09-03T05:54:03Z) - Using LLMs and Essence to Support Software Practice Adoption [0.3609538870261841]
本研究では,ソフトウェアエンジニアリングプラクティスを管理するための標準および思考フレームワークであるEssenceと,大規模言語モデル(LLM)の統合について検討する。
提案システムは、ドメイン固有のタスクにおいて、ベースラインよりも一貫して優れている。
論文 参考訳(メタデータ) (2025-08-22T14:59:35Z) - Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision [49.073964142139495]
マルチモーダル融合法と視覚言語モデルの適用と進歩を体系的に検討する。
セマンティックシーン理解タスクでは、エンコーダデコーダフレームワーク、アテンションベースアーキテクチャ、グラフニューラルネットワークに融合アプローチを分類する。
クロスモーダルアライメント、効率的な融合、リアルタイムデプロイメント、ドメイン適応など、現在の研究における重要な課題を特定します。
論文 参考訳(メタデータ) (2025-04-03T10:53:07Z) - EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents [57.468696197956604]
EmbodiedEvalは、組み込みタスクを持つMLLMの総合的かつインタラクティブな評価ベンチマークである。
多様性が大幅に向上した既存のAIタスクの幅広い範囲をカバーする。
EmbodiedEval における最先端MLLM の評価を行い,人体作業における人体レベルと比較して有意に不足していることがわかった。
論文 参考訳(メタデータ) (2025-01-21T03:22:10Z) - Visual Language Models as Operator Agents in the Space Domain [36.943670587532026]
VLM(Vision-Language Models)は、宇宙ミッションにおける自律的な制御と意思決定を強化する。
ソフトウェア環境では、複雑な軌道操作を行うために、VLMを用いてグラフィカルユーザインタフェースの視覚的なスクリーンショットを解釈する。
ハードウェアの分野では、衛星などの物理空間オブジェクトを検査・診断するためのカメラを備えたロボットシステムとVLMを統合する。
論文 参考訳(メタデータ) (2025-01-14T03:03:37Z) - Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset [92.99416966226724]
我々は、未学習アルゴリズムの有効性を頑健に評価するために設計された新しいVLMアンラーニングベンチマークであるFacial Identity Unlearning Benchmark (FIUBench)を紹介する。
情報ソースとその露出レベルを正確に制御する2段階評価パイプラインを適用した。
FIUBench 内の 4 つのベースライン VLM アンラーニングアルゴリズムの評価により,すべての手法がアンラーニング性能に制限されていることが明らかとなった。
論文 参考訳(メタデータ) (2024-11-05T23:26:10Z) - AutoBench-V: Can Large Vision-Language Models Benchmark Themselves? [65.92331309449015]
本稿では,モデル能力の特定の側面に基づいてLVLMをベンチマークする,オンデマンドで評価を行う自動フレームワークであるAutoBench-Vを紹介する。
5つの要求されたユーザ入力に対して9つの人気のあるLVLMを広範囲に評価することにより、このフレームワークの有効性と信頼性を示す。
論文 参考訳(メタデータ) (2024-10-28T17:55:08Z) - MarkLLM: An Open-Source Toolkit for LLM Watermarking [80.00466284110269]
MarkLLMは、LLMウォーターマーキングアルゴリズムを実装するためのオープンソースのツールキットである。
評価のために、MarkLLMは3つの視点にまたがる12のツールと、2種類の自動評価パイプラインを提供する。
論文 参考訳(メタデータ) (2024-05-16T12:40:01Z) - IM-IAD: Industrial Image Anomaly Detection Benchmark in Manufacturing [88.35145788575348]
画像異常検出(英: Image Anomaly Detection、IAD)は、産業用コンピュータビジョンの課題である。
統一IMベンチマークの欠如は、現実世界のアプリケーションにおけるIADメソッドの開発と利用を妨げる。
7つの主要なデータセットに19のアルゴリズムを含む包括的画像異常検出ベンチマーク(IM-IAD)を構築した。
論文 参考訳(メタデータ) (2023-01-31T01:24:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。