論文の概要: TestifAI: Tomography-Based Testing for Deep Learning Systems
- arxiv url: http://arxiv.org/abs/2608.18900v2
- Date: Thu, 20 Aug 2026 10:50:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.623041
- Title: TestifAI: Tomography-Based Testing for Deep Learning Systems
- Title(参考訳): TestifAI: ディープラーニングシステムのためのトモグラフィーベースのテスト
- Abstract要約: TestifAIは、摂動の組み合わせに対する堅牢性を効率的かつ正確に推定するためのフレームワークである。
少数の摂動のみを適用したテストから多摂動空間におけるモデル挙動を再構成する。
低次 (1 と 2 の摂動) 観測から高次 (3 と 4 の摂動) テスト結果を予測することができ、集合的強靭性推定誤差は 7% 未満である。
- 参考スコア(独自算出の注目度): 42.86570387250456
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI systems are increasingly deployed in safety-critical application domains (e.g., autonomous driving), associated risks increase too. Deep learning models underlying modern AI systems, therefore, must undergo thorough testing to ensure their correct behaviour. A single robustness test involves thousands of inferences to empirically verify if a model's outputs remain stable under a bounded perturbation of its inputs. However, existing testing frameworks lack the means to systematically explore and summarise robustness across a combinatorial space of perturbations. We propose TestifAI, a deep learning testing framework for efficient and accurate estimation of robustness against combinations of perturbations. TestifAI enables users to specify operational conditions as structured spaces of semantic input perturbations (e.g., image blur, brightness and zoom) and discrete severity levels (e.g., low, medium and high). Users can query model robustness for any combination (e.g., "low blur, high brightness, and medium zoom"). To achieve efficiency and accuracy, TestifAI introduces partial model tomography, a novel approach to reconstructing model behaviour in a multi-perturbation space from tests that apply only a small number of perturbations (lower-order projections). To estimate robustness against at least three perturbations, TestifAI trains an auxiliary model on the results of tests involving up to two perturbations only, avoiding execution of an exponential number of tests. Our experiments on five image and language classification tasks show that TestifAI can predict higher-order (3 and 4 perturbations) test outcomes from low-order (1 and 2 perturbations) observations with an aggregate robustness estimation error of less than 7%, while reducing the number of inferences by 60-80%.
- Abstract(参考訳): AIシステムは、安全クリティカルなアプリケーションドメイン(例えば自動運転)にますますデプロイされているため、関連するリスクも増加します。
したがって、現代のAIシステムの基盤となるディープラーニングモデルは、彼らの正しい振る舞いを保証するために徹底的なテストを行う必要がある。
単一のロバスト性テストは、モデル出力がその入力の有界摂動の下で安定であるかどうかを実証的に検証する数千の推論を含む。
しかし、既存のテストフレームワークには、摂動の組合せ空間をまたいだ堅牢性を体系的に探求し、要約する手段が欠けている。
摂動の組み合わせに対するロバストネスの効率的かつ正確な評価を行うためのディープラーニングテストフレームワークであるTestifAIを提案する。
TestifAIは、ユーザが操作条件を、セマンティック入力摂動(例えば、画像のぼやけ、明るさ、ズーム)と離散重大度レベル(例えば、低、中、高)の構造化された空間として指定することができる。
任意の組み合わせ(例えば、"低ボケ、高輝度、中程度のズーム")に対して、モデルロバストネスをクエリできる。
効率と精度を達成するために、TestifAIは、少数の摂動(低次射影)のみを適用するテストから、多摂動空間におけるモデル挙動を再構築するための新しいアプローチである、部分モデルトモグラフィーを導入した。
少なくとも3回の摂動に対して頑健さを推定するために、TestifAIは2回の摂動のみを含むテストの結果に対して補助モデルを訓練し、指数的な数のテストの実行を避けた。
画像分類と言語分類の5つの課題について実験した結果,低次(1と2の摂動)観測から高次(3と4の摂動)検定結果を7%未満で予測できる一方で,推測回数を60~80%削減できることがわかった。
関連論文リスト
- TESTNAV: Pareto-Guided Search for Compositional Robustness Testing [42.86570387250456]
TESTNAVは、ディープラーニングモデルのための双方向の堅牢性テストフレームワークである。
モダリティ比の指標によって測定された入力忠実度を保ちながら、性能劣化を最大化する。
論文 参考訳(メタデータ) (2026-08-20T10:43:22Z) - Modest-Align: Data-Efficient Alignment for Vision-Language Models [67.48633659305592]
クロスモーダルアライメントモデルは、リソース制約のある環境での運用において、過信と劣化したパフォーマンスに悩まされることが多い。
我々は,ロバスト性と効率性に配慮した軽量アライメントフレームワークであるModest-Alignを提案する。
本手法は,実世界の低リソースシナリオにおけるクロスモーダルアライメントを実現するための,実用的でスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2025-10-24T16:11:10Z) - Consistency-based Abductive Reasoning over Perceptual Errors of Multiple Pre-trained Models in Novel Environments [5.5855749614100825]
本稿では,複数の事前学習モデルを活用することで,このリコール低減を緩和できるという仮説を述べる。
我々は,一貫性に基づく推論問題として,様々なモデルからの矛盾する予測を特定し,管理することの課題を定式化する。
本研究は,複数の不完全なモデルから得られた知識を,難易度の高い新しいシナリオにおいて堅牢に統合するための効果的なメカニズムとして,一貫性に基づく誘拐の有効性を検証するものである。
論文 参考訳(メタデータ) (2025-05-25T23:17:47Z) - A Few Large Shifts: Layer-Inconsistency Based Minimal Overhead Adversarial Example Detection [13.109309606764754]
我々は、ターゲットモデル自体の内部の階層的不整合を利用するプラグイン検出フレームワークを導入する。
本手法は計算オーバーヘッドを無視して最先端検出性能を実現する。
論文 参考訳(メタデータ) (2025-05-19T00:48:53Z) - Multi-stream deep learning framework to predict mild cognitive impairment with Rey Complex Figure Test [10.324611550865926]
2つの異なる処理ストリームを統合するマルチストリームディープラーニングフレームワークを開発した。
提案したマルチストリームモデルは,外部検証においてベースラインモデルよりも優れた性能を示した。
本モデルは,早期スクリーニングのための費用対効果のあるツールとして機能する,臨床現場における実用的意味を持つ。
論文 参考訳(メタデータ) (2024-09-04T17:08:04Z) - Scalable Similarity-Aware Test Suite Minimization with Reinforcement Learning [6.9290255098776425]
TripRLは、多種多様なテストスイートを高いテスト効率で生成する新しい技術である。
本稿では,TripRLのランタイムは,Multi-Criteria Test Suite Minimization問題の規模と線形にスケール可能であることを示す。
論文 参考訳(メタデータ) (2024-08-24T08:43:03Z) - High-Dimensional Fault Tolerance Testing of Highly Automated Vehicles Based on Low-Rank Models [39.139025989575686]
HAVの安全性を評価するために, フォールトインジェクション(FI)試験を実施している。
テストケースを完全にカバーするためには、さまざまな駆動シナリオと障害設定を検討する必要がある。
低ランクスムースネス正規化行列因子化フレームワークにおけるFI試験の高速化を提案する。
論文 参考訳(メタデータ) (2024-07-28T14:27:13Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Uncertainty-inspired Open Set Learning for Retinal Anomaly
Identification [71.06194656633447]
9つの網膜条件の基底像をトレーニングし,不確実性に着想を得たオープンセット(UIOS)モデルを構築した。
しきい値戦略を持つUIOSモデルはF1スコア99.55%、97.01%、91.91%を達成した。
UIOSは、高い不確実性スコアを正しく予測し、非ターゲットの網膜疾患、低品質の眼底画像、および非基本画像のデータセットを手動でチェックする必要があることを示唆した。
論文 参考訳(メタデータ) (2023-04-08T10:47:41Z) - Detecting Errors and Estimating Accuracy on Unlabeled Data with
Self-training Ensembles [38.23896575179384]
本稿では,この2つの課題に同時に対処する,原則的かつ実用的な枠組みを提案する。
1つのインスタンス化は、教師なし精度推定における推定誤差を少なくとも70%削減し、エラー検出のためのF1スコアを少なくとも4.7%改善する。
iWildCamでは、教師なし精度推定における推定誤差を少なくとも70%削減し、エラー検出のためのF1スコアを少なくとも4.7%改善する。
論文 参考訳(メタデータ) (2021-06-29T21:32:51Z) - Anomaly Detection in Cybersecurity: Unsupervised, Graph-Based and
Supervised Learning Methods in Adversarial Environments [63.942632088208505]
現在の運用環境に固有ののは、敵対的機械学習の実践である。
本研究では,教師なし学習とグラフに基づく異常検出の可能性を検討する。
我々は,教師付きモデルの訓練時に,現実的な対人訓練機構を組み込んで,対人環境における強力な分類性能を実現する。
論文 参考訳(メタデータ) (2021-05-14T10:05:10Z) - Attribute-Guided Adversarial Training for Robustness to Natural
Perturbations [64.35805267250682]
本稿では,属性空間への分類器の露出を最大化するために,新しいサンプルを生成することを学習する逆学習手法を提案する。
我々のアプローチは、ディープニューラルネットワークが自然に発生する摂動に対して堅牢であることを可能にする。
論文 参考訳(メタデータ) (2020-12-03T10:17:30Z) - SUOD: Accelerating Large-Scale Unsupervised Heterogeneous Outlier
Detection [63.253850875265115]
外乱検出(OD)は、一般的なサンプルから異常物体を識別するための機械学習(ML)タスクである。
そこで我々は,SUODと呼ばれるモジュール型加速度システムを提案する。
論文 参考訳(メタデータ) (2020-03-11T00:22:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。