論文の概要: Probabilistic Modelling of Operational Design Domains, A New Approach for Testing AI Systems
- arxiv url: http://arxiv.org/abs/2609.24397v1
- Date: Mon, 21 Sep 2026 10:46:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.255992
- Title: Probabilistic Modelling of Operational Design Domains, A New Approach for Testing AI Systems
- Title(参考訳): 操作設計領域の確率論的モデリング -AIシステムテストの新しいアプローチ-
- Abstract要約: 従来のテストプロセスは、車両の検知などのMLベースのシステムに適用されると失敗する。
テスト結果は統計的にのみ解釈できるため、システムの操作領域(ODD)だけでなく、それを表すテストセットも必要となる。
ODDを記述した確率的拡張(PEON)を導入し、それらが引き起こすパーティショニングの確率分布を拡張した。
我々は,代表試験事例のサンプリング,所定の品質目標と重要度に対する厳密な最終試験基準,既存試験結果の再評価方法,およびトレーニングデータのバランス評価手法を導出する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The conventional testing process quickly fails when applied to ML-based systems such as obstacle detection in vehicles: if an obstacle is not detected in a test, classical bug fixing is impossible and an AI system will always retain shortcomings. Test results can therefore only be interpreted statistically, which in turn requires test sets that are not only complete with respect to the operational design domain (ODD) of the system, but also representative of it. To this end, we introduce probabilistically extended ontologies (PEONs): ontologies describing the ODD, augmented with a probability distribution over the partitioning they induce. Instead of unmaintainable conditional probability tables, only marginal distributions and functionally described dependencies need to be specified; algorithms based on couplings and optimal transport complete this specification to a Bayesian network. From a PEON we derive the sampling of representative test cases, rigorous end-of-test criteria for given quality targets and significance levels, and methods for re-evaluating existing test results and for assessing the balance of training data. We demonstrate the practical modelling of a complex ODD using the example of automatic train operation.
- Abstract(参考訳): 従来のテストプロセスは、車両の障害物検出などのMLベースのシステムに適用した場合、即座に失敗する。もしテストで障害が検出されない場合、古典的なバグ修正は不可能であり、AIシステムは常に欠点を保っている。
したがって、テスト結果は統計的にのみ解釈できるため、システムの運用設計領域(ODD)に対して完全ではなく、その代表となるテストセットが必要である。
この目的のために、確率的拡張オントロジー(PEON)を導入し、ODDを記述するオントロジーを、それらが引き起こすパーティショニングの確率分布で拡張する。
保守不能な条件付き確率表の代わりに、限界分布と機能的に記述された依存関係のみを指定する必要がある。
PEONから,代表試験事例のサンプリング,所定の品質目標と重要度に対する厳密なテスト終了基準,既存のテスト結果の再評価方法,トレーニングデータのバランス評価手法を導出する。
自動列車運転例を用いて複雑なODDの実用モデリングを実演する。
関連論文リスト
- Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data [73.19814469893088]
デジタルツインと学習された世界モデルは、エンジニアリングシステムにおける人工知能(AI)モデルのトレーニングに利用可能な、少ない実際のデータセットを増大させる合成データを生成するために、ますます使われています。
本稿では,拡張データセットのトレーニングが真の,人口レベルのパフォーマンスを向上する一方で,実際のテストデータポイントを可能な限り少なく消費するかどうかを論じる。
合成データ分類タスク、DT支援無線パケットスケジューリングタスク、および無線マップ予測タスクにおいて、aeSFTは平均ベースのシーケンシャルテストよりもはるかに少ない実検サンプルを用いて有用な合成データを識別することを示す。
論文 参考訳(メタデータ) (2026-08-28T07:05:38Z) - Kernel conditional tests from learning-theoretic bounds [16.813275168865953]
本研究では,条件付き確率分布の仮説テストのためのフレームワークを提案する。
次に、条件分布の関数の統計的テストを構築する。
本研究は,機能検査の総合的基盤を構築した。
論文 参考訳(メタデータ) (2025-06-04T12:53:13Z) - Generalization is not a universal guarantee: Estimating similarity to training data with an ensemble out-of-distribution metric [0.09363323206192666]
機械学習モデルの新しいデータへの一般化の失敗は、AIシステムの信頼性を制限する中核的な問題である。
本稿では、一般化可能性推定(SAGE)のための教師付きオートエンコーダを構築することにより、データの類似性を評価するための標準化されたアプローチを提案する。
モデル自体のトレーニングやテストデータセットのデータに適用しても,SAGEスコアのフィルタリング後にアウト・オブ・ボックスモデルの性能が向上することを示す。
論文 参考訳(メタデータ) (2025-02-22T19:21:50Z) - Density-based Feasibility Learning with Normalizing Flows for
Introspective Robotic Assembly [20.92328610763089]
本稿では,実例のみを必要とする密度に基づく実現可能性学習法を提案する。
提案手法は,ロボット組立のユースケースで実証され,他の単一クラスベースラインよりも優れていた。
論文 参考訳(メタデータ) (2023-07-03T19:43:53Z) - User-defined Event Sampling and Uncertainty Quantification in Diffusion
Models for Physical Dynamical Systems [49.75149094527068]
拡散モデルを用いて予測を行い,カオス力学系に対する不確かさの定量化が可能であることを示す。
本研究では,雑音レベルが低下するにつれて真の分布に収束する条件付きスコア関数の確率的近似法を開発する。
推論時に非線形ユーザ定義イベントを条件付きでサンプリングすることができ、分布の尾部からサンプリングした場合でもデータ統計と一致させることができる。
論文 参考訳(メタデータ) (2023-06-13T03:42:03Z) - Robust Continual Test-time Adaptation: Instance-aware BN and
Prediction-balanced Memory [58.72445309519892]
テストデータストリーム以外のデータストリームに対して堅牢な新しいテスト時間適応方式を提案する。
a)分布外サンプルの正規化を修正するIABN(Instance-Aware Batch Normalization)と、(b)クラスバランスのない方法で非i.d.ストリームからのデータストリームをシミュレートするPBRS(Predict- Balanced Reservoir Sampling)である。
論文 参考訳(メタデータ) (2022-08-10T03:05:46Z) - CAFA: Class-Aware Feature Alignment for Test-Time Adaptation [50.26963784271912]
テスト時間適応(TTA)は、テスト時にラベルのないデータにモデルを適応させることによって、この問題に対処することを目的としている。
本稿では,クラス認識特徴アライメント(CAFA, Class-Aware Feature Alignment)と呼ばれる単純な機能アライメント損失を提案する。
論文 参考訳(メタデータ) (2022-06-01T03:02:07Z) - Training on Test Data with Bayesian Adaptation for Covariate Shift [96.3250517412545]
ディープニューラルネットワークは、信頼できない不確実性推定で不正確な予測を行うことが多い。
分布シフトの下でのラベルなし入力とモデルパラメータとの明確に定義された関係を提供するベイズモデルを導出する。
本手法は精度と不確実性の両方を向上することを示す。
論文 参考訳(メタデータ) (2021-09-27T01:09:08Z) - Learn what you can't learn: Regularized Ensembles for Transductive
Out-of-distribution Detection [76.39067237772286]
ニューラルネットワークの現在のアウト・オブ・ディストリビューション(OOD)検出アルゴリズムは,様々なOOD検出シナリオにおいて不満足な結果をもたらすことを示す。
本稿では,テストデータのバッチを観察した後に検出方法を調整することで,このような「ハード」なOODシナリオがいかに有用かを検討する。
本稿では,テストデータと正規化に人工ラベリング手法を用いて,テストバッチ内のOODサンプルに対してのみ矛盾予測を生成するモデルのアンサンブルを求める手法を提案する。
論文 参考訳(メタデータ) (2020-12-10T16:55:13Z) - Efficient statistical validation with edge cases to evaluate Highly
Automated Vehicles [6.198523595657983]
自動運転車の大規模展開は、まだ解決されていない多くの安全上の課題にもかかわらず、差し迫っているようだ。
既存の標準は、検証が要求をカバーするテストケースのセットだけを必要とする決定論的プロセスに焦点を当てています。
本稿では, 自動生成テストケースを最悪のシナリオに偏り付け, システムの挙動の統計的特性を計算するための新しい手法を提案する。
論文 参考訳(メタデータ) (2020-03-04T04:35:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。