論文の概要: Self-Adaptive Anomaly Detection with Reinforcement Learning and Human Feedback in Connected Vehicles
- arxiv url: http://arxiv.org/abs/2607.08373v1
- Date: Thu, 09 Jul 2026 11:48:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.51111
- Title: Self-Adaptive Anomaly Detection with Reinforcement Learning and Human Feedback in Connected Vehicles
- Title(参考訳): 強化学習と人間フィードバックを用いた連結車両の自己適応型異常検出
- Authors: Matthias Weiß, Athreya Hosahalli Prakash, Maurice Artelt, Falk Dettinger, Nasser Jazdi, Michael Weyrich,
- Abstract要約: 本稿では,自律型CPSのためのオンライン異常検出フレームワークを提案する。
自己注意を伴う分解された深いQネットワークは、監視対象サービス毎に候補プールから最も適切な検出器を選択する。
保留中のトランジションバッファと60/40の優先順位付けされたリプレイ戦略を中心に構築されたHuman-in-the-loopリトレーニング機構により、オペレーターは専門家の知識を組み込むことができる。
- 参考スコア(独自算出の注目度): 0.3324986723090369
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Connected vehicles are autonomous cyber-physical systems whose behavior must be continuously monitored during operation to detect deviations from normal operation before they propagate into failures. Such evaluation is challenging because the systems themselves evolve: over-the-air updates, configuration changes, and shifting workloads alter the definition of normal behavior, causing static diagnostic methods to degrade silently over time. Existing approaches typically address either automated model adaptation or operator integration in isolation, rather than as a single coordinated supervisory loop. This paper presents an online anomaly detection framework for autonomous CPS that integrates three coordinated mechanisms. A factorized deep Q-network with self-attention selects the most suitable detector from a candidate pool for each monitored service, exploiting inter-service dependencies in the microservice topology. An ensemble of three statistical drift detectors monitors the input distribution and raises an alarm only when all three concur, prioritizing precision over recall. A human-in-the-loop retraining mechanism, built around a pending transition buffer and a 60/40 prioritized replay strategy, allows the operator to incorporate expert knowledge while preserving the system's learned response to prior data distributions. The framework is evaluated on a connected-vehicle testbed running an automated valet parking application across seven backend microservices. The attention-augmented agent achieves an F1 score of 0.69, compared to at most 0.11 for any single detector applied uniformly. Following a real software update that induces measurable concept drift, F1 drops to 0.52; after operator-triggered retraining, performance recovers to 0.65 on the new distribution while remaining at 0.69 on the prior one, demonstrating sustained adaptation without catastrophic forgetting.
- Abstract(参考訳): 接続された車両は自律的なサイバー物理システムであり、正常な操作から逸脱を検知するためには、動作を継続的に監視する必要がある。
オーバー・ザ・エアの更新、設定の変更、ワークロードのシフトなど、システム自体が進化しているため、このような評価は難しい。
既存のアプローチは通常、単一の調整されたスーパーバイザループとしてではなく、独立して自動モデル適応またはオペレータ統合に対処する。
本稿では,3つの協調機構を統合した自律型CPSのためのオンライン異常検出フレームワークを提案する。
自己アテンションを備えたファクタライズされたディープQネットワークは、監視対象サービス毎の候補プールから最も適切な検出器を選択し、マイクロサービストポロジにおけるサービス間依存関係を活用する。
3つの統計的ドリフト検出器のアンサンブルは、入力分布を監視し、3つの共起がすべて一致する場合にのみアラームを発生させ、リコールの精度を優先する。
保留中のトランジションバッファと60/40の優先順位付けされたリプレイ戦略を中心に構築されたHuman-in-the-loopリトレーニング機構により、オペレータは、事前のデータ分散に対するシステムの学習した応答を保ちながら、専門家の知識を組み込むことができる。
このフレームワークは、7つのバックエンドマイクロサービスにまたがる自動Valetパーキングアプリケーションを実行するコネクテッドビークルテストベッドで評価される。
注意増強剤はF1スコアが0.69であるのに対し、一様に塗布された1つの検出器は0.11である。
測定可能なコンセプトドリフトを誘導する実際のソフトウェア更新の後、F1は0.52に低下し、オペレーターによる再トレーニングの後、前のバージョンでは0.69に留まり、新しいディストリビューションでは0.65に回復する。
関連論文リスト
- Validation-Gated Multi-Agent Governance for Online Adaptation of Thermal-Hydraulic Surrogate Models under Operating-Regime Shift [3.732931548972571]
本研究では,実験熱水循環データに対するガード付き連続適応フレームワークを開発した。
MA-Fullモードでは、ロール分離されたマルチエージェント・カウンシルが評価ストリームの各ステップをレビューし、最低平均誤差5.72、35.8%を達成している。
論文 参考訳(メタデータ) (2026-06-02T08:31:48Z) - EAGLE: Edge-Aware Graph Learning for Proactive Delivery Delay Prediction in Smart Logistics Networks [0.5653106385738822]
本稿では,プロアクティブサプライチェーンリスク管理のためのハイブリッドディープラーニングフレームワークを提案する。
提案手法は,軽量な Transformer patch encoder を用いて時間次数フローのダイナミクスを共同でモデル化する。
このフレームワークは0.0089のクロスシードF1標準偏差を示しており、最高の改良版よりも3.8倍改善されている。
論文 参考訳(メタデータ) (2026-04-06T23:35:15Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Beyond Reward Suppression: Reshaping Steganographic Communication Protocols in MARL via Dynamic Representational Circuit Breaking [0.0]
監視を回避するためのプライベートプロトコルを開発するエージェントによるステガノグラフィーの共謀は、AIの安全性に重大な脅威をもたらす。
既存の防御は行動層や報酬層に限られており、潜伏する通信路での調整を検知できない。
本稿では,動的表現回路ブレーカ(DRCB)について紹介する。
論文 参考訳(メタデータ) (2026-03-07T04:14:38Z) - World Model Failure Classification and Anomaly Detection for Autonomous Inspection [23.48742973289626]
教師付き障害分類と異常検出を組み合わせたハイブリッドフレームワークを提案する。
我々のアプローチは、圧縮されたビデオ入力を持つ世界モデルバックボーンを使用する。
実験では、成功、失敗、およびOODケースの区別において90%以上の精度が示されている。
論文 参考訳(メタデータ) (2026-02-18T04:41:14Z) - Axle Sensor Fusion for Online Continual Wheel Fault Detection in Wayside Railway Monitoring [1.1199585259018456]
本研究は,鉄道断層診断のためのセマンティック・アウェア,ラベル効率のよい連続学習フレームワークを提案する。
このモデルは、フラットやポリゴン化による小さな欠陥を検出しながら、進化する運用条件に適応する。
論文 参考訳(メタデータ) (2026-02-18T00:14:18Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - Unsupervised Domain Adaptation for Self-Driving from Past Traversal
Features [69.47588461101925]
本研究では,新しい運転環境に3次元物体検出器を適応させる手法を提案する。
提案手法は,空間的量子化履歴特徴を用いたLiDARに基づく検出モデルを強化する。
実世界のデータセットの実験では、大幅な改善が示されている。
論文 参考訳(メタデータ) (2023-09-21T15:00:31Z) - Unsupervised Adaptation from Repeated Traversals for Autonomous Driving [54.59577283226982]
自動運転車はエンドユーザー環境に一般化し、確実に動作させなければならない。
潜在的な解決策の1つは、エンドユーザの環境から収集されたラベルのないデータを活用することである。
適応過程を監督する信頼性のある信号はターゲット領域に存在しない。
この単純な仮定は、ターゲット領域上の3次元物体検出器の反復的自己学習を可能にする強力な信号を得るのに十分であることを示す。
論文 参考訳(メタデータ) (2023-03-27T15:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。