論文の概要: Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control
- arxiv url: http://arxiv.org/abs/2608.04732v1
- Date: Wed, 05 Aug 2026 11:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.876224
- Title: Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control
- Title(参考訳): 安全なアクタークリティカル最適制御における適応的体験リプレイとオンライン不確かさ推定の統合に向けて
- Authors: Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima Samadzadeh,
- Abstract要約: 本研究では,制御バリア関数が使用する障害物形状を不確実性推定により更新する統合アーキテクチャを開発する。
本研究では,2次元ロボットナビゲーションタスクのアーキテクチャを,破壊された障害物計測を用いてインスタンス化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Safe actor-critic control often treats barrier filtering, uncertainty estimation, and experience replay as separate modules, even though each changes the data used for learning and control. We develop an integrated architecture in which the uncertainty estimate updates the obstacle geometry used by a control barrier function, filter interventions and estimation residuals determine replay priority, and the critic learns from the executed rather than nominal action. We instantiate the architecture on a two-dimensional robot-navigation task with corrupted obstacle measurements and compare six component-matched configurations under common training budgets, random seeds, sensor streams, exploration, and disturbances. Evaluation includes a moderate post-training test, an eleven-level perception-noise sweep, and an exploratory extreme-stress test at multiplier $6.0$. In the extreme test, the integrated configuration recorded no contacts and reached the goal in all five evaluation seeds. Its mean cost was $7.63\pm0.44$ and its obstacle-belief root-mean-square error was $3.52\pm0.55$ cm. The uncertainty-estimation ablation also recorded no contacts but reached the goal in four of five seeds, with mean cost $8.96\pm2.08$ and belief error $11.08\pm1.23$ cm. A finite-training bound clarifies replay exposure, and a robust barrier condition states the required estimation-error and feasibility assumptions. The results support coupling estimation, safety filtering, and replay on this benchmark; broader safety and convergence claims require further study.
- Abstract(参考訳): 安全なアクター批判制御は、学習と制御に使用されるデータを変更しても、バリアフィルタリング、不確実性推定、経験リプレイを別々のモジュールとして扱うことが多い。
本研究では,制御バリア関数が使用する障害物形状を不確実性推定で更新し,フィルタの介入と推定残差でリプレイの優先度が決定される統合アーキテクチャを開発し,批判者は名目的行動ではなく実行から学習する。
本研究では,2次元ロボットナビゲーションタスクにおいて,損傷した障害物の測定を行い,一般的なトレーニング予算,ランダムシード,センサストリーム,探索,外乱の6つのコンポーネントマッチング構成を比較した。
評価には、適度なポストトレーニングテスト、11レベルの知覚ノイズスイープ、および6.0ドルの乗算で探索的な極端なストレステストが含まれる。
極端なテストでは、統合された構成は接触を記録せず、5つの評価種すべてで目標に達した。
平均的なコストは7.63 pm0.44$、障害物を許容するルート平均二乗誤差は3.52 pm0.55$ cmである。
不確実性推定アブレーションは接触も記録しなかったが、平均コストが8.96 pm2.08$、信念誤差が11.08 pm1.23$ cmの5つの種のうち4つで目標に達した。
有限トレーニング境界は、リプレイ露光を明らかにし、ロバストバリア条件は、要求される推定エラーと実現可能性の仮定を記述している。
結果は、このベンチマークにおける結合推定、安全性フィルタリング、リプレイをサポートし、より広範な安全性と収束のクレームはさらなる研究が必要である。
関連論文リスト
- When May a Model Replace the Experiment? Audits, Licenses, and the Price of Trust in Surrogate-Driven Design [8.037395295172088]
化学、材料科学、機械学習におけるデザインキャンペーンはボトルネックを共有している。
これらの結果を予測する機械学習サロゲートは、候補を提案するだけでなく、それらを格付けし、測定したように自身の予測を検索に戻すためにも使われるようになっている。
我々は、この慣行が安全で、どんな安全証明書もコストがかからず、代金が確実に支払うことを確約する。
論文 参考訳(メタデータ) (2026-08-02T16:59:29Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations [55.76952683833966]
本稿では,データ破損時の信頼性設定サイズを低減するために,重み付きCONCH(W-CONCH)と重み付きCROC(W-CROC)を提案する。
画像ベースおよび実世界の変化点と根本原因ベンチマークの実験は、不確実性ベースの重み付けが信頼性セットのサイズを大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-29T05:16:59Z) - Safety-Aware Cascaded Inference for Crop Damage Assessment with Controlled Error Trade-offs [0.0]
小作農の絵ベースの農業保険では、被害検出の欠落は誤報よりもかなり高いコストがかかる。
本稿では,2段階のカスケードアーキテクチャであるCascadeCropNetを提案する。
軽量のセンチネルモデルでは2値の健康トリアージを行い、キャリブレーションされた損傷確率閾値タウを超えるサンプルを専門家モデルにエスカレーションして詳細な診断を行う。
論文 参考訳(メタデータ) (2026-07-28T09:01:27Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - Reinforcement Learning Trained Observer Control for Bearings-Only Tracking [0.9167082845109437]
本稿では、自律型ベアリングのみの移動目標追跡のための強化学習に基づくオブザーバ制御ポリシーを開発する。
報酬関数は、絶対目標位置推定誤差の最小化とCKF推定一貫性の維持という、2つの矛盾する目標に対処するように設計されている。
その結果、DQNの$0.7ドルのポリシーは、正確性と堅牢性の間の最良のトレードオフを達成していることがわかった。
論文 参考訳(メタデータ) (2026-05-04T00:55:14Z) - Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs [51.56484100374058]
ガードレールの設計には、敵の堅牢性、良質なタスクのユーザビリティ、応答レイテンシの明確なトレードオフが伴う。
決定論的パターンフィルタ,構造検証,コンテキストサンドボックス,セッションレベルの動作チェックを組み合わせた,ドメイン固有のマルチレイヤセーフガードパイプラインの評価を行った。
NeMoは16.22パーセントのFPRと1.5パーセントのレイテンシで0パーセントのバイパスに達し、Prompt Guardは38.48パーセントのFPRと3.60パーセントのバイパスを実現している。
論文 参考訳(メタデータ) (2026-03-29T18:52:01Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。