論文の概要: Real-Time Hard Peak Age-of-Information Safety with No-Regret Learning
- arxiv url: http://arxiv.org/abs/2607.27626v2
- Date: Mon, 03 Aug 2026 07:19:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.081848
- Title: Real-Time Hard Peak Age-of-Information Safety with No-Regret Learning
- Title(参考訳): No-Regret Learning を用いたリアルタイムハードピーク情報安全性
- Abstract要約: 産業用クローズループ制御、V2X調整、遠隔遠隔操作といった安全クリティカルなIoTシステムでは、すべてのセンサのピークアジ・オブ・インフォメーションは、スロット毎のハードデッドライン未満に留まる必要がある。
既存のアプローチはこの要件を満たすのは限定的な仮定のみである。
OCO-PAoI-Hardは、モデル化されたAoI状態が1段階の生存性の下でゼロスロット当たりの違反を保証し、O(sqrt(T))は静的な安全に対して後悔する。
- 参考スコア(独自算出の注目度): 10.60247182857914
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety-critical IoT systems such as industrial closed-loop control, V2X coordination, and remote teleoperation require every sensor's peak Age of Information (peak AoI, also abbreviated PAoI) to stay below a hard per-slot deadline, not merely an average bound. Existing approaches meet this requirement only under restrictive assumptions: stochastic channels for Whittle-index AoI, simulator rollouts for deep reinforcement learning, or sublinear cumulative violation for long-term constrained online convex optimization. Under adversarial coefficients, OCO-PAoI-Hard guarantees zero per-slot violation of the modeled AoI state under one-step viability and O(sqrt(T)) regret against any static safe comparator; packet-level safety requires stronger service assumptions. Our key observation is that the fractional peak-AoI deadline collapses exactly to an affine half-space constraint on the resource-allocation vector, turning hard real-time scheduling into time-varying constrained online convex optimization over a polyhedral safe set. A strictly causal proposal-shield-update loop enforces feasibility through one Euclidean projection per slot, the gradient step preserves no-regret behavior, and the classical virtual queue is reduced to an a-posteriori certificate. We establish closed-form static and dynamic regret bounds, a matching Omega(sqrt(T)) minimax lower bound, a margin-safe variant against execution noise, and a deadline-induced competitive ratio. On a four-sensor adversarial fluid-model trap channel, OCO-PAoI-Hard attains zero modeled-state deadline violations across all ten seeds, while four representative baselines miss between 1.65 percent and 64.0 percent of slots, and the empirical normalized regret stays below the theoretical envelope across two orders of magnitude in T.
- Abstract(参考訳): 産業用クローズループ制御、V2X調整、遠隔遠隔操作などの安全クリティカルなIoTシステムは、すべてのセンサーのピーク情報時代(AoI、PAoIとも略される)に、単に平均的な境界ではなく、スロット単位のハードな期限以下に留まる必要がある。
既存のアプローチはこの要件を満たすのは、Whittle-index AoIの確率チャネル、深層強化学習のシミュレータロールアウト、長期制約付きオンライン凸最適化のサブ線形累積違反である。
逆係数の下では、OCO-PAoI-Hardは、モデル化されたAoI状態が1ステップの生存性の下でゼロスロット当たりの違反を保証し、O(sqrt(T))は静的な安全なコンパレータに対して後悔する。
我々のキーとなる観察は、分数ピークAoIの期限がちょうどリソース割り当てベクトル上のアフィン半空間の制約に崩壊し、ハードリアルタイムスケジューリングを多面体安全集合上の時間変化制約付きオンライン凸最適化に変換することである。
厳密な因果的提案-シールド更新ループは、1スロット当たりのユークリッドプロジェクションを通じて実現可能であり、勾配ステップは非回帰的な振る舞いを保ち、古典的な仮想キューはa-posteriori証明書に還元される。
我々は, クローズド形式の静的および動的後悔境界, 一致するOmega(sqrt(T)) minimax下限, 実行ノイズに対するマージンセーフな変種, 期限付き競合比を確立する。
四感対向流体モデルトラップチャネルでは、OCO-PAoI-Hardは10種すべてに対してモデル付き状態の期限違反をゼロとし、4つの代表的なベースラインはスロットの1.65パーセントから64.0パーセントを外れ、経験的正規化後悔はTの2桁の理論的エンベロープの下にとどまる。
関連論文リスト
- Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery [3.9929096403817255]
Trajectory-Anchor Optimization (TAO) はマクロスケールでの効率的なフェールセーフフィルタである。
5mの半径内では、幻覚はしばしば固いアライメントを知覚する局所的に一貫した幾何学を持つ。
TAOは、多視点の一貫性が破滅的な地形破壊を確実に分離する、明確な収束盆地(10m)を確立している。
論文 参考訳(メタデータ) (2026-07-06T07:31:37Z) - From Prediction Uncertainty to Conformalized Distance Fields for Safe Motion Planning [9.50741434664352]
既存のコンフォメーションアプローチは、障害物ごとの予測誤差を集計するスカラースコアに適合する。
代わりに、予測距離場全体を同時に整列する。
この関数共形予測フレームワークは、分布自由で、フィールドレベルの低い境界をもたらす。
論文 参考訳(メタデータ) (2026-07-01T11:02:51Z) - CSPO: Constraint-Sensitive Policy Optimization for Safe Reinforcement Learning [9.011823422505378]
本稿では,局所的制約感度をポリシー更新に組み込む一階法である制約感作政策最適化(CSPO:Constraint-Sensitive Policy Optimization)を提案する。
CSPOは、最も短い符号付き距離から安全境界までの制約に敏感な補正により、主目的を増強し、よりスマートな回復ステップを安全に戻すことができる。
ナビゲーションと移動ベンチマークの実験では、CSPOはより高速な安全回復と高い報酬保存を実現し、より高い制約付きリターンをもたらすことが示されている。
論文 参考訳(メタデータ) (2026-06-12T12:48:56Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization [58.03221830946145]
我々は、純粋なCL、純粋なFL、ハイブリッドCL-FLトレーニングモードを融合する統合フレームワークであるOmniISRを提案する。
我々は,OmniISRが集中型パラダイムとフェデレーション型パラダイムの両方において,モデル性能を一貫して改善していることを示す。
論文 参考訳(メタデータ) (2026-05-19T04:13:27Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning [49.25750348525603]
BandPOは、信頼領域を動的で確率対応のクリッピング間隔に投影する統一理論演算子であるBandに取って代わる。
BandPOはカノニカルクリッピングやClip-Higherより一貫して優れ,エントロピー崩壊の軽減が図られている。
論文 参考訳(メタデータ) (2026-03-05T08:03:05Z) - Near-Constant Strong Violation and Last-Iterate Convergence for Online CMDPs via Decaying Safety Margins [31.581870065866568]
制約付きマルコフ決定過程(CMDP)における安全なオンライン強化学習を,強い後悔と違反の指標の下で研究する。
サブリニアの強い報酬を後悔させる既存の原始二重法は、強い制約違反の増大を招いたり、あるいは固有振動による平均点収束に制限されたりしている。
本稿では,マルチ正規化探索(FlexDOME)アルゴリズムによるフレキシブルセーフティドメイン最適化を提案する。
論文 参考訳(メタデータ) (2026-02-11T14:54:26Z) - Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping [61.459927600301654]
マルチコンディション制御は従来のコンカデント・アンド・アットエンドの戦略によってボトルネックとなる。
分析の結果,これらの相互作用の多くは空間的にも意味的にも冗長であることがわかった。
本稿では,これらの冗長性を解消するための高効率なフレームワークであるPKAを提案する。
論文 参考訳(メタデータ) (2026-02-06T16:39:10Z) - E-Globe: Scalable $ε$-Global Verification of Neural Networks via Tight Upper Bounds and Pattern-Aware Branching [9.161865803917847]
形式的検証は堅牢性を保証するが、現在のメソッドはスケーラビリティと完全性というトレードオフに直面している。
我々は,$$$globalの最適値に到達するか,早期停止を起動するまで,上界と下界を効率的に締め付けるハイブリッド検証器を提案する。
論文 参考訳(メタデータ) (2026-02-04T21:42:29Z) - Towards Continual Learning Desiderata via HSIC-Bottleneck
Orthogonalization and Equiangular Embedding [55.107555305760954]
本稿では,レイヤワイドパラメータのオーバーライトや決定境界の歪みに起因する,概念的にシンプルで効果的な手法を提案する。
提案手法は,ゼロの指数バッファと1.02倍の差が絶対的に優れていても,競争精度が向上する。
論文 参考訳(メタデータ) (2024-01-17T09:01:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。