論文の概要: Certifying Plans under Model Mismatch: A Trilemma for Reachability from Scarce Data
- arxiv url: http://arxiv.org/abs/2608.02453v1
- Date: Mon, 03 Aug 2026 16:28:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.706237
- Title: Certifying Plans under Model Mismatch: A Trilemma for Reachability from Scarce Data
- Title(参考訳): モデルミスマッチによる計画認定:スカースデータからの到達可能性に関するトリレンマ
- Authors: Yanliang Huang, Zhen Zhang, Ahmad Hafez, Wenyuan Wu, Peng Xie, Zhuoqi Zeng, Amr Alanwar,
- Abstract要約: シモン・トゥ・リアル・ポリシーは、名目力学の下で設計されているが、ターゲット・システム・トライアルは、わずかに孤立した1段階の遷移をもたらす。
本研究では,学習ポリシによって生成されるアクションチャンクなど,固定制御シーケンスの事前実行認証について検討する。
- 参考スコア(独自算出の注目度): 5.455772242709494
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sim-to-real policies are designed under nominal dynamics, but target-system trials may yield only a few isolated one-step transitions. We study pre-execution certification of a fixed control sequence, such as an action chunk produced by a learned policy. If the sequence reaches an unobserved state-input region, the observations remain consistent with target systems whose trajectories separate along it by an arbitrarily large amount. Any deterministic certifier sound for all of them must then decline to certify or return a reachable tube with arbitrarily large projected width. For bounded smooth classes of the target-nominal model error, we derive a finite plan-dependent projected-width lower bound. These results expose a trilemma among uniform trajectory containment, finite projected width, and unrestricted model-error behavior beyond the observations. ForeReach requires a supplied componentwise Lipschitz bound on the model error. Observed transition pairs can refute this declaration but cannot establish it outside the observed locations. Conditional on a valid declaration, our method constructs a set-membership envelope for the model error, propagates a zonotopic reachable tube, and certifies only when propagation remains within the certification domain and every projected tube slice avoids the unsafe set. In two benchmark systems, calibration baselines may remain narrow after losing trajectory containment outside data support, whereas our method declines to certify unsupported sequences and recovers certification when relevant target data and sufficient obstacle clearance are available.
- Abstract(参考訳): シモン・トゥ・リアル・ポリシーは、名目力学の下で設計されているが、ターゲット・システム・トライアルは、わずかに孤立した1段階の遷移をもたらす。
本研究では,学習ポリシによって生成されるアクションチャンクなど,固定制御シーケンスの事前実行認証について検討する。
シーケンスが観測されていない状態入力領域に達すると、観測は軌道が任意に多くの量で分離される対象システムと一致している。
それらのすべてに対する決定論的認証音は、任意に大きく投影された幅を持つ到達可能な管を認証または返却するために下降しなければならない。
対象ノルミナルモデル誤差の有界滑らかなクラスに対しては、有限計画依存の射影幅下界を導出する。
これらの結果は、均一な軌道包有物、有限射影幅、および観測を超えた非制限モデルエラーの挙動のトリレンマを露呈する。
ForeReachは、モデルエラーに縛られたコンポーネントワイドのLipschitzを必要とする。
観測された遷移ペアは、この宣言を反論することができるが、観測された場所の外でそれを確立することはできない。
有効な宣言を条件として,本手法では, モデルエラーに対するセットメンバシップエンベロープを構築し, ゾノトピック到達可能なチューブを伝搬させ, 伝播が認証領域内に留まっている場合にのみ認証し, 射影管スライス毎に安全でないセットを避ける。
2つのベンチマークシステムでは,データサポート外の軌道包摂をなくした後もキャリブレーションベースラインは狭く保たれるが,本手法は,関連するターゲットデータと十分な障害クリアランスが利用可能である場合に,サポート対象シーケンスを認証し,認証を回復する。
関連論文リスト
- What Can Be Enforced? A Theory of Certified Runtime Safety for Tool-Using Agents [0.0]
ガードレールは不可逆のツールコールの前に動作しますが、その保証は、どのポリシー状態が表現可能であるかによって異なります。
ピアソン表現攻撃はマージンを増すので、良性校正だけでは移動しない。
実験は静的診断、制御モデル列挙、表現書き直し、ペア化された閉ループ再実行を通じてこれらの区別を目標とする。
論文 参考訳(メタデータ) (2026-07-24T19:14:26Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - PAC-Bayesian Certificates for Quadratic Closed-Loop Control [0.0]
PAC-ベイズ境界は、データ依存予測器に対する有限サンプル保証を提供する。
学習に基づく制御にそれらを適用することは、自然な目的が二次的な軌道コストであるため困難である。
PAC-Bayes-Chernoff 証明書の集合を,実現可能な閉ループ応答に対する後部分布として提供する。
論文 参考訳(メタデータ) (2026-06-26T17:24:21Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - A Held-Out Transition-Pair Falsifier for Long-Horizon Non-Abelian State Tracking [0.5076419064097734]
有限非アベリア群追跡のためのホールドアウト遷移ペアファルシファイアを導入する。
制御された$S_3 times S_3$ベンチマークでは、長さ8列のみに基づいてトレーニングされた投影されたリカレント状態モデルがエラーのない最終状態予測を生成する。
論文 参考訳(メタデータ) (2026-06-05T13:26:41Z) - How Far Can Unsupervised RLVR Scale LLM Training? [57.44753418846446]
検証可能な報酬を伴う教師なし強化学習(URLVR)は、監督ボトルネックを越えてLLMトレーニングをスケールするための経路を提供する。
最近の研究は、モデル固有の信号を活用し、期待できる早期の利得を示しているが、その可能性と限界は未だ不明である。
我々は、URLVRメソッドを報酬源に基づく固有対外部に分類し、統一された理論的枠組みを確立する。
論文 参考訳(メタデータ) (2026-03-09T17:38:11Z) - Conformal Tradeoffs: Guarantees Beyond Coverage [0.02648566468224904]
配置されたコンフォーマル予測器は、有限操作ウィンドウ上で稼働する長期間の意思決定基盤である。
マージのカバレッジは、デプロイメントに直面する量を特定しません。
私たちは、範囲を超えて運用の認証と計画のためのフレームワークを提供しています。
論文 参考訳(メタデータ) (2026-02-20T07:58:25Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Verification-Guided Falsification for Safe RL via Explainable Abstraction and Risk-Aware Exploration [8.246285288584625]
本稿では、説明可能性、モデルチェック、リスク誘導のファルシフィケーションを統合し、厳密性とカバレッジを両立させるハイブリッドフレームワークを提案する。
我々のアプローチは、包括的抽象ポリシー要約(CAPS)を用いたRLポリシーの人間解釈可能な抽象化の構築から始まる。
違反が検出されない場合、オフラインデータセットの抽象化とカバレッジに制限があるため、満足度を結論付けることはできません。
論文 参考訳(メタデータ) (2025-06-04T00:54:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。