論文の概要: CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift
- arxiv url: http://arxiv.org/abs/2608.07809v1
- Date: Fri, 07 Aug 2026 23:16:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.517416
- Title: CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift
- Title(参考訳): CausalNav:物理パラメータシフト制御のための信頼性認定因果世界モデル
- Abstract要約: CausalNavは、特定状態座標上の署名付きアクション条件遷移グラフを中心に構築されたコントローラである。
CausalNavはデプロイメント時に、介入シーケンスの小さなライブラリをシミュレートし、客観的エラーをポリシ-ログアドバイスに変換する。
我々はCartPole-v1とPendulum-v1の9つの制御基線について評価した。
- 参考スコア(独自算出の注目度): 4.0604823050005345
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A world model is only useful for physical AI if it changes what the agent does, and only safe if it declines to do so when it is wrong. We study both halves of that requirement with CausalNav, a controller built around a signed, action-conditioned transition graph over identified state coordinates. At deployment CausalNav simulates a small library of intervention sequences, converts their objective error into policy-logit advice, and admits that advice only when a scale-free predictive-reliability certificate, a policy-margin gate, and an argmax-agreement gate all pass; otherwise it falls back exactly to its own model-based base controller. We evaluate against nine controlled baselines (transformer, recurrent, split-latent, graph, causal-induction, and three recent model-based reasoning modules) on CartPole-v1 and discretized Pendulum-v1 with physical-parameter shifts, under one shared PPO trainer, one interaction budget, and ten held-out seeds (200 runs). CausalNav attains the best average rank (1.25 of ten). The diagnostic result is more informative than the ranking: the learned graph recovers structure well above chance (CartPole F1 = 0.59 +/- 0.09), yet per-seed structural fidelity is uncorrelated with per-seed control benefit (r = -0.15, p = 0.67), and the certificate abstains on 10/10 Pendulum seeds, where forcing the planner on costs return. Model fidelity did not predict downstream control utility in our setting; certified abstention, not better prediction, is what made the world model safe to deploy.
- Abstract(参考訳): 世界モデルは、エージェントが何をしているかを変える場合にのみ、物理的なAIに役立ちます。
この要件の両面を、特定状態座標上の符号付きアクション条件遷移グラフを中心に構築されたコントローラであるCausalNavを用いて検討する。
CausalNavはデプロイメント時に、介入シーケンスの小さなライブラリをシミュレートし、客観的なエラーをポリシ-ログのアドバイスに変換し、スケールフリーな予測信頼性証明書、ポリシ-マージンゲート、argmax-agreementゲートがすべて通った場合にのみ、そのアドバイスを認める。
我々はCartPole-v1とPendulum-v1の物理パラメータシフトによる9つの制御ベースライン(transformer, recurrent, split-latent, graph, causal-induction, and three recent model-based reasoning modules)を1つの共有PPOトレーナー,1つの相互作用予算,10個の保持種子(200ラン)で評価した。
CausalNavは最高位(10の1.25)に達した。
学習したグラフはチャンスよりはるかに高い構造(CartPole F1 = 0.59 +/- 0.09)を回復するが、種子ごとの構造忠実度は、種子ごとの制御利益(r = -0.15, p = 0.67)とは無関係であり、証明書は10/10ペンデュラムの種子を吸収し、プランナーにコストの返却を強制する。
モデル忠実度は、我々の設定では下流制御ユーティリティを予測せず、より良い予測ではなく、認定された棄権が、世界モデルを安全な配置にしました。
関連論文リスト
- Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling [0.0]
合成親和性ツールは、独立大規模言語モデル(LLM)エージェントとして各個人を動作させる。
このパラダイムには基本的な障害モードがあることを示し、分散優先の修正をそれに対して設定する。
論文 参考訳(メタデータ) (2026-07-17T15:45:57Z) - Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs [4.721990925113432]
修飾言語モデルは、非証拠的な圧力下で定期的に誤レポートされる。
我々は2つの要求を調査し、抵抗(不当な圧力)と更新(認可された証拠をフォロー)する。
低ランクレポートのコーディネートを慎重にローカライズして,回答,信頼,注意を喚起する。
論文 参考訳(メタデータ) (2026-07-14T17:28:25Z) - A Control Theory of Predictability in Latent World Models [39.22646915328561]
現在のプラクティスでは、トレーニングとモデル選択の目的として、ホールトアウトデータに対する単一または複数ステップのロールアウト損失である予測エラーを採用しています。
この仮定は構造上の理由から信頼できないことを示す。
プランナーはトレーニング分布についてモデルに問い合わせるのではなく、その候補となるアクションが到達し、一般にデータ多様体を残します。
論文 参考訳(メタデータ) (2026-07-11T15:42:26Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures [0.0]
Causal Agent Replay (CAR) は、エージェントが構造的因果モデルとして実行されることをモデル化する。
ステップにダブルオペレーションを適用し、同じポリシーの下で軌道を再実行します。
CARはオープンソースで、ホストまたはフリーのローカルモデルで動作する。
論文 参考訳(メタデータ) (2026-06-06T17:44:23Z) - Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents [0.0]
自律的なAIエージェントは、完全に認証されたままで、振る舞いのドリフト、敵の適応、決定パターンのシフトによって、コードの変更なしに、安全が保たれる。
エージェントの管理は、未観測のリスクに対する限界を見積もることを減らす。
textbfRiskGateはこのフレームワークを、専用の統計推定器(KL分散、セグメント-vs-rest $z$-tests、シーケンシャルパターンマッチング)、フェイルセーフなモノトニックパイプライン、クローズドループオートパイロットでインスタンス化する。
論文 参考訳(メタデータ) (2026-04-27T16:46:15Z) - MERGETUNE: Continued fine-tuning of vision-language models [77.8627788911249]
微調整視覚言語モデル(VLM)は、しばしば事前訓練された知識を破滅的に忘れてしまう。
ゼロショットモデルに適応した後に事前学習した知識を回復するための新しいパラダイムである連続微調整(CFT)を導入する。
論文 参考訳(メタデータ) (2026-01-15T15:15:53Z) - Steering Without Side Effects: Improving Post-Deployment Control of Language Models [61.99293520621248]
言語モデル(LM)は、デプロイ後予期せず振る舞うことが示されている。
KL-then-steer (KTS) は, その利点を保ちながら, 操舵の副作用を低減する技術である。
本手法はLlama-2-chat-7Bモデルと比較して44%のジェイルブレイク攻撃を防ぐ。
論文 参考訳(メタデータ) (2024-06-21T01:37:39Z) - Mismatched No More: Joint Model-Policy Optimization for Model-Based RL [172.37829823752364]
本稿では,モデルとポリシーを共同でトレーニングする単一目的について提案する。
我々の目標は、期待されるリターンのグローバルな低い境界であり、この境界は特定の仮定の下で厳密になる。
結果のアルゴリズム(MnM)は概念的にはGANと似ている。
論文 参考訳(メタデータ) (2021-10-06T13:43:27Z) - On the Practicality of Differential Privacy in Federated Learning by
Tuning Iteration Times [51.61278695776151]
フェデレートラーニング(FL)は、分散クライアント間で機械学習モデルを協調的にトレーニングする際のプライバシ保護でよく知られている。
最近の研究では、naive flは勾配リーク攻撃の影響を受けやすいことが指摘されている。
ディファレンシャルプライバシ(dp)は、勾配漏洩攻撃を防御するための有望な対策として現れる。
論文 参考訳(メタデータ) (2021-01-11T19:43:12Z) - Offline Contextual Bandits with Overparameterized Models [52.788628474552276]
オフラインの文脈的盗賊にも同じ現象が起こるかどうかを問う。
この相違は, 目的の強調安定性によるものであることを示す。
大規模なニューラルネットワークを用いた実験では、アクション安定な値ベース目標と不安定なポリシベース目標とのギャップは、大きなパフォーマンス差をもたらす。
論文 参考訳(メタデータ) (2020-06-27T13:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。